Reddit
Лучший публичный результат Tinker от Thinking Machines оказался на базе Qwen3-235B, а не Inkling. Насколько важен выбор базовой модели?
Статья сравнивает производительность модели Inkling с другими фронтир-моделями (Qwen3-235B, GLM 5.2, DeepSeek V4 Pro, Kimi) на бенчмарках AIME 2026, HLE, SWEBench Pro и IFBench. Выявлено, что кейс Bridgewater/Tinker использовал Qwen3-235B как базовую модель, а не Inkling, при этом Inkling лидирует в IFBench (79.8%). Автор задаётся вопросом, стоит ли использовать Inkling для дообучения или лучше выбрать модели с более документированным поведением.
score 40r/LocalLLaMA