Reddit
Модель на 35B параметров обогнала 120B в задаче кодинга: почему спецификации не всё решают
Автор создал кастомный бенчмарк для оценки AI-агентов и выяснил, что Qwen3.6-35B справилась с задачами на 95%, тогда как более крупная GPT-OSS-120B показала лишь 53%. Разница объясняется тем, что система оценки (harness) была специально заточена под меньшую модель, что доказывает важность оптимизации среды тестирования под конкретную модель.
score 40r/AI_Agents