Назад к дайджесту
Reddit

Модель на 35B параметров обогнала 120B в задаче кодинга: почему спецификации не всё решают

Автор создал кастомный бенчмарк для оценки AI-агентов и выяснил, что Qwen3.6-35B справилась с задачами на 95%, тогда как более крупная GPT-OSS-120B показала лишь 53%. Разница объясняется тем, что система оценки (harness) была специально заточена под меньшую модель, что доказывает важность оптимизации среды тестирования под конкретную модель.

score 40r/AI_Agents