Назад к дайджесту
Reddit

Урок на будущее: не доверяй репозиториям вслепую и убедись в стабильности для долгосрочного (многонедельного) бенчмарка

Автор пересмотрел результаты своего бенчмарка SWE-verified Django (100 задач) после обнаружения нестабильности в оценочном workflow. Исправление показало, что модель Flash Next по-прежнему лидирует, но теперь явно видно преимущество высокого уровня рассуждений (xhigh) над средним (medium). Аналогичная картина наблюдается для модели 3.8 27B, хотя в повседневных задачах автор предпочитает medium.

score 55r/LocalLLaMA