Reddit
Урок на будущее: не доверяй репозиториям вслепую и убедись в стабильности для долгосрочного (многонедельного) бенчмарка
Автор пересмотрел результаты своего бенчмарка SWE-verified Django (100 задач) после обнаружения нестабильности в оценочном workflow. Исправление показало, что модель Flash Next по-прежнему лидирует, но теперь явно видно преимущество высокого уровня рассуждений (xhigh) над средним (medium). Аналогичная картина наблюдается для модели 3.8 27B, хотя в повседневных задачах автор предпочитает medium.
score 55r/LocalLLaMA