Reddit
Новый бенчмарк SWE-sweep: поиск и исправление багов в коде до их обнаружения пользователями
Исследователи из Meta, Стэнфорда и других университетов представили новый открытый бенчмарк SWE-sweep, оценивающий способность языковых моделей находить и исправлять реальные ошибки в больших кодовых базах самостоятельно, без предварительного указания на проблему. Тестирование показывает, что даже современные модели пока не достигают сверхчеловеческих результатов на многих задачах, хотя некоторые сложные случаи (например, в numpy) решаются успешно.
score 40r/LocalLLaMA