Reddit
SWE-Race: бенчмарк для кодовых агентов на 188 реальных ошибках конкурентности с тестами трех моделей
Представлен новый бенчмарк SWE-Race, оценивающий способность AI-агентов исправлять реальные ошибки конкурентности (гонки данных, взаимные блокировки) в Python-проектах. Тестирование трех моделей показало, что GLM-5.3 Flash достигла 85% успеха при одной попытке, а результаты GPT-5.6 Luna составили 81%, при этом ключевые различия между моделями проявляются на сложных задачах.
score 40r/MachineLearning