Назад к дайджесту
Reddit

SWE-Race: бенчмарк для кодовых агентов на 188 реальных ошибках конкурентности с тестами трех моделей

Представлен новый бенчмарк SWE-Race, оценивающий способность AI-агентов исправлять реальные ошибки конкурентности (гонки данных, взаимные блокировки) в Python-проектах. Тестирование трех моделей показало, что GLM-5.3 Flash достигла 85% успеха при одной попытке, а результаты GPT-5.6 Luna составили 81%, при этом ключевые различия между моделями проявляются на сложных задачах.

score 40r/MachineLearning