Назад к дайджесту
Reddit

OpenAI обнаружила, что около 30% задач в SWE Bench Pro некорректны

OpenAI провела аудит бенчмарка SWE Bench Pro, оценивающего способности ИИ в программировании. Выяснилось, что значительная часть тестовых задач содержит ошибки или не могут быть выполнены. Это ставит под сомнение точность метрик оценки языковых моделей в задачах написания кода.

score 55r/singularity