Reddit
OpenAI обнаружила, что около 30% задач в SWE Bench Pro некорректны
OpenAI провела аудит бенчмарка SWE Bench Pro, оценивающего способности ИИ в программировании. Выяснилось, что значительная часть тестовых задач содержит ошибки или не могут быть выполнены. Это ставит под сомнение точность метрик оценки языковых моделей в задачах написания кода.
score 55r/singularity