Назад к дайджесту
Новость

Бенчмарки Мебиуса: IBM учит ИИ проверять собственные тесты

Исследователи IBM предложили использовать языковые модели для валидации качества бенчмарков — независимый аудит выявил 18,5% ошибок в автоматической оценке ИИ-агентов. Работа поднимает проблему «бенчмарков для бенчмарков» и запускает цикл мета-оценки в AI-индустрии.