Назад к дайджесту
Reddit

Бенчмарки врут: почему оценки моделей не предсказывают успех внедрения

Автор отмечает, что текущие бенчмарки ИИ-моделей либо показывают ничтожные различия между лидерами, либо настолько сложны, что топ-модели набирают лишь треть от уровня экспертов-людей. Проблема в том, что ни один бенчмарк не оценивает «суждение» модели — способность понять, стоит ли задача усилий, или выбрать правильный вариант в бизнес-контексте. Именно провалы в суждении, а не в точности задач, становятся причиной неудачных внедрений в enterprise.

score 40r/AI_Agents