Reddit
Бенчмарки врут: почему оценки моделей не предсказывают успех внедрения
Автор отмечает, что текущие бенчмарки ИИ-моделей либо показывают ничтожные различия между лидерами, либо настолько сложны, что топ-модели набирают лишь треть от уровня экспертов-людей. Проблема в том, что ни один бенчмарк не оценивает «суждение» модели — способность понять, стоит ли задача усилий, или выбрать правильный вариант в бизнес-контексте. Именно провалы в суждении, а не в точности задач, становятся причиной неудачных внедрений в enterprise.
score 40r/AI_Agents