Reddit
Напоминание: рекорды бенчмарков не определяют качество модели для повседневного использования
Автор утверждает, что высокие результаты в тестовых бенчмарках не гарантируют лучшей производительности модели в реальных задачах. Модели могут быть переобучены на тесты, подобно подготовке к экзаменам, что не отражает их истинную полезность. Приводится пример, где модель с лучшими показателями оказалась хуже в повседневном использовании.
score 40r/ChatGPT