Reddit
Почему почти все новые бенчмарки и лидерборды ориентированы на программирование?
Автор критикует доминирование кодинговых тестов для LLM и призывает к развитию метрик для других задач. В посте отмечается нехватка бенчмарков для языкового обучения, медицины и креативного письма, что мешает оценить реальный прогресс моделей в этих направлениях.
score 40r/LocalLLaMA