Назад к дайджесту
Reddit

Почему почти все новые бенчмарки и лидерборды ориентированы на программирование?

Автор критикует доминирование кодинговых тестов для LLM и призывает к развитию метрик для других задач. В посте отмечается нехватка бенчмарков для языкового обучения, медицины и креативного письма, что мешает оценить реальный прогресс моделей в этих направлениях.

score 40r/LocalLLaMA