Reddit
Какие бенчмарки для ИИ всё ещё далеки от насыщения?
Автор обсуждает актуальные тесты для оценки передовых языковых моделей, где текущие результаты остаются крайне низкими (менее 30%). В качестве примеров приводятся активно поддерживаемые RLI и ProgramBench, а также устаревшие наборы данных, такие как FormulaOne и Esolang-bench.
score 40r/artificial