Назад к дайджесту
Reddit

Какие бенчмарки для ИИ всё ещё далеки от насыщения?

Автор обсуждает актуальные тесты для оценки передовых языковых моделей, где текущие результаты остаются крайне низкими (менее 30%). В качестве примеров приводятся активно поддерживаемые RLI и ProgramBench, а также устаревшие наборы данных, такие как FormulaOne и Esolang-bench.

score 40r/artificial