Назад к дайджесту
Reddit

ARC-AGI 3: нечестный тест на уровень AGI

Автор критикует методологию ARC-AGI 3, утверждая, что принудительный сброс контекста между действиями искусственно занижает результаты моделей. По его мнению, сохранение памяти и компактизация контекста, как у реальных агентов, позволили бы достичь в три раза лучшего результата при меньших затратах токенов. Вывод: текущий бенчмарк не отражает истинный потенциал общего интеллекта.

score 40r/singularity