Reddit
ARC-AGI 3: нечестный тест на уровень AGI
Автор критикует методологию ARC-AGI 3, утверждая, что принудительный сброс контекста между действиями искусственно занижает результаты моделей. По его мнению, сохранение памяти и компактизация контекста, как у реальных агентов, позволили бы достичь в три раза лучшего результата при меньших затратах токенов. Вывод: текущий бенчмарк не отражает истинный потенциал общего интеллекта.
score 40r/singularity