Reddit
Распространённая проблема вводящих в заблуждение бенчмарк-отчётов (на примере Astra)
Автор критикует OpenAI за публикацию результатов Astra на ARC-AGI-3, которые выглядят впечатляюще (98,6%), но получены с использованием дополнительных функций агентного харнеса (сохранение цепочки рассуждений и кастомная компактизация), недоступных конкурентам. На стандартном харнесе Astra показывает 62,7%, что всё равно выше, но менее сенсационно. Автор призывает не воспринимать бенчмарки как истину в последней инстанции.
score 55r/singularity