Назад к дайджесту
Reddit

Распространённая проблема вводящих в заблуждение бенчмарк-отчётов (на примере Astra)

Автор критикует OpenAI за публикацию результатов Astra на ARC-AGI-3, которые выглядят впечатляюще (98,6%), но получены с использованием дополнительных функций агентного харнеса (сохранение цепочки рассуждений и кастомная компактизация), недоступных конкурентам. На стандартном харнесе Astra показывает 62,7%, что всё равно выше, но менее сенсационно. Автор призывает не воспринимать бенчмарки как истину в последней инстанции.

score 55r/singularity