Reddit
GPT-5.5 показала 10,6% на тесте ActiveVision, люди — 96,1%
Новое исследование с arXiv представляет бенчмарк ActiveVision, оценивающий способность моделей к повторному визуальному восприятию, а не статичному описанию. GPT-5.5 и Claude Fable 5 показали крайне низкие результаты (10,6% и 3,5%), не справившись даже с генерацией кода для исправления ошибок. Для сравнения, люди набрали в среднем 96,1%, что подчеркивает значительный разрыв в задачах динамического зрения.
score 40r/MachineLearning