Reddit
Тест на пределе: бенчмарк "Bad Apple" для оценки моделей
Автор сравнивает работу моделей GPT-6 Astra и Opus 5.5 при генерации видео по мотивам "Bad Apple". Эксперимент показал, что Opus 5.5 лучше справляется с методологией, но страдает от галлюцинаций, тогда как GPT-6 Astra эффективнее работает в режиме дообучения на основе предыдущей работы другой модели.
score 40r/singularity