Reddit
Сравнение LLM на задачах Международной математической олимпиады 2026 года
Исследователи протестировали различные языковые модели на задачах Международной математической олимпиады 2026 года, оценив их способность решать сложные математические задачи. Фронтальные модели показали идеальный результат, тогда как для других потребовалась разработка специализированного агента AutoFyn для улучшения производительности. Несмотря на улучшения, проблемы с галлюцинациями и пропуском ключевых шагов в сложных доказательствах остаются актуальными.
score 40r/MachineLearning