Новость
Reasoning-модели требуют новой оценки: запускаем публичный рейтинг MERA Reason
В мире больших языковых моделей фокус сместился с проверки знаний на способность к сложному рассуждению, но метрики оценки остаются размытыми. Для стандартизации сравнения моделей представлен публичный лидерборд MERA Reason, оценивающий именно reasoning-способности. Это значимый инструмент для исследователей и разработчиков в области генеративного ИИ.