Reddit
Необходимость нового бенчмарка для оценки поиска в интернете и фактологической проверки ИИ
Автор поста указывает на отсутствие актуальных и открытых бенчмарков для оценки способности языковых моделей к глубокому исследованию и поиску фактов в реальном времени. Существующие тесты либо устарели, либо ограничивают доступ к инструментам и интернету, тогда как пользователи активно применяют чат-боты для широкого сбора информации.
score 55r/singularity