Назад к дайджесту
Reddit

Нам срочно нужен бенчмарк для исследований, широкого поиска в вебе и извлечения фактов

Автор поста отмечает, что существующие бенчмарки для оценки языковых моделей либо исчерпаны, либо тестируются в искусственно ограниченных условиях без доступа к реальным инструментам и интернету. При этом многие пользователи активно применяют чатботы для глубоких исследований и сбора информации, для чего требуются открытые тестовые среды с неограниченным доступом к поиску и внешним системам.

score 55r/OpenAI