Reddit
Датасеты и тесты для оценки чат-моделей
Пользователь Reddit ищет актуальные бенчмарки для оценки многооборотных диалогов и памяти моделей. Обсуждаются существующие наборы данных (LongBench, NIAH, RULER) и поиск SOTA решений для выявления слабых мест LLM.
score 40r/OpenAI