Назад к дайджесту
Reddit

Датасеты и тесты для оценки чат-моделей

Пользователь Reddit ищет актуальные бенчмарки для оценки многооборотных диалогов и памяти моделей. Обсуждаются существующие наборы данных (LongBench, NIAH, RULER) и поиск SOTA решений для выявления слабых мест LLM.

score 40r/OpenAI