Назад к дайджесту
Новость

RUMBA: бенчмарк для оценки долгосрочной памяти диалоговых систем на русском языке

Представлен RUMBA — специализированный бенчмарк для оценки способности русскоязычных диалоговых систем сохранять долгосрочную память пользователя. Инструмент проверяет работу с контекстом, обновление фактов и разрешение противоречий в многосессионных сценариях. Это закрывает пробел в метриках для LLM и агентных архитектур на русском языке.