Назад к дайджесту
Reddit

Как оценивать ошибки, проявляющиеся только на нескольких шагах диалога?

Автор описывает проблему тестирования многошаговых LLM-сессий: при высокой точности на каждом отдельном шаге (97.6%) система допускает повторное предложение ранее отклоненного варианта из-за потери контекста. Поднимается вопрос о различении реального изменения предпочтений пользователя и технического сбоя памяти модели при оценке траектории диалога.

score 40r/AI_Agents