Reddit
Что делать, когда оценка агента фиксирует сбой: отладка AI-агентов
Автор обсуждает реальные практики отладки AI-агентов после того, как системы оценки (evals) и мониторинга фиксируют ошибку. Рассматриваются методы ручного анализа трейсов, сравнения с эталонными запусками и использования скриптов для сужения круга поиска проблемы, когда агент завершает работу, но выдает неверный результат.
score 40r/AI_Agents