Reddit
Используете ли вы статистические методы на больших выборках для оценки?
Разработчик делится опытом использования бутстрэппинга и увеличения выборки тестов для оценки агентов, аналогично практике в чат-ботах. Обсуждаются стандарты оценки и наблюдаемости (observability) для нестационарных AI-систем и последовательностей действий.
score 40r/AI_Agents