Назад к дайджесту
Reddit

Используете ли вы статистические методы на больших выборках для оценки?

Разработчик делится опытом использования бутстрэппинга и увеличения выборки тестов для оценки агентов, аналогично практике в чат-ботах. Обсуждаются стандарты оценки и наблюдаемости (observability) для нестационарных AI-систем и последовательностей действий.

score 40r/AI_Agents