Reddit
Невозможно протестировать своего агента: я пытался и провалился
Автор потратил год на создание персонального ИИ-агента, но не смог оценить его качество из-за отсутствия инструментов бенчмаркинга. Он обнаружил, что агент успешно проходит тесты, но проваливается на новых задачах, так как адаптируется к известным проверкам. Это поднимает проблему необходимости динамических методов оценки для реальных ИИ-систем.
score 40r/AI_Agents