Reddit
Все твердят о тестах для ИИ-агентов. Но что на самом деле оценивать?
Практическое руководство по написанию оценок (evals) для ИИ-агентов: как определить, какие сбои превращать в тест-кейсы, что оставлять для юнит-тестов, и когда использовать LLM-судей вместо детерминированных проверок. Автор рекомендует начинать с 5-10 качественных кейсов на основе реальных ошибок, а не создавать масштабные бенчмарки заранее.
score 40r/AI_Agents