Новость
LLM-судьям нельзя доверять: как построить надёжный гейт и проверить тесты
Статья посвящена проблемам доверия к LLM-судьям при автоматизированной оценке моделей и предлагает двухконтурную систему проверки. Описываются методы использования CI-инвариантов и враждебных тестов для обнаружения галлюцинаций. Автор делится опытом реальных багов проектирования, способных исказить результаты оценки.