Новость
FrontierHarness Eval: стоимость оценки одной модели различается в 17 раз в зависимости от харнесса
Исследование FrontierHarness показывает, что при оценке одной и той же AI-модели через 9 различных тестовых харнессов стоимость одного прохода может отличаться в 17 раз. Это критично для команд, оптимизирующих бюджет на оценку LLM и других моделей.