Назад к дайджесту
Новость

Создание бенчмарка OenoBench: как LLM генерировали вопросы о вине и где ошибались

Автор описывает процесс создания бенчмарка OenoBench для оценки знаний языковых моделей в узкой предметной области — виноделии. Проект включал генерацию 3 266 вопросов и проверку фактов с помощью множества AI-агентов, включая Claude Code и других LLM, при минимальном участии человека. Исследование выявило системные ошибки в генерации данных и несогласованность между различными моделями-судьями.