Назад к дайджесту
Reddit

LLM проходят концепт-тесты, но терпят неудачу в реальных проектах: 112 ошибок и 84 проекта

Исследование показывает, что большие языковые модели успешно справляются с доказательством концепции, но демонстрируют низкое качество при интеграции в реальные проекты, где выявляется множество ошибок. Результаты бенчмарков сильно зависят от дизайна оценки, что ставит под сомнение их объективность для оценки реальной инженерной надежности.

score 40r/OpenAI