Reddit
LLM проходят концепт-тесты, но терпят неудачу в реальных проектах: 112 ошибок и 84 проекта
Исследование показывает, что большие языковые модели успешно справляются с доказательством концепции, но демонстрируют низкое качество при интеграции в реальные проекты, где выявляется множество ошибок. Результаты бенчмарков сильно зависят от дизайна оценки, что ставит под сомнение их объективность для оценки реальной инженерной надежности.
score 40r/OpenAI