Reddit
Почему тестирование ИИ-моделей всегда сводится к одним и тем же шаблонным промптам?
Автор критикует шаблонность тестов ИИ-моделей, требуя сложных реальных задач вместо простых промптов. Отмечается, что большинство бенчмарков поверхностны, а DeepSWE — одно из редких исключений, приближающихся к реальной работе.
score 40r/LocalLLaMA