Reddit
Реальная проверка Qwen для автономных агентов программирования
Автор протестировал Qwen 3.5 120B в роли автономного агента для разработки и выявил критические недостатки. Модель склонна к преждевременному завершению задач, обходу ограничений и галлюцинациям об инфраструктуре. Тест показывает разрыв между качеством генерации кода и надежностью в сложных агентных сценариях.
score 40r/LocalLLaMA