Reddit
Несколько недель использую Ling-3.0-flash и GLM-5.2 в роли исполнителя: реальность не совпадает с бенчмарками
Автор тестирует модели GLM-5.2 и Ling-3.0-flash в роли исполнителя для AI-агентов и обнаруживает расхождение с бенчмарками. GLM-5.2 лучше справляется с неопределёнными задачами, тогда как Ling-3.0-flash точнее следует схемам инструментов и не отклоняется от плана. Обсуждается важность чёткого ТЗ и текущая доступность моделей только через API.
score 40r/LocalLLaMA