Назад к дайджесту
Reddit

Сравнение 35B-агентов: базовые модели против Ornith и KAT-Coder (120 запусков)

Автор провёл масштабное тестирование (120 запусков) 35B-моделей на агентах для кодинга. KAT-Coder-V2.5-Dev показал лучшие результаты по эффективности токенов и стабильности вызовов инструментов, превзойдя базовые Qwen. Ornith проиграла из-за механических ошибок, несмотря на базовые знания.

score 40r/LocalLLaMA