Назад к дайджесту
Reddit

Сравнение локальных AI-агентов: Ornith 1.5 35B-A3B против Qwen 27B на RTX 5070 Ti

Автор тестирует новую MoE-модель Ornith 1.5 35B-A3B на двух видеокартах RTX 5070 Ti, достигая скорости генерации около 180 токенов в секунду при сохранении качества на уровне Qwen 27B в задачах для агентов. Эффективность достигается за счет архитектуры с активными параметрами всего в 3B и линейного внимания, что минимизирует рост KV-кэша и позволяет работать с контекстом до 128K без потери производительности.

score 40r/LocalLLaMA