Reddit
Бенчмарк Qwen 35B и 122B: 206 токенов в секунду на связке RTX 4090 и 5060 Ti
Пользователь поделился результатами тестирования локального запуска моделей Qwen 35B и 122B на гибридной конфигурации из RTX 4090 и 5060 Ti с использованием llama.cpp. Модель 122B генерирует 37 токенов в секунду, используя системную память для части слоев, что выше ожидаемых показателей. Приведены детальные настройки квантования и данные по производительности для энтузиастов локального ИИ.
score 40r/LocalLLaMA