Новость
Запуск больших MoE-моделей на GTX 1080 Ti: сравнение llama-server для архитектур 35B, 120B и 176B
Автор проводит сравнительный тест производительности больших языковых моделей с архитектурой MoE (Qwen) на устаревшем GPU GTX 1080 Ti. В статье анализируется возможность эффективного запуска моделей объемом 35B, 120B и 176B через llama-server, опираясь на эксперименты с гибридными архитектурами и квантованием.