Reddit
Оптимизация Qwen3.8 27B для 12 ГБ видеопамяти: контекст до 200K и ускорение через MTP
Автор представляет улучшенную квантованную версию модели Qwen3.8 (27B параметров) с поддержкой длинного контекста до 200-340K токенов на видеокартах NVIDIA Ampere с 12 ГБ памяти. Решение использует технологию Multi-Token Prediction (MTP) для повышения скорости генерации и новые методы сжатия KV-кэша (KVaRN), что позволяет достичь производительности, близкой к полноразрядной модели, при значительном снижении требований к ресурсам.
score 40r/LocalLLaMA