Назад к дайджесту
Reddit

Оптимизация Qwen3.8 27B для 12 ГБ видеопамяти: контекст до 200K и ускорение через MTP

Автор представляет улучшенную квантованную версию модели Qwen3.8 (27B параметров) с поддержкой длинного контекста до 200-340K токенов на видеокартах NVIDIA Ampere с 12 ГБ памяти. Решение использует технологию Multi-Token Prediction (MTP) для повышения скорости генерации и новые методы сжатия KV-кэша (KVaRN), что позволяет достичь производительности, близкой к полноразрядной модели, при значительном снижении требований к ресурсам.

score 40r/LocalLLaMA