Назад к дайджесту
Reddit

Локальная оптимизация Qwen3.8-27B: 13.2 ток/с на RTX 5080 при 50K+ контексте

Пользователь поделился опытом настройки локальной LLM Qwen3.8-27B в квантовании Q4_K_M на RTX 5080 16GB. Путём селективного размещения тензоров FFN на CPU удалось достичь 13.2 ток/с при контексте до 61K токенов — значительно быстрее полного оффлоада слоёв. Опубликованы конфигурация, бенчмарки и методология для воспроизведения результатов.

score 40r/LocalLLaMA