Назад к дайджесту
Reddit

Запуск Qwen3.8 Flash Next 176B на ноутбуке с 16 ГБ VRAM: оптимизация памяти через TensorSharp

Автор демонстрирует возможность запуска огромной MoE-модели Qwen3.8 Flash Next 176B на потребительском ноутбуке с RTX 3080 (16 ГБ VRAM) и 32 ГБ ОЗУ с использованием движка TensorSharp. Ключевым аспектом является не просто загрузка модели, а эффективное распределение данных между VRAM, системной памятью и SSD с учетом архитектуры MoE, что позволяет избежать использования дорогостоящего оборудования. Бенчмарки показывают, что TensorSharp значительно превосходит Strata по времени полного процесса генерации (16.54 с против 62.15 с), хотя скорость декодирования токенов сопоставима.

score 40r/LocalLLaMA