Reddit
Запуск Qwen3.8-Flash на 12 ГБ VRAM: 20-30 токенов/сек декодирования и до 90k токенов/сек префилла
Пользователь успешно запустил квантованную модель Qwen3.8-Flash (IQ3_S) на оборудовании с 12 ГБ видеопамяти и 32 ГБ оперативной памяти, используя модифицированную версию фреймворка Strata. Достигнуты показатели 20-30 токенов в секунду на этапе декодирования и до 90 000 токенов в секунду на этапе префилла при контексте 131k.
score 40r/LocalLLaMA