Reddit
Qwen3.8-Flash-Next на 12 ГБ VRAM — 65 токенов в секунду
Автор создал собственный движок инференса для модели Qwen3.8-Flash-Next, оптимизированный под 12 ГБ видеопамяти. На квантовании IQ3_XXS он достигает ~65 ток/с на генерации и ~430 ток/с на обработке промпта, а 2-битные квантизации работают ещё быстрее. Движок доступен на GitHub, модель — на Hugging Face.
score 40r/LocalLLaMA