Назад к дайджесту
Reddit

Qwen3.8-Flash-Next на 12 ГБ VRAM — 65 токенов в секунду

Автор создал собственный движок инференса для модели Qwen3.8-Flash-Next, оптимизированный под 12 ГБ видеопамяти. На квантовании IQ3_XXS он достигает ~65 ток/с на генерации и ~430 ток/с на обработке промпта, а 2-битные квантизации работают ещё быстрее. Движок доступен на GitHub, модель — на Hugging Face.

score 40r/LocalLLaMA