Назад к дайджесту
Reddit

Qwen3.8-Flash-Next на MLX-serve: поддержка контекста в 1 млн токенов

Соредактор движка Qwen3.8-Flash-Next для MLX-serve сообщает о поддержке контекста до 1 млн токенов. Модель работает с 8-битным KV-кэшем на M5 Max 128GB, достигая скорости около 40 ток/с на прозе и 75 ток/с на коде при полном контексте. Используется смешанное квантование: 8 бит для плотных слоёв и 4 бита для экспертных, что сохраняет высокое качество. Для работы с полным контекстом требуется ~117 ГБ памяти.

score 55r/LocalLLaMA