Назад к дайджесту
Reddit

[Splash Engine] Qwen3.8-27B в нативном 8-битном формате со скоростью 37–55 ток/с на Apple Silicon: расширение Splash до Q8, масштабирование контекста до 256k и «обрыв рассуждений»

Пользователь расширил движок спекулятивного декодирования Splash для поддержки нативных 8-битных весов на Apple Silicon (M5 Pro, 64 ГБ). Это позволило сохранить скорость 37–55 ток/с без деградации качества, в отличие от агрессивного 4-битного квантования, которое приводит к «обрыву рассуждений» на сложных математических задачах. Форк добавляет схему Q8 и обратную совместимость с официальными Q4-моделями.

score 40r/LocalLLaMA