Reddit
Релиз WinterMix: нативное квантование Qwen3.5-122B в MLX (82 ГБ) превосходит 6-битные аналоги и подходит для агентных систем
Автор разработал новый метод квантования WinterMix для Qwen3.5-122B-A10B в нативном формате MLX, который превосходит существующие 6-битные сборки по качеству при меньшем размере. Новый 82 ГБ квант близок к исходному GGUF, но работает значительно быстрее на Apple Silicon без необходимости в кастомных ядрах. Это решение позволяет эффективно запускать большие модели локально, включая сценарии с агентными роями и длинным контекстом.
score 55r/LocalLLaMA