Reddit
Выпуск GSQ-RCO квантованных GGUF для Qwen3.8-Flash-Next и экспертно-усеченная модель для кодинга
Опубликованы квантованные версии модели Qwen3.8-Flash-Next с использованием методов GSQ и RCO, достигающие производительности, близкой к оригиналу BF16, при размере всего 66-84 ГБ. Также представлена специализированная версия для кодинга, в которой половина экспертов удалена через оптимизацию RCO, что позволяет снизить среднюю битность до 1.89 на параметр.
score 55r/LocalLLaMA