Назад к дайджесту
Reddit

Обновление Halogen 0.17.2: стабильная скорость декодирования Qwen Flash Next на GPU Strix Halo

В версии 0.17.2 фреймворка Halogen достигнута стабильная скорость декодирования около 45 токенов в секунду для модели Qwen 3.8 Flash Next (177 млрд параметров) на аппаратной платформе AMD Strix Halo с 128 ГБ памяти. Пользователи отмечают высокое качество генерации кода и текста моделью, сравнивая её производительность с более крупными аналогами.

score 40r/LocalLLaMA