Reddit
[Статья] Статистически безпотерьное квантование больших языковых моделей
Авторы представляют метод SLQ для статистически безпотерьного квантования LLM, разделяя понятия сохранения точности задач и распределения токенов. Подход позволяет достичь сжатия до 3.3 бит на параметр без потери качества в бенчмарках и ускорения инференса в 1.7–3.6 раза. Исследование обосновывает необходимость асимметричного квантования для сохранения распределения вероятностей токенов.
score 55r/LocalLLaMA