Назад к дайджесту
Reddit

[Статья] Статистически безпотерьное квантование больших языковых моделей

Авторы представляют метод SLQ для статистически безпотерьного квантования LLM, разделяя понятия сохранения точности задач и распределения токенов. Подход позволяет достичь сжатия до 3.3 бит на параметр без потери качества в бенчмарках и ускорения инференса в 1.7–3.6 раза. Исследование обосновывает необходимость асимметричного квантования для сохранения распределения вероятностей токенов.

score 55r/LocalLLaMA