GitHub
Multi-TurboQuant: унифицированное сжатие KV-кэша для LLM
Репозиторий предлагает унифицированный подход к сжатию KV-кэша для инференса языковых моделей, объединяя методы TurboQuant, IsoQuant и другие. Инструмент позволяет сжимать кэш в 5-80 раз, что даёт возможность запускать более крупные модели и работать с длинным контекстом на доступных GPU.
245 forksPythonscore 73
inferenceturboquantattentioncudacompressionnvidiavllmllmmulti-gpumachine-learning