Назад к дайджесту
Reddit

DKV: Открытый фреймворк для сжатия KV-кэша при локальном инференсе LLM (CLI + тех. отчёт)

Разработчик представил DKV (DifferentialKV) — открытый инструмент для сжатия KV-кэша, снижающий требования к памяти при работе с длинными контекстами в локальных LLM. Решение использует anchor-based представления и низкоранговое сжатие, предлагая CLI и бэкенды для MLX и CUDA. Автор приглашает сообщество к тестированию и обсуждению интеграции с существующими фреймворками вроде llama.cpp и vLLM.

score 55r/LocalLLaMA