Reddit
Блокировка потоковой передачи KV-кэша: ограничение VRAM при длинном контексте через общую CUDA-арену фаз от giveen · Pull Request #357 · TheTom/llama-cpp-turboquant
Автор PR портирует и расширяет работу Raymond по адаптивной потоковой передаче KV-кэша, добавляя поддержку нескольких моделей (изначально только Qwen) и проводя бенчмарки для подтверждения эффективности. Решение позволяет ограничить использование VRAM при длинном контексте за счёт общей CUDA-арены фаз.
score 55r/LocalLLaMA