Reddit
Оптимизация vLLM: NVFP4 KV-кеш на 2xRTX 5060 Ti
Автор публикует конфигурацию запуска vLLM с использованием NVFP4-квантования для KV-кэша на двух видеокартах RTX 5060 Ti. В настройке прописаны специфические параметры для обхода проверок P2P и оптимизации памяти под модели Qwen3.6-27B. Это практический пример внедрения новых форматов квантования в инференс LLM на потребительском оборудовании.
score 40r/LocalLLaMA