Назад к дайджесту
Reddit

Оптимизация vLLM: NVFP4 KV-кеш на 2xRTX 5060 Ti

Автор публикует конфигурацию запуска vLLM с использованием NVFP4-квантования для KV-кэша на двух видеокартах RTX 5060 Ti. В настройке прописаны специфические параметры для обхода проверок P2P и оптимизации памяти под модели Qwen3.6-27B. Это практический пример внедрения новых форматов квантования в инференс LLM на потребительском оборудовании.

score 40r/LocalLLaMA