Назад к дайджесту
Reddit

Запуск DeepSeek-V4-Flash с контекстом 1M на одиночной RTX 5090: vLLM с оффлоадингом на CPU/RAM, ~800 токенов/сек

Энтузиаст продемонстрировал запуск DeepSeek-V4-Flash-0731 с полным контекстом в 1 миллион токенов на настольной системе с RTX 5090 и 256 ГБ DDR5, используя vLLM с оффлоадингом на процессор. Достигнута производительность около 800 токенов/сек на префилле и 15+ токенов/сек при декодировании, с подробным описанием необходимых патчей и конфигурации для стабильной работы.

score 40r/LocalLLaMA