Reddit
DeepSeek-V4-Flash на четырёх RTX 4090 с vLLM и контекстом 256k
Энтузиаст запустил языковую модель DeepSeek-V4-Flash на конфигурации из четырёх GPU RTX 4090 (48 ГБ каждая) с использованием vLLM и DSpark. Изначально достигнув контекста 64k, автор довёл систему до поддержки 256k токенов — демонстрация возможностей локального развёртывания больших моделей на потребительском железе.
score 40r/LocalLLaMA