Назад к дайджесту
Reddit

DeepSeek-V4-Flash-Vision-Exp (285B MoE) на 10-12x RTX 3090 — спекулятивное декодирование, зрение

Пользователь запустил полную модель DeepSeek-V4-Flash-Vision-Exp (285B MoE) на потребительских GPU Ampere (10-12x RTX 3090) с использованием SM86-совместимой сборки vLLM. Достигнута скорость декодирования 60+ ток/с на 10 GPU и 120+ ток/с на 12 GPU, поддержка зрения, спекулятивного декодирования и инструментов, а также контекст до 1M (без оффлоада) и 4M (с оффлоадом в RAM). Предоставлены готовый Docker-образ и репозиторий с документацией и патчами.

score 40r/LocalLLaMA