Reddit
DeepSeek V4 Flash: 105 токенов в секунду на двух Nvidia 4090d 48G (Ada) в vLLM
Автор переписал ядра, доступные только для Blackwell, на Triton для запуска модели DeepSeek V4 Flash на архитектуре Ada, что дало прирост скорости в 2-3 раза. Решение позволяет обрабатывать контекст до 262k токенов и обеспечивает лучшую конкурентность по сравнению с llama.cpp, используя 96 ГБ видеопамяти двух карт.
score 55r/LocalLLaMA