Reddit
Тестирование DeepSeek-V4-Flash-0731 на Bosgame M5 с RTX PRO 6000 Max-Q eGPU
Автор публикует результаты бенчмарков модели DeepSeek-V4-Flash-0731 с использованием llama.cpp и различных квантований от Q2 до Q8. В материале приведены метрики скорости генерации токенов, показатели принятия черновиков и примеры конфигурации для разделения вычислений между CUDA и ROCm на внешнем GPU.
score 40r/LocalLLaMA