Назад к дайджесту
Reddit

Локальный запуск модели DeepSeek V4-Flash-0731 на 3xMI50: 15 токенов в секунду

Автор протестировал локальный запуск квантованной модели DeepSeek V4-Flash-0731 на трёх видеокартах AMD MI50. Скорость генерации составила 15–16 токенов в секунду, при этом модель продемонстрировала способность решать задачи по программированию. Приведены логи llama-server и примеры диалога для оценки качества квантования.

score 40r/LocalLLaMA