Назад к дайджесту
Reddit

Полная модель Kimi K3 работает на кластере из 16 GPU GB10 со скоростью 20+ токенов/сек

Пользователь запустил полную версию языковой модели Kimi K3 на кластере из 16 GPU NVIDIA GB10, достигнув производительности 20-38 токенов в секунду и 750 tps на prefill. Планируется публикация vLLM-образа и инструкций для развёртывания.

score 40r/LocalLLaMA