Reddit
Полная модель Kimi K3 работает на кластере из 16 GPU GB10 со скоростью 20+ токенов/сек
Пользователь запустил полную версию языковой модели Kimi K3 на кластере из 16 GPU NVIDIA GB10, достигнув производительности 20-38 токенов в секунду и 750 tps на prefill. Планируется публикация vLLM-образа и инструкций для развёртывания.
score 40r/LocalLLaMA