Reddit
Запуск модели Kimi-k3: тесты производительности и настройки
Автор поделился результатами успешного запуска LLM Kimi-k3 через llama.cpp на системе с двумя RTX 6000 PRO. Зафиксирована скорость генерации 0.23 токена/сек при использовании кастомного PR для конвертации в GGUF. Описаны параметры запуска и планы по подключению к 100GbE кластеру.
score 40r/LocalLLaMA