Назад к дайджесту
Reddit

Запуск модели Kimi-k3: тесты производительности и настройки

Автор поделился результатами успешного запуска LLM Kimi-k3 через llama.cpp на системе с двумя RTX 6000 PRO. Зафиксирована скорость генерации 0.23 токена/сек при использовании кастомного PR для конвертации в GGUF. Описаны параметры запуска и планы по подключению к 100GbE кластеру.

score 40r/LocalLLaMA