Назад к дайджесту
Reddit

Первые результаты Kimi K3 в домашней лаборатории: ~4 токена/сек

Пользователь поделился результатами запуска модели Kimi K3 на домашнем сервере с двумя видеокартами RTX 5090 и 768 ГБ оперативной памяти. С использованием кастомной сборки llama.cpp и квантования Q2_K достигнута скорость декодирования около 4 токенов в секунду, при этом производительность растёт со временем. Материал демонстрирует возможности локального инференса новых LLM на потребительском оборудовании.

score 40r/LocalLLaMA