Назад к дайджесту
Reddit

Квантование Kimi K3 (2.8 трлн параметров) в GGUF своими силами: Q3_K_S работает, 1.1 ТБ на диске

Команда Atomic Chat реализовала динамическое квантование модели Kimi K3 (2.8 трлн параметров) в формат GGUF через форк llama.cpp. Тесты на CPU-инференсе подтвердили работоспособность квантования Q3_K_S и сохранение качества понимания изображений и текста. Обсуждается целесообразность запуска гигантских моделей на процессорах вместо уменьшения размера.

score 40r/LocalLLaMA