Reddit
BeeLlama.cpp v0.4.1: KVarN, хвост точности KV-кэша и новые типы квантования
Форк библиотеки llama.cpp v0.4.1 представил продвинутые методы квантования KV-кэша, включая KVarN и технологию хвоста точности. Новые типы квантования (q2_0-q3_1, q6_0/1) позволяют запускать модели с меньшим потреблением видеопамяти. Бенчмарки подтверждают, что конфигурация с хвостом 1024 токенов обеспечивает качество, сопоставимое с q8_0, при значительной экономии VRAM.
score 55r/LocalLLaMA