Назад к дайджесту
Reddit

BeeLlama.cpp v0.4.1: KVarN, хвост точности KV-кэша и новые типы квантования

Форк библиотеки llama.cpp v0.4.1 представил продвинутые методы квантования KV-кэша, включая KVarN и технологию хвоста точности. Новые типы квантования (q2_0-q3_1, q6_0/1) позволяют запускать модели с меньшим потреблением видеопамяти. Бенчмарки подтверждают, что конфигурация с хвостом 1024 токенов обеспечивает качество, сопоставимое с q8_0, при значительной экономии VRAM.

score 55r/LocalLLaMA