Назад к дайджесту
Reddit

BeeLlama.cpp v0.4.0: KVarN, оптимизация точности KV-кэша, новые типы квантования и ребаза на llama.cpp

Вышел релиз v0.4.0 для форка llama.cpp, внедряющий продвинутые методы квантования KV-кэша, такие как KVarN и типы q2_0-q3_1. Разработчик очистил код от устаревших функций (DFlash, TurboQuant) и пересобрал проект на актуальной базе upstream с подтверждением эффективности через бенчмарки на Qwen и Gemma. Обновление направлено на улучшение точности инференса без существенного снижения производительности.

score 55r/LocalLLaMA