Назад к дайджесту
Reddit

focus-llama: форк llama.cpp с реализацией декларативного внимания

Автор форкнул llama.cpp, чтобы реализовать Declarative Attention: модель сама указывает тегом <focus magic_chunks="N">, какие части контекста ей нужны, а движок ограничивает внимание последующих токенов. Это позволяет сократить время декодирования до 0.71× (Gemma) и 0.77× (Qwen) по данным статьи, хотя автор ещё не проводил собственных бенчмарков. Форк добавляет в llama-server возможность удалять KV-диапазоны во время генерации.

score 70r/LocalLLaMA