Reddit
focus-llama: форк llama.cpp с реализацией декларативного внимания
Автор форкнул llama.cpp, чтобы реализовать Declarative Attention: модель сама указывает тегом <focus magic_chunks="N">, какие части контекста ей нужны, а движок ограничивает внимание последующих токенов. Это позволяет сократить время декодирования до 0.71× (Gemma) и 0.77× (Qwen) по данным статьи, хотя автор ещё не проводил собственных бенчмарков. Форк добавляет в llama-server возможность удалять KV-диапазоны во время генерации.
score 70r/LocalLLaMA