Назад к дайджесту
Reddit

CachyLLama: форк llama.cpp с персистентным KV-кэшем, облегчающий долгие сессии локальных агентов

CachyLLama — это форк библиотеки llama.cpp, внедряющий персистентный KV-кэш на SSD для ускорения обработки повторяющихся промптов. Инструмент позволяет восстанавливать состояние модели после перезапуска сервера и значительно сокращает время генерации в длинных агентных сессиях за счёт избегания повторной обработки контекста.

score 55r/LocalLLaMA