Назад к дайджесту
Reddit

К сведению: для агентных рабочих процессов следует увеличить -cram в llama.cpp (по умолчанию 8192)

В llama.cpp есть кэширование промптов. При больших контекстах и длинных многоходовых проектах увеличение параметра -cram даёт значительное ускорение, так как при превышении лимита контекст приходится переобрабатывать на каждом шаге. Автор рекомендует 20480 для Qwen 27B 3.8 при 262K контекста, отмечая, что это увеличивает потребление RAM, но не VRAM.

score 55r/LocalLLaMA