Reddit
Инженерия инференса для начинающих: разбор типичных ошибок
Автор делится опытом оптимизации запуска LLM, указывая на критическую важность выбора правильного рантайма. Рекомендуются VLLM для GPU-инференса и llama.cpp для случаев с CPU offload, тогда как Ollama подходит только для быстрого старта. Также подчеркивается необходимость компиляции с аппаратно-специфичными флагами для максимальной производительности.
score 40r/LocalLLaMA