Reddit
Проклятие 64 ГБ оперативной памяти при запуске локальных LLM
Автор делится опытом использования связки AMD R9700 и NVIDIA RTX 5060 Ti для запуска больших языковых моделей через Strata и llama.cpp. Несмотря на значительный прирост скорости инференса, модель Qwen3.8-Flash-Next в квантовании IQ3_XXS потребляет около 70 ГБ памяти, что приводит к заполнению 64 ГБ системной RAM и делает невозможным одновременную работу с другими ресурсоемкими задачами, такими как генерация изображений в ComfyUI.
score 40r/LocalLLaMA