Reddit
Какие модели вы запускаете на 32 ГБ VRAM (16+16) и 128 ГБ RAM?
Пользователь собрал систему с двумя RTX 5080 (по 16 ГБ VRAM) и 128 ГБ DDR5 RAM, спрашивает сообщество о подходящих LLM-моделях и точных настройках llama.cpp для оптимальной производительности. Обсуждаются варианты распределения моделей между GPU и оптимизации для двухканальной памяти.
score 40r/LocalLLaMA