Reddit
Сборка на AMD Strix Halo и CMP 170HX для локального запуска LLM
Автор делится опытом настройки гибридной системы для инференса больших языковых моделей, объединяющей iGPU Strix Halo и видеокарту AMD CMP 170HX в eGPU-конфигурации. В качестве базовой модели используется Qwen 3.8 Flash на Strix Halo, а для параллельной обработки запросов через подзадачные агенты применяются две инстанции Qwen 3.8 27B на карте CMP, что позволило полностью отказаться от облачных вычислений.
score 40r/LocalLLaMA