Назад к дайджесту
Reddit

Насколько хорошо масштабируется несколько GPU для инференса LLM? (Попытка понять основы)

Пользователь спрашивает о практическом масштабировании инференса больших языковых моделей на нескольких GPU. Вопросы касаются линейности производительности, узких мест (PCIe, задержки), различий между плотными и MoE моделями, а также возможности распределения одной модели между разными ПК.

score 40r/LocalLLaMA