Новость
SGLang без магии: как устроены основные настройки инференса LLM
Статья разбирает ключевые параметры фреймворка SGLang для оптимизации инференса больших языковых моделей. Рассматриваются группы настроек: параллелизм (TP, DP, CP, PP, EP), управление KV-кэшем (Radix Cache, HiCache), вычисления в MoE, attention-бекенд и спекулятивное декодирование.