Reddit
Улучшение TPS Gemma 4 31B: путь и создание кастомных патчей с форком VLLM
Автор делится опытом оптимизации скорости генерации токенов (TPS) модели Gemma 4 31B. Для этого ему пришлось форкнуть VLLM и написать собственные патчи, а также глубоко разобраться в архитектуре модели. В статье объясняется, как улучшить TPS для любой модели, что будет полезно новичкам в оптимизации инференса.
score 40r/LocalLLaMA