Назад к дайджесту
Reddit

Улучшение TPS Gemma 4 31B: путь и создание кастомных патчей с форком VLLM

Автор делится опытом оптимизации скорости генерации токенов (TPS) модели Gemma 4 31B. Для этого ему пришлось форкнуть VLLM и написать собственные патчи, а также глубоко разобраться в архитектуре модели. В статье объясняется, как улучшить TPS для любой модели, что будет полезно новичкам в оптимизации инференса.

score 40r/LocalLLaMA