Назад к дайджесту
Reddit

Будет ли экстремально высокая скорость декодирования токенов действительно полезна?

В обсуждении рассматривается целесообразность достижения скоростей декодирования в 1–10 тысяч токенов в секунду для больших языковых моделей. Участники анализируют, откроет ли это новые сценарии использования или эффективнее будет масштабировать размер моделей. В качестве примеров приводятся актуальные архитектуры вроде Qwen 3.5, GLM-5.2 и Kimi K3.

score 40r/LocalLLaMA