Назад к дайджесту
Reddit

Реальность производительности Gufo: 70 токенов в секунду на Qwen 27B требует оговорок

Автор тестирует фреймворк Gufo для локального запуска LLM на оборудовании AMD Strix Halo и подтверждает заявленные 70 токенов/с для модели Qwen 27B. Однако высокая скорость достигается за счет спекулятивного декодирования на синтетическом тесте (повторение слова), тогда как на реальных промптах производительность падает до 39-52 токенов/с. Статья разбирает методологию бенчмарков и показывает разницу между агрегированными показателями и реальной пропускной способностью.

score 40r/LocalLLaMA