Reddit
Большая длина принятия, медленнее проза: тест MTP n=1/2/3 Ling на одном Spark
В бенчмарках Ling-3.0-flash от sudoingX сравнивается производительность с многотокеновым предсказанием (MTP) и без него на одном DGX Spark. Показано, что увеличение числа спекулятивных токенов (n) повышает среднюю длину принятия, но снижает скорость генерации прозы, тогда как код остаётся примерно стабильным. Отдельно исправлены замеры, разделяющие эффекты CUDA graphs и MTP.
score 40r/LocalLLaMA