Reddit
Обновление llama.cpp: вероятностный MTP ускоряет генерацию текста на 14%
В репозиторий llama.cpp слит пулл-реквест, внедряющий вероятностный метод MTP (Multi-Token Prediction). Тестирование показывает ускорение декодирования на 14% при генерации прозы, при этом оптимальные параметры настройки совпадают с жадным сэмплированием.
score 40r/LocalLLaMA