Назад к дайджесту
Reddit

Обновление llama.cpp: вероятностный MTP ускоряет генерацию текста на 14%

В репозиторий llama.cpp слит пулл-реквест, внедряющий вероятностный метод MTP (Multi-Token Prediction). Тестирование показывает ускорение декодирования на 14% при генерации прозы, при этом оптимальные параметры настройки совпадают с жадным сэмплированием.

score 40r/LocalLLaMA