Назад к дайджесту
Reddit

Загружается ли MTP-голова в VRAM по умолчанию?

Пользователь столкнулся с ростом потребления системной памяти при запуске llama.cpp с режимом MTP (Multi-Token Prediction), несмотря на свободное место в VRAM. Вопрос касается того, загружается ли MTP-голова отдельно от основной модели и требует ли она явного указания устройства.

score 40r/LocalLLaMA