Reddit
Загружается ли MTP-голова в VRAM по умолчанию?
Пользователь столкнулся с ростом потребления системной памяти при запуске llama.cpp с режимом MTP (Multi-Token Prediction), несмотря на свободное место в VRAM. Вопрос касается того, загружается ли MTP-голова отдельно от основной модели и требует ли она явного указания устройства.
score 40r/LocalLLaMA