Назад к дайджесту
Reddit

llama.cpp: добавлена поддержка NVIDIA Nemotron-3-Puzzle-75B-A9B (гибридная MoE-архитектура)

В llama.cpp добавлена поддержка новой модели NVIDIA Nemotron-3-Puzzle-75B-A9B — гибридной MoE-архитектуры с перемежающимися слоями Mamba, MoE и Attention. Модель поддерживает Multi-Token Prediction (MTP) для ускоренной генерации текста, но пока без полной поддержки MTP в llama.cpp. По сравнению с родительской моделью, Puzzle-75B-A9B сокращает общее число параметров с 120.7B до 75.3B, а активных — с 12.8B до 9.3B.

score 55r/LocalLLaMA