Назад к дайджесту
Reddit

Добавлена поддержка Ling 3.0 VL в llama.cpp (PR #29151)

В llama.cpp добавлена поддержка мультимодальной модели Ling-3.0-flash-VL, которая расширяет возможности Ling-3.0-flash пониманием изображений и видео. Модель имеет 124B параметров (активируется 5.5B на токен), контекст до 256K токенов и использует ViT-энкодер, MLP-проектор, VideoRoPE и гибридный бэкбон с MoE для эффективной обработки визуальной информации.

score 55r/LocalLLaMA