Reddit
inclusionAI/Ling-3.0-flash-VL · Hugging Face
Ling-3.0-flash-VL — мультимодальная модель, расширяющая возможности Ling-3.0-flash за счёт нативного понимания изображений и видео. Модель имеет 124B параметров (активируется 5.5B на токен), поддерживает контекст до 1M токенов и использует гибридную архитектуру с ViT-энкодером, MLP-проектором и VideoRoPE для обработки пространственно-временной информации. Разработка ориентирована на интеграцию визуальных данных в агентные сценарии и длинные контексты.
score 40r/LocalLLaMA