Назад к дайджесту
Reddit

Ling-3.0-flash-VL: визуальное понимание и мультимодальные агентные возможности на базе Ling-3.0-flash

Представлена модель Ling-3.0-flash-VL, построенная на основе Ling-3.0-flash и дополненная возможностями визуального восприятия и мультимодального агента. Модель демонстрирует высокие результаты в задачах визуального восприятия, STEM-рассуждений, анализа документов, мультимодальных агентных сценариях, фронтенд-кодинге и интерпретации медицинских отчетов.

score 40r/LocalLLaMA