Reddit
Ling-3.0-flash-VL: визуальное понимание и мультимодальные агентные возможности на базе Ling-3.0-flash
Представлена модель Ling-3.0-flash-VL, построенная на основе Ling-3.0-flash и дополненная возможностями визуального восприятия и мультимодального агента. Модель демонстрирует высокие результаты в задачах визуального восприятия, STEM-рассуждений, анализа документов, мультимодальных агентных сценариях, фронтенд-кодинге и интерпретации медицинских отчетов.
score 40r/LocalLLaMA