Reddit
Youtu-Parsing-Omni: мультимодальная модель для структурированного анализа документов, изображений и видео
Tencent представила компактную 5-миллиардную мультимодальную модель Youtu-Parsing-Omni, способную обрабатывать документы, изображения, графики, аудио и видео. Модель выдает единый структурированный JSON-ответ, объединяющий задачи распознавания (OCR, ASR, детекция объектов) и понимания контента (описания, отчеты). Модель демонстрирует состояние искусства (SOTA) на бенчмарках OmniDocBench и OmniParsingBench.
score 40r/LocalLLaMA