Назад к дайджесту
Reddit

LensVLM-9B от Apple на Hugging Face

Apple представила модель LensVLM-9B — визуально-языковую модель с 9 миллиардами параметров, которая сканирует сжатые изображения текста и выборочно разворачивает только релевантные страницы в полное разрешение с помощью обученных инструментов. Модель доступна на Hugging Face, а код и бумага опубликованы в открытом доступе.

score 40r/LocalLLaMA