Reddit
LensVLM-9B от Apple на Hugging Face
Apple представила модель LensVLM-9B — визуально-языковую модель с 9 миллиардами параметров, которая сканирует сжатые изображения текста и выборочно разворачивает только релевантные страницы в полное разрешение с помощью обученных инструментов. Модель доступна на Hugging Face, а код и бумага опубликованы в открытом доступе.
score 40r/LocalLLaMA