Назад к дайджесту
Reddit

Какая модель лучше подойдёт для описания изображений?

Пользователь ищет оптимальную vision-language модель для генерации кратких alt-текстов к фотографиям со смартфона. В обсуждении сравниваются Qwen3-VL и другие современные модели для задачи image captioning.

score 40r/LocalLLaMA