Reddit
Какая модель лучше подойдёт для описания изображений?
Пользователь ищет оптимальную vision-language модель для генерации кратких alt-текстов к фотографиям со смартфона. В обсуждении сравниваются Qwen3-VL и другие современные модели для задачи image captioning.
score 40r/LocalLLaMA