Reddit
VLMs могут показывать высокие результаты на бенчмарках, но молча стирают значимые термины и вносят галлюцинаторную предвзятость [P]
Исследователи обнаружили, что метрики оценки Vision-Language Models в радиологии некорректно поощряют шаблонные отчёты без клинических деталей. Предложен новый фреймворк для измерения стирания значимых терминов и выявления скрытой предвзятости в генерации медицинских отчётов.
score 40r/MachineLearning