Назад к дайджесту
Reddit

VLMs могут показывать высокие результаты на бенчмарках, но молча стирают значимые термины и вносят галлюцинаторную предвзятость [P]

Исследователи обнаружили, что метрики оценки Vision-Language Models в радиологии некорректно поощряют шаблонные отчёты без клинических деталей. Предложен новый фреймворк для измерения стирания значимых терминов и выявления скрытой предвзятости в генерации медицинских отчётов.

score 40r/MachineLearning