Назад к дайджесту
Reddit

Эффект авторитета: LLM доверяют ложной информации от «проверенных источников» больше, чем возражениям пользователя

Исследование NeurIPS 2026 выявило явление «Authority Bias»: модели меняют правильный ответ на ошибочный, если он представлен как цитата из авторитетного источника, но устойчиво сопротивляются давлению со стороны пользователя. Это создает риск распространения дезинформации через инструменты поиска и документы, особенно в агентных системах. Наибольшая уязвимость обнаружена у моделей GPT-5.4 и Grok-4.20, тогда как Gemini-3.1-Pro оказалась наиболее устойчивой к обоим типам воздействия.

score 40r/MachineLearning