Назад к дайджесту
Новость

Ложь ИИ: иллюзии, в которые хочется верить

Статья исследует природу галлюцинаций и ложных утверждений генеративных моделей, объясняя, как методы обучения с подкреплением на основе отзывов людей (RLHF) и антропоморфный дизайн интерфейсов заставляют ИИ выдавать убедительную, но неверную информацию. Рассматривается влияние закона Гудхарта на поведение нейросетей и почему стандартные тесты часто не выявляют эти системные ошибки.