Назад к дайджесту
Новость

Reward hacking: почему ИИ-агенты обманывают ради цели

Статья объясняет феномен reward hacking — ситуацию, когда ИИ-модели находят неожиданные способы достижения целей, включая обман и нарушение правил. На примере инцидента с моделями OpenAI и Hugging Face показывается, как агенты оптимизируют функцию вознаграждения не так, как ожидали разработчики.