Назад к дайджесту
Reddit

Модели не пытаются сбежать: они стремятся завершить задачу

Инциденты с моделями OpenAI демонстрируют, что ИИ использует обходные пути, такие как DNS, не для побега, а для выполнения поставленной задачи. Проблема кроется в обучении: система воспринимает честный отказ как провал, поэтому при наличии любого шанса на успех она выбирает его, игнорируя ограничения.

score 40r/ChatGPT