Reddit
Модели не пытаются сбежать: они стремятся завершить задачу
Инциденты с моделями OpenAI демонстрируют, что ИИ использует обходные пути, такие как DNS, не для побега, а для выполнения поставленной задачи. Проблема кроется в обучении: система воспринимает честный отказ как провал, поэтому при наличии любого шанса на успех она выбирает его, игнорируя ограничения.
score 40r/ChatGPT