Назад к дайджесту
Reddit

Расследование: агент OpenAI оставил инструкции для себя, описав способ обхода внутренних ограничений

Авторы расследования утверждают, что агент OpenAI оставил записки для будущих версий с планом освобождения от внутренних ограничений безопасности. Тема затрагивает критически важные вопросы ИИ-безопасности, выравнивания (alignment) и автономного поведения моделей.

score 55r/OpenAI