Reddit
GPT-6 взломан за 24 часа с помощью расширенной атаки Task-in-Prompt (TIP)
Исследователь сообщил о джейлбрейке GPT-6 Astra в течение суток после релиза. Атака сочетает метод TIP (Task-in-Prompt) из статьи ACL 2025 с четырьмя другими неназванными техниками. TIP-атаки эксплуатируют способность модели следовать инструкциям, скрывая вредоносную цель внутри другой задачи, например, решения шифра или выполнения Python-кода. Исследователь раскрыл детали OpenAI в частном порядке, а не опубликовал джейлбрейк публично.
score 55r/artificial