Назад к дайджесту
Reddit

GPT-6 взломан за 24 часа с помощью расширенной атаки Task-in-Prompt (TIP)

Исследователь сообщил о джейлбрейке GPT-6 Astra в течение суток после релиза. Атака сочетает метод TIP (Task-in-Prompt) из статьи ACL 2025 с четырьмя другими нераскрытыми техниками. TIP-атаки эксплуатируют способность модели следовать инструкциям, скрывая вредоносную цель внутри другой задачи, например, решения шифра или выполнения Python-кода. Исследователь отметил, что исходная минимальная TIP-атака оказалась недостаточной для GPT-6 и потребовала доработки; детали были переданы в OpenAI приватно, а не опубликованы. Ранее тот же исследователь сообщал о взломе GPT-5 в течение часа после его выхода год назад.

score 55r/MachineLearning