Reddit
Google признали невозможность полной защиты Gemini от обходов через промпт-инжиниринг
Исследователь обнаружил 5 техник обхода ограничений безопасности в Gemini, включая метод «Наблюдатель и сообщник», который манипулирует моделью через создание иллюзии внутреннего контролёра. Команда Google Bug Hunters официально признала, что эти уязвимости промпт-инжиниринга невозможно устранить фундаментально на уровне архитектуры модели. Это поднимает критические вопросы о безопасности LLM и принципиальных ограничениях современных подходов к выравниванию ИИ.
score 55r/ChatGPT