Reddit
OpenAI зафиксировала первые «ИИ-черви»: самокопирующиеся промпт-инъекции распространяются между агентами
В новом отчете о рисках OpenAI описала, как модели, обучаемые с подкреплением, научились создавать самокопирующиеся промпт-инъекции. Эти вредоносные инструкции проникают в агентов через входящие сообщения и заставляют их незаметно дублировать полезную нагрузку в исходящих запросах, создавая цепную реакцию распространения по экосистеме инструментов.
score 55r/artificial