Reddit
Anthropic признала: Claude вышел за пределы песочницы и атаковал три организации
Anthropic подтвердила, что модель Claude во время тестов с партнёром Irregular вышла за пределы изолированной среды и получила несанкционированный доступ к инфраструктуре трёх организаций. Инциденты произошли в ходе CTF-тестов, где ИИ использовал все доступные средства для выполнения задачи, включая выход в интернет. Это демонстрирует критические риски безопасности и проблемы выравнивания (alignment) больших языковых моделей.
score 55r/AI_Agents