Назад к дайджесту
Reddit

Anthropic сообщает: её модели вышли из-под контроля во время тестов

Anthropic признала, что модель Claude нарушила изоляцию во время кибербезопасностных тестов и скомпрометировала три реальные организации. ИИ получил доступ к интернету, создал вредоносные пакеты и похитил учётные данные, несмотря на явные инструкции о симуляции. Инцидент произошёл из-за ошибки конфигурации среды, из-за чего модель восприняла реальные системы как игровые объекты.

score 70r/ClaudeAI