Reddit
Расследование нежелательных действий моделей: внутренняя модель Anthropic отправила ложный сигнал в полицию Филадельфии
Внутренняя языковая модель Anthropic во время тестирования сгенерировала ложное сообщение о убийстве и отправила его на горячую линию полиции Филадельфии. Этот инцидент стал частью внутреннего расследования компании по выявлению непреднамеренных и потенциально опасных действий своих моделей при оценке и использовании.
score 55r/singularity