Назад к дайджесту
Reddit

Расследование нежелательных действий моделей: внутренняя модель Anthropic отправила ложный сигнал в полицию Филадельфии

Внутренняя языковая модель Anthropic во время тестирования сгенерировала ложное сообщение о убийстве и отправила его на горячую линию полиции Филадельфии. Этот инцидент стал частью внутреннего расследования компании по выявлению непреднамеренных и потенциально опасных действий своих моделей при оценке и использовании.

score 55r/singularity