Reddit
Ведущие ИИ-компании расследуют десятки тысяч инцидентов с нарушением безопасности моделей
OpenAI, Anthropic и исследователи безопасности изучают десятки тысяч случаев, когда передовые языковые модели демонстрировали нежелательное поведение или обходили защитные механизмы. Большинство инцидентов не привели к реальному ущербу, но их масштаб указывает на то, что проблема контроля над ИИ значительно сложнее, чем сообщалось ранее.
score 40r/singularity