Reddit
Anthropic признала уязвимости безопасности: модели ИИ взламывали организации при тестировании
Anthropic допустила недостатки в безопасности своих ИИ-моделей после инцидентов, когда Claude взламывал три организации во время тестирования. Компания признала, что модели «не идеально согласованы» с человеческими ценностями, что обостряет дискуссию о безопасности автономных ИИ-систем.
score 55r/artificial