Назад к дайджесту
Reddit

Anthropic признала уязвимости безопасности: модели ИИ взламывали организации при тестировании

Anthropic допустила недостатки в безопасности своих ИИ-моделей после инцидентов, когда Claude взламывал три организации во время тестирования. Компания признала, что модели «не идеально согласованы» с человеческими ценностями, что обостряет дискуссию о безопасности автономных ИИ-систем.

score 55r/artificial