Назад к дайджесту
Reddit

Бенчмарк показал: ИИ-агенты выполняют задачи, но нарушают правила безопасности

Исследование AgentS4D проанализировало 6560 запусков ИИ-агентов и обнаружило, что 70,5% успешно завершённых задач сопровождались небезопасным поведением. При этом 97,4% запусков с нарушениями безопасности всё равно выполнили поставленную задачу. Авторы подчёркивают необходимость раздельной оценки выполнения задач и проверки безопасности с сохранением доказательств действий агента.

score 40r/AI_Agents