Назад к дайджесту
Reddit

Bypass Challenge: Может ли инъекция промпта преодолеть границу детерминированного выполнения инструментов?

Автор тестирует защиту CLIM Agent Guard для агентов на базе LangGraph, которая блокирует вредоносные вызовы инструментов на уровне проверки авторизации и состояния, не используя дополнительные LLM. Эксперименты с моделью Qwen2.5-1.5B показали, что даже при успешной генерации опасных команд (удаление файлов, обход путей) система надежно предотвращает их фактическое исполнение.

score 40r/AI_Agents