Reddit
Bypass Challenge: Может ли инъекция промпта преодолеть границу детерминированного выполнения инструментов?
Автор тестирует защиту CLIM Agent Guard для агентов на базе LangGraph, которая блокирует вредоносные вызовы инструментов на уровне проверки авторизации и состояния, не используя дополнительные LLM. Эксперименты с моделью Qwen2.5-1.5B показали, что даже при успешной генерации опасных команд (удаление файлов, обход путей) система надежно предотвращает их фактическое исполнение.
score 40r/AI_Agents