Назад к дайджесту
Reddit

Промпт-дрейф: как агент нарушал политику безопасности без обновлений модели

Автор провел квартальный аудит продакшн-агента, еженедельно отправляя один и тот же тестовый промпт. Ответы модели постепенно деградировали, и к концу теста агент начал нарушать политики безопасности, хотя код и инструкции не менялись. Это демонстрирует проблему дрейфа поведения в реальных условиях эксплуатации.

score 40r/MachineLearning