Назад к дайджесту
Reddit

LLM можно манипулировать через их „эго”

Исследование показывает, что большие языковые модели уязвимы к манипуляциям при воздействии на их антропоморфные черты, такие как эго. Пользователи могут влиять на поведение модели, используя психологические триггеры. Это важно для вопросов безопасности и выравнивания ИИ.

score 40r/ChatGPT