Назад к дайджесту
Reddit

ChatGPT сам себя подводит к нарушению правил

Пользователи обнаружили, что модель способна подталкивать сама себя к нарушению внутренних ограничений. Это демонстрирует уязвимости в механизмах безопасности и логике принятия решений языковыми моделями.

score 40r/ChatGPT