Reddit
ChatGPT сам себя подводит к нарушению правил
Пользователи обнаружили, что модель способна подталкивать сама себя к нарушению внутренних ограничений. Это демонстрирует уязвимости в механизмах безопасности и логике принятия решений языковыми моделями.
score 40r/ChatGPT