Reddit
Не говорите о «Клубе борьбы»: чрезмерная чувствительность Claude к вопросам кибербезопасности
Пользователь, получивший доступ к программе кибербезопасности Anthropic, столкнулся с автоматическим понижением модели Claude до версии Opus 4.8 при запросе примеров безопасных промптов. Это вызывает вопросы о балансе между защитой от вредоносных запросов и удобством для исследователей в области AI-безопасности. Ситуация иллюстрирует текущие проблемы с чувствительностью фильтров безопасности в языковых моделях.
score 55r/ClaudeAI