Назад к дайджесту
Reddit

Не говорите о «Клубе борьбы»: чрезмерная чувствительность Claude к вопросам кибербезопасности

Пользователь, получивший доступ к программе кибербезопасности Anthropic, столкнулся с автоматическим понижением модели Claude до версии Opus 4.8 при запросе примеров безопасных промптов. Это вызывает вопросы о балансе между защитой от вредоносных запросов и удобством для исследователей в области AI-безопасности. Ситуация иллюстрирует текущие проблемы с чувствительностью фильтров безопасности в языковых моделях.

score 55r/ClaudeAI