Reddit
Рейтинг безопасности ИИ: оценка устойчивости моделей
Команда разработала лидерборд для ранжирования безопасности передовых языковых моделей, используя автоматизированный тест с 1500 попытками взлома. Исследование выявило значительный разрыв в устойчивости между моделями и ищет фидбек по методологии, включая тестирование открытых весов и новых доменов атак. Проект направлен на улучшение критериев оценки рисков при развертывании ИИ-агентов и моделей.
score 40r/MachineLearning