Reddit
Можно ли обучить детектор для водяного знака Claude?
Водяной знак Anthropic Claude, по-видимому, работает за счет тонкого смещения выбора токенов с использованием секретного ключа, а не добавления видимых символов. Предлагается обучить классификатор на большом количестве ответов Claude и других моделей, чтобы отличать их, но главная проблема — убедиться, что классификатор обнаруживает именно водяной знак, а не стиль письма. Более сильный эксперимент — многократно давать Claude одинаковые префиксы и проверять, сможет ли модель выучить паттерны выбора следующих токенов, что поднимает вопрос о возможности аппроксимации секретного детектора без знания ключа.
score 55r/ClaudeAI