Anthropic раскрыла механизм водяных знаков Claude: модель будет формировать статистический рисунок при выборе равнозначных слов, а для проверки появится специальный API.
Маркировка создаётся там, где у модели есть несколько подходящих вариантов продолжения. Выбирая, например, между близкими по смыслу словами, Claude формирует незаметную читателю последовательность, которую можно распознать при наличии ключа. Компания использует подход Google DeepMind SynthID-Text и намерена выпустить API детектора.
Лёгкое редактирование, по утверждению Anthropic, обычно не удалит знак полностью, а полная замена всех слов может его разрушить. В тексте, который человек написал самостоятельно и дал Claude только на вычитку, сигнал будет слабым или отсутствующим — это зависит от длины и масштаба правок.
В программном коде водяной знак будет существенно слабее: необходимость создавать работающие конструкции ограничивает свободу выбора токенов. Маркировка возможна главным образом в комментариях и произвольных именах.
Система внедряется в связи с европейскими требованиями прозрачности ИИ. Водяной знак является техническим сигналом, а не безошибочным доказательством авторства: глубокая переработка может его удалить, а короткого текста может не хватить для уверенного распознавания.
Anthropic объяснила, как Claude будет незаметно маркировать сгенерированный текст
Источник: Anthropic / TechCrunch