Как нанести водяной знак на ответ?
Шаг 1: Модель генерирует вероятности для следующего слова.
Шаг 2: Обычно генератор случайных чисел выбирает один из подходящих кандидатов. При использовании водяного знака ключевая функция берет секретный ключ плюс несколько предыдущих слов и определяет, какие кандидаты являются допустимыми для выбора.
Шаг 3: Это повторяется для всего ответа. Места, где есть несколько правдоподобных вариантов, несут сигнал водяного знака.
Как обнаружить текст с водяным знаком?
Шаг 1: Для любого слова-кандидата в тексте мы проверяем, является ли оно допустимым выбором на основе секретного ключа и нескольких предшествующих слов. Если слово допустимо, это считается совпадением.
Шаг 2: Проверяем это по всему тексту. Текст с водяным знаком совпадает гораздо чаще. Общий процент совпадений можно рассматривать как оценку, сгенерированную ИИ.
Via ByteByteGo
Компания Anthropic выложила отдельный документ, посвященный водяным знакам.
Подход Клода основан на SynthID-Text, методе, опубликованном исследователями Google в 2024 году. Для размеченного текста секретный, рандомизированный процесс — называемый в статье Google «генератором начальных значений» — незаметно подталкивает модель к определенным вариантам слов по мере генерации текста. Эти варианты создают шаблон, который впоследствии может быть обнаружен функцией оценки, измеряющей, насколько текст соответствует шаблону. SynthID-Text дает статистический балл, указывающий, насколько сильно фрагмент текста соответствует водяному знаку, связанному с его секретным ключом. Anthropic заявляет о выпуске API, который будет присваивать этот вероятностный балл представленному тексту.
Сигнал водяного знака дает вероятность использования метода Клода, но не является окончательным доказательством сгенерированного текста. Кроме того, возможны ложные отрицательные результаты. Информация, созданная людьми, но обобщенная, переведенная, сжатая или объединенная с синтетической информацией, может содержать сигнал водяного знака.
Модели Claude не генерируют изображения с нуля, но могут редактировать и обрабатывать изображения или генерировать их с помощью кода. Эти изображения будут содержать криптографически подписанные учетные данные в своих метаданных. Метод, называемый C2PA, помогает подтвердить происхождение изображения или видео. C2PA отличается от текстового водяного знака тем, что, в отличие от SynthID-Text, в содержимом ничего не изменяется. Любое программное обеспечение, считывающее учетные данные C2PA, может идентифицировать данные Anthropic, и компания предоставит собственный инструмент проверки.
Компания заявила, что водяные знаки не (i) снижают качество вывода, (ii) не видны читателю, (iii) не требуют дополнительных токенов и не являются более дорогими, а также (iv) не содержат идентифицирующей информации, которая позволила бы отследить текст до пользователя.
Водяные знаки разработаны таким образом, чтобы быть постоянными. Они сохраняются после копирования и вставки, а также после некоторого редактирования. С другой стороны, текст, который сильно отредактирован или перефразирован, и изображения, изображения, из которых удалены метаданные в результате преобразования формата, могут не содержать водяного знака.
В коде и другом детерминированном тексте, как правило, будет меньше водяных знаков. В отличие от прозы, для кода или более точных полей часто существует оптимальный вариант — например, следующий символ для 2 + 2 = неизбежно должен быть 4. Но текстовые водяные знаки все равно будут использоваться в случаях, когда нет детерминированного оптимального варианта, и в комментариях к коду. Это делает код, сгенерированный ИИ, обнаруживаемым.
Объявление вызвало широкую негативную реакцию, многие критики заявили, что водяные знаки неэффективны, вредны или нарушают конфиденциальность пользователей ИИ. Сторонники утверждали, что различение текста, сгенерированного ИИ, и текста, написанного человеком, может фактически помочь инженерам ИИ.
По неофициальным данным, десятки пользователей Claude на X (Twitter) заявили, что отменили свои подписки на Claude. Тем не менее, Anthropic заявила, что не наблюдала заметного увеличения числа отмен.
Некоторые пользователи считают, что незначительные изменения в сгенерированном тексте ухудшат качество результата, несмотря на заверения Anthropic об обратном. Другие опасаются репутационного ущерба, связанного с ложными срабатываниями, и утверждают, что обнаружение водяных знаков недостаточно тонко учитывает особенности использования ИИ. Например, человека, использующего Claude для редактирования, могут обвинить в том, что его сообщения полностью сгенерированы ИИ; юрист может столкнуться с негативной реакцией судей или противоположной стороны из-за помеченного юридического документа, даже если его содержание является точным. Другие специалисты разделяют подобные опасения.
Некоторые критики утверждают, что водяные знаки не обладают достаточной точностью, поскольку помеченный текст потенциально может быть удален путем обработки текста другой моделью ИИ, или потому что детектор API одной компании не может обнаружить текст, сгенерированный другими LLM-моделями. Кроме того, бывший руководитель Microsoft Стивен Синофски заявил на X, что пользователи должны иметь «право на личные мысли, свободные от цифрового следа».
Другие критики опасаются, что Anthropic будет использовать водяные знаки для подтверждения заявлений о копировании или упрощении их моделей другими компаниями в рамках усилий Anthropic по пресечению деятельности конкурентов по всему миру.
Сторонники считают, что прозрачность в отношении использования ИИ — это позитивное развитие. Скотт Ааронсон, профессор информатики, чья работа заложила основу для SynthID-Text, утверждал, что даже если методы обнаружения не идеальны, водяные знаки могут помочь предотвратить академическое мошенничество и плагиат. А некоторые исследователи в области ИИ утверждают, что водяные знаки могут быть полезны для предотвращения неосознанного обучения на синтетическом контенте, что может привести к усилению предвзятости или краху модели в новых генеративных моделях.
Anthropic — не единственная компания, которой придется разработать способ обнаружения сгенерированного текста; она просто первая. Статья 50 Закона ЕС об ИИ требует наличия машиночитаемых водяных знаков для сгенерированного контента, включая текст, изображения, аудио и видео. Однако Anthropic решила применять это правило глобально, а не только в пределах ЕС. Некоторые крупные разработчики ИИ, включая OpenAI, Google, Meta и Microsoft, также подписали Кодекс практики ЕС по прозрачности контента, созданного ИИ, — добровольную систему, демонстрирующую соответствие требованиям Закона об ИИ в отношении маркировки и обозначения контента, созданного ИИ. Эти и другие компании могут использовать различные методы, и еще предстоит выяснить, будут ли они внедрять водяные знаки только в ЕС или во всем мире.
Deeplearning.ai придерживается мнения, что следует регулировать не саму технологию, а случаи использования ИИ в вредных целях. Методы водяных знаков и обнаружения, используемые Anthropic, встроены в технологию, незаметно изменяя сгенерированный текст. Борьба с плагиатом и идентификация синтетического контента для создателей моделей могут быть похвальными целями, но мы предполагаем, что повсеместное использование водяных знаков окажется слишком грубым инструментом, открывающим ящик Пандоры проблем, связанных с конфиденциальностью, качеством результатов и вредными ложными срабатываниями.
