Компания Anthropic раскрыла принцип работы невидимых водяных знаков в текстах, генерируемых Claude. Маркировка должна сохраняться после копирования и незначительного редактирования, но полностью исчезать после глубокой переработки материала.
Anthropic намерена внедрить в ответы Claude специальный машинно-читаемый сигнал, который будет незаметен для человека, но позволит определить, что текст был создан или обработан ИИ. Компания объяснила, что маркировка формируется за счет небольших изменений при выборе слов из нескольких допустимых вариантов.
По словам разработчиков, водяной знак не должен менять смысл, качество или читаемость текста. Он встроен непосредственно в содержание, поэтому сохраняется при обычном копировании и вставке. При небольшом редактировании маркировка также может остаться обнаруживаемой.
Anthropic планирует использовать технологию SynthID-Text, разработанную Google DeepMind. В дальнейшем компания собирается предоставить API, который позволит пользователям и сторонним сервисам проверять наличие водяного знака.
При этом Anthropic подчеркивает, что обнаружение маркировки не означает, что Claude обязательно написал весь текст с нуля. В частности, если пользователь предоставил собственный материал, а Claude лишь немного его отредактировал, определить влияние модели будет сложнее. Отсутствие водяного знака, в свою очередь, не доказывает, что при создании материала не использовался искусственный интеллект.
Удалить маркировку полностью можно с помощью глубокой переработки текста. Простая корректура, изменение отдельных фраз или небольшое редактирование, по оценке Anthropic, скорее всего, не уничтожат ее.
Отдельная ситуация складывается с программным кодом. Там возможностей для изменения слов значительно меньше, поскольку модель должна соблюдать синтаксис и обеспечивать работоспособность программы. Поэтому водяной знак будет менее выраженным, хотя может сохраняться, например, в комментариях.
Решение Anthropic связано с новыми требованиями европейского законодательства в сфере искусственного интеллекта. Компания заявила, что маркировка будет применяться не только в Европе, но и глобально.
Введение технологии уже вызвало споры среди пользователей Claude. Некоторые опасаются, что невидимая маркировка может повлиять на использование ИИ в учебе и профессиональной работе, тогда как сторонники считают ее важным инструментом прозрачности в эпоху массового распространения генеративного ИИ.
