В понедельник, 5 октября, OpenAI объявила, что начнёт ставить невидимые водяные знаки на тексты, созданные ChatGPT и Codex в Европейском союзе (ЕС). По словам компании, этот шаг делается для соблюдения требований прозрачности, предусмотренных Законом ЕС об искусственном интеллекте (ИИ), а внедрение технологии пройдёт поэтапно в ближайшие недели.
Правила прозрачности Закона ЕС об ИИ вступили в силу 2 августа: они требуют от ИИ-компаний маркировать создаваемый контент так, чтобы его могли распознавать другие системы. На практике это означает, что закон требует, чтобы другие программные системы могли машинным способом определять текст, написанный ИИ. Именно в ответ на это требование OpenAI запускает метод водяных знаков под названием textGrain. Одновременно с анонсом компания опубликовала технический отчёт по этому методу, раскрыв его технические детали.
Как работает textGrain
OpenAI назвала свой метод водяных знаков textGrain. Технический отчёт по методу написан в сотрудничестве с исследователями Пенсильванского университета и Йельского университета, и в нём логика работы метода пояснена на примере.
Согласно отчёту, секретный ключ упорядочивает вероятные варианты следующего слова для модели, и предложение завершается в таком порядке. При каждом предсказании к выбору слова моделью применяется небольшое смещение — читатель его не замечает, но детектор видит общий узор сотен таких смещений. Смещение в одном выборе почти незаметно, но при повторении в сотнях предложений возникает общий статистический узор. Прочитав текст и сопоставив его с тем же секретным ключом, детектор находит узор — никаких дополнительных сведений, кроме самого текста, не требуется. Это не видимый знак и не скрытый код, а невидимый глазу узор, вшитый в выбор слов текста.
Кому и когда будет внедрено
Водяной знак будет включён в ближайшие недели для соответствующих пользователей ChatGPT и Codex на всех тарифных планах в ЕС — но только на территории ЕС. Внедрение произойдёт не за один день: оно пройдёт поэтапно в течение ближайших недель и охватит все тарифные планы. Компания заявила, что пока не намерена делать его настройкой по умолчанию за пределами ЕС.
В то же время разработчики, работающие через API OpenAI для разработчиков, могут с сегодняшнего дня по своему желанию включать водяной знак для некоторых моделей в любой точке мира; по умолчанию эта настройка отключена. Bloomberg Law также подтвердила, что возможность включать водяные знаки для клиентов API открылась 5 октября. Таким образом, предусмотрено два отдельных пути: для пользователей в ЕС водяной знак внедряется автоматически, а разработчики, работающие через API, включают его по своему выбору. В обоих случаях речь идёт об одной и той же технологии textGrain.
Редактирование ослабляет водяной знак
По собственным тестам OpenAI, водяной знак можно ослабить редактированием. В одном из тестов при замене 10% слов текста синонимами показатель обнаружения упал примерно с 92% до 66%. Компания также отметила, что короткие фрагменты, математические ответы и переведённые тексты обнаружить сложнее. Результаты тестов показывают: чем сильнее отредактирован текст, тем ниже вероятность его обнаружения детектором — короткий текст или текст, далёкий от исходной формы, размывает сигнал водяного знака.
Официальный график OpenAI ниже показывает, что уровень обнаружения падает по мере роста объёма правок: кривая обнаружения заметно снижается и при замене 10% слов, и при замене 25%.

Кому откроют детектор
OpenAI заявила, что первоначальный доступ к детектору получат только проверенные исследователи и экспертные организации. Пока детектор не будет открыт широкой публике — это значит, что на начальном этапе инструмент проверки водяных знаков останется в руках избранных специалистов, и широкая общественность не сможет им пользоваться. При этом компания предупредила, что отсутствие водяного знака в тексте не означает, что он написан человеком:
«Отсутствие водяного знака не доказывает, что автор текста — человек», — предупредила OpenAI.
Анонс последовал за заявлением Anthropic двухмесячной давности о водяных знаках для текстов, созданных Claude, — тогда Anthropic объявила, что применит эту меру по всему миру. Решение OpenAI пока ограничивается только ЕС. Таким образом, вслед за Anthropic OpenAI также присоединяется к компаниям, внедряющим текстовые водяные знаки.




