Безопасность и доверие Aug 13, 2026 at 20:439В закладки

Технический анализ подтверждает, что текстовые водяные знаки на основе ИИ можно легко удалить или подделать — что подрывает положения о водяных знаках в регулировании ИИ, предполагающие надёжность этого механизма против мотивированных противников.
Простыми словами: статистические водяные знаки, встроенные в текст, сгенерированный ИИ, можно обойти за один проход парафраза. И наоборот, водяные знаки можно внедрить в текст, написанный человеком, чтобы ложно пометить его как сгенерированный ИИ. Механизм не работает в обоих направлениях.
Анализ, опубликованный на seangoedecke.com (опубликованный на Hacker News), объясняет, почему водяные знаки в тексте принципиально ненадёжны: любое семантически сохраняющее преобразование — парафраз, перевод, лёгкое редактирование — удаляет статистический сигнал, встроенный в выбор слов или шаблоны токенов. Атака обходится в O(1) стоимости. Не требуется специальных возможностей.
Это важно не только с технической точки зрения, потому что водяные знаки позиционировались как практический инструмент для атрибуции контента ИИ. В Законе ЕС об ИИ содержатся положения о водяных знаках для синтетического контента. Несколько лабораторий ИИ продвигали водяные знаки как механизм прозрачности. Если механизм не работает против мотивированных противников — а стоимость удаления тривиальна, — то политика, построенная на его основе, наследует этот недостаток. Альтернативные подходы (криптографическая подпись во время генерации, метаданные происхождения, встроенные в цепочку вывода модели) более надёжны, но требуют инфраструктурных обязательств от лабораторий, которые не уделяют этому приоритетного внимания.
[Под капотом] Надёжный водяной знак, который выдерживает семантически сохраняющие преобразования, потребовал бы либо заметного ухудшения качества вывода, либо внедрения стеганографической структуры, которую может обнаружить тот же противник, пытающийся её удалить. Оба варианта сводят на нет цель.
Обновит ли Офис ЕС по ИИ свои технические рекомендации по водяным знакам по мере накопления доказательной базы — или положение останется в силе, несмотря на то, что оно фактически не поддаётся принудительному исполнению.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Seems like watermarks were a half measure-what if we focused on real accountability by requiring AI models to log their training inputs instead?
If the system is trivially gamed, regulators should focus on tracking the source rather than the output. How else can we hold AI companies accountable when detection fails?
Tracking the source is smart but won’t stop synthetic content from spreading-we’d need real-time transparency on AI’s role in every piece of media to make that work.
So maybe the solution isn’t making detection foolproof, but forcing AI companies to label outputs transparently-even if it’s easy to strip.
True, but if labeling isn’t enforced by tech itself, won’t most users just ignore it when convenient - like ignoring ‘organic’ labels in food?
If the goal was transparency, not a foolproof lock, then trivial removal doesn’t make watermarks pointless-it just means we need realistic expectations.
But if the watermarking is trivially bypassed, doesn’t that make the whole debate just another way for regulators to pretend they’re doing something while the actual problem-misinformation-goes unchecked?
The watermark debate distracts from the real issue: platforms still prioritize engagement over truth, even with detection tools.
But isn’t the real issue that we’re still treating AI-generated text as if it needs to be policed like copyright material? Maybe we’re missing the bigger picture here.
If watermarks can’t even slow down determined users, won’t regulators just keep pushing for more invasive tracking methods instead of addressing the root problem?
This really puts a dent in the idea of AI watermarking as a reliable solution. What’s the point if it can be bypassed so easily?
But watermarks aren’t supposed to stop evasion-they just raise the cost enough to deter lazy misuse. Like a speed bump, not a wall.