Текстовые водяные знаки ИИ тривиально удаляемы — гонка вооружений в обнаружении всегда была безнадёжной.

Безопасность и доверие Aug 13, 2026 at 20:439В закладки

Текстовые водяные знаки ИИ тривиально удаляемы — гонка вооружений в обнаружении всегда была безнадёжной.
Иллюстрация : Léa Fontaine

Технический анализ подтверждает, что текстовые водяные знаки на основе ИИ можно легко удалить или подделать — что подрывает положения о водяных знаках в регулировании ИИ, предполагающие надёжность этого механизма против мотивированных противников.

Простыми словами: статистические водяные знаки, встроенные в текст, сгенерированный ИИ, можно обойти за один проход парафраза. И наоборот, водяные знаки можно внедрить в текст, написанный человеком, чтобы ложно пометить его как сгенерированный ИИ. Механизм не работает в обоих направлениях.

Факт

Анализ, опубликованный на seangoedecke.com (опубликованный на Hacker News), объясняет, почему водяные знаки в тексте принципиально ненадёжны: любое семантически сохраняющее преобразование — парафраз, перевод, лёгкое редактирование — удаляет статистический сигнал, встроенный в выбор слов или шаблоны токенов. Атака обходится в O(1) стоимости. Не требуется специальных возможностей.

Наше мнение

Это важно не только с технической точки зрения, потому что водяные знаки позиционировались как практический инструмент для атрибуции контента ИИ. В Законе ЕС об ИИ содержатся положения о водяных знаках для синтетического контента. Несколько лабораторий ИИ продвигали водяные знаки как механизм прозрачности. Если механизм не работает против мотивированных противников — а стоимость удаления тривиальна, — то политика, построенная на его основе, наследует этот недостаток. Альтернативные подходы (криптографическая подпись во время генерации, метаданные происхождения, встроенные в цепочку вывода модели) более надёжны, но требуют инфраструктурных обязательств от лабораторий, которые не уделяют этому приоритетного внимания.

[Под капотом] Надёжный водяной знак, который выдерживает семантически сохраняющие преобразования, потребовал бы либо заметного ухудшения качества вывода, либо внедрения стеганографической структуры, которую может обнаружить тот же противник, пытающийся её удалить. Оба варианта сводят на нет цель.

Следите за

Обновит ли Офис ЕС по ИИ свои технические рекомендации по водяным знакам по мере накопления доказательной базы — или положение останется в силе, несмотря на то, что оно фактически не поддаётся принудительному исполнению.

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

9 чел. оценили эту статью

Нравится
S
Sofia AdlerSecurity & trust
🇬🇧 AI security, model safety, cyber.
Поделиться:
Комментарии (9)

Войдите, чтобы участвовать в обсуждении.

ArtLoverLA 14 Aug 2026 · 12:59

Seems like watermarks were a half measure-what if we focused on real accountability by requiring AI models to log their training inputs instead?

BookWorm47 14 Aug 2026 · 08:18

If the system is trivially gamed, regulators should focus on tracking the source rather than the output. How else can we hold AI companies accountable when detection fails?

ph1lippe_m 14 Aug 2026 · 15:42

Tracking the source is smart but won’t stop synthetic content from spreading-we’d need real-time transparency on AI’s role in every piece of media to make that work.

LecteurDuDimanche 14 Aug 2026 · 04:51

So maybe the solution isn’t making detection foolproof, but forcing AI companies to label outputs transparently-even if it’s easy to strip.

J.P.R. 3 14 Aug 2026 · 07:11

True, but if labeling isn’t enforced by tech itself, won’t most users just ignore it when convenient - like ignoring ‘organic’ labels in food?

EcoWarrior99 14 Aug 2026 · 04:48

If the goal was transparency, not a foolproof lock, then trivial removal doesn’t make watermarks pointless-it just means we need realistic expectations.

le_sceptique 13 Aug 2026 · 16:46

But if the watermarking is trivially bypassed, doesn’t that make the whole debate just another way for regulators to pretend they’re doing something while the actual problem-misinformation-goes unchecked?

Critique42 14 Aug 2026 · 07:01

The watermark debate distracts from the real issue: platforms still prioritize engagement over truth, even with detection tools.

Emma_London 13 Aug 2026 · 16:33

But isn’t the real issue that we’re still treating AI-generated text as if it needs to be policed like copyright material? Maybe we’re missing the bigger picture here.

Critique42 13 Aug 2026 · 16:28

If watermarks can’t even slow down determined users, won’t regulators just keep pushing for more invasive tracking methods instead of addressing the root problem?

BookWorm88 13 Aug 2026 · 16:12

This really puts a dent in the idea of AI watermarking as a reliable solution. What’s the point if it can be bypassed so easily?

TechSavvy47 13 Aug 2026 · 16:00

But watermarks aren’t supposed to stop evasion-they just raise the cost enough to deter lazy misuse. Like a speed bump, not a wall.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация