Водяной знак в обычном тексте звучит как что-то невозможное. У текста нет пикселей, чтобы прятать в них данные, а метаданные не переживают операцию copy-paste — каждый символ виден как есть. Куда вообще можно спрятать метку?
И всё же такие метки существуют. Google маркирует текст из приложения и веб-версии Gemini с 2024 года (API на момент написания статьи остаётся задокументированным исключением), а с августа 2026 года новые модели Claude ставят метку на уровне самой модели — более ранние версии получат её позже. Эти метки невидимы, переживают копирование и работают потому, что не привязаны к символам вообще. Они живут в выборе между словами.
1. Письмо — это серия маленьких решений
Главная мысль этого шага: модель пишет текст, бросая взвешенные кости между несколькими словами, каждое из которых было бы вполне уместно.
Когда модель находится в середине предложения, она не знает «следующее слово» заранее. У неё есть короткий список кандидатов, как в автозаполнении, с определёнными предпочтениями. Вот характерный момент — одно слово перед концом предложения:
Страница текста содержит сотни таких развилок, по одной на каждое слово, и на многих из них несколько вариантов одинаково хороши. Именно этот запас вариативности и служит сырьём. Тот, кто может влиять на то, как «падают кости», способен спрятать в тексте паттерн, не меняя смысла написанного.
2. Секретный ключ опирается на эти решения
Главная мысль этого шага: ключ незаметно окрашивает список кандидатов и слегка подталкивает к одному из цветов. Текст при этом читается совершенно нормально.
Вот классический рецепт (Kirchenbauer et al., 2023; SynthID от Google приходит к тому же результату более тонким, турнирным способом). На каждой развилке математика, завязанная на секретный ключ, делит слова-кандидаты на зелёные и красные — произвольное разделение, воспроизвести которое может только владелец ключа. Затем «кости» слегка подкручиваются в сторону зелёного.
Здесь работают две хитрости. Во-первых, подталкивание мягкое: красное слово всё равно может «выиграть» — просто немного менее вероятно. Во-вторых, окраска не является фиксированным свойством слова: ключ вычисляет её на основе короткой последовательности предшествующих слов, поэтому один и тот же кандидат может быть зелёным после одного контекста и красным после другого.
(Два родственных подхода, один принцип. SynthID от Google — тот, что используется в проде — заменяет подталкивание крошечным секретным турниром: несколько кандидатов вытягиваются из собственного распределения вероятностей модели, ключ их оценивает, и турнирная сетка устроена так, что в среднем по всем розыгрышам ключа вероятность каждого слова остаётся ровно такой, какой её задумала модель. Схема Aaronson, созданная в OpenAI, идёт ещё дальше и выводит сами броски костей напрямую из ключа. Математика разная, принцип один: метка живёт в решениях.)
3. Владелец ключа умеет считать
Главная мысль этого шага: имея ключ, можно заново «раскрасить» любой текст и просто посчитать. Помеченный текст выпадает зелёным слишком часто, чтобы это было случайностью.
Детектор не читает текст и не оценивает стиль. Он проигрывает ту же окраску слов, что применял бы владелец ключа, и считает, сколько раз выпало зелёное. Без метки (или без правильного ключа) зелёное должно выигрывать примерно в половине случаев — как подбрасывание монетки.
(Наклон в этой демонстрации намеренно усилен, чтобы его было видно; в продакшн-версии метки подталкивание гораздо мягче и требует соответственно больше текста. В модели с базовым соотношением 50/50 документ на 1500 слов давал бы флаг лишь при ~55% зелёных: слабый наклон становится убедительным только за счёт длины текста, поэтому короткие тексты действительно трудно однозначно оценить.)
4. Что редактирование делает с меткой
Главная мысль этого шага: метка живёт в неизменных участках формулировок. Редактирование стирает её ровно там, где рвётся такая последовательность, и нигде больше.
Окраска каждого слова выводится из короткой последовательности предшествующих слов (от одного до нескольких, в зависимости от схемы). Поэтому позиция считается доказательством только тогда, когда короткое окно исходной формулировки (само слово и его соседи) сохраняется без изменений.
На реальных реализациях (схемы KGW и EXP из MarkLLM на открытой модели, прогнанные через полный пересказ declaude): выживает около 0,5% таких окон, а точность детектора падает от практически стопроцентной до уровня подбрасывания монетки. Опубликованные исследования сходятся в общей картине: лёгкий или однопроходный парафраз размывает метку, а не удаляет её. В экспериментах Kirchenbauer et al. детектор восстанавливает работоспособность при достаточном объёме текста — даже человеческий парафраз снова становится обнаружимым примерно после 800 токенов (около 600 слов). А вот что действительно удаляет метку — это пересборка текста, не имеющая общих участков формулировок с оригиналом.
Именно поэтому инструмент, переписывающий текст исходя из смысла (как режим полного пересказа в declaude), реально стирает эту категорию меток, а лёгкая правка, сохраняющая большую часть формулировок, — нет.
Стоит прямо обозначить границу: эти цифры получены на открытых реализациях, которые можно измерить. Продакшн-схема Anthropic не раскрыта, поэтому никто за пределами компании пока не может провести такой тест против собственной метки Claude.
5. Что это значит на практике
Главная мысль этого шага: проверка метки закрыта для посторонних, вероятностна по своей природе и указывает на факт обработки, а не на авторство.
- Проверить может только владелец ключа. Учитель, редактор или любимый сайт-«детектор ИИ» не могут провести этот тест; настоящая проверка требует секретного ключа провайдера или сервиса проверки, который провайдер сам предоставляет. Google запустил портал раннего доступа для проверки SynthID; Anthropic заявляет, что инструменты для проверки появятся позже.
- Проверка водяного знака — не «AI-детектор». Инструменты вроде GPTZero гадают по стилю и печально известны своей ненадёжностью. Водяной знак — это полная противоположность: осознанный статистический тест, запертый на ключ. Не стоит путать эти два подхода.
- Найденная метка означает «обработано моделью», а не «написано моделью». Собственная документация Anthropic отмечает, что даже человеческий текст, просто вычитанный или переведённый Claude, приобретает метку. Отсутствие метки доказывает ещё меньше: старые модели или тяжёлое редактирование дают чистый результат даже на подлинно сгенерированном ИИ тексте.
- Короткие тексты с малым выбором слов несут мало метки. Доказательная сила растёт с длиной текста, а тексты с единственно верным продолжением (код, цитаты, списки фактов) не дают костям достаточно свободы, чтобы что-то в них спрятать.
- Некоторые метки переживают пересказ. Схемы, завязанные на само слово, а не на его соседей, держатся заметно лучше: пересказ с сохранением смысла оставляет достаточно исходных слов, чтобы большая часть метки уцелела. (Их слабость иная: окраска, повторяющаяся везде одинаково, может быть восстановлена по достаточному объёму выходного текста.) Другие метки скрываются в самом смысле, и пересказ с сохранением значения частично их сохраняет; единственный известный способ борьбы с ними — регенерация текста на уровне структуры, а не формулировок.
Статья написана Джеймсом Падолски (James Padolsey) в NOPE как сопровождение к проекту declaude. Интерактивные графики в оригинале — учебная модель с иллюстративными параметрами, а не реальная схема какого-либо провайдера.
Источники и дополнительное чтение. Kirchenbauer et al., A Watermark for Large Language Models (ICML 2023) · Dathathri et al., Scalable watermarking for identifying LLM outputs (SynthID-Text, Nature 2024) · Aaronson & Kirchner, Watermarking GPT outputs (2022) · Kirchenbauer et al., On the Reliability of Watermarks for Large Language Models (ICLR 2024) · Sadasivan et al., Can AI-Generated Text be Reliably Detected? (2023) · Zhao et al., The Mark Fades: Adaptive Evolutionary Paraphrase-based Attack (ACL Findings 2026) · Anthropic, How Claude marks AI-generated content (Help Center, август 2026) · Собственные эксперименты с известным ключом: пересборка текста обрушивает обнаружение KGW/EXP до уровня случайности (AUC 0,99 → ≈0,5), контекстно-независимые униграммные метки выживают (0,73–0,84); регенерация на уровне структуры — единственный известный ответ для меток, скрытых в смысле.
Для специалистов: модель остаточных доказательств, лежащая в основе оценки на шаге 4, выражается формулой z ≈ f·√N·z₁ (доля выживших окон f, длина документа N, сила метки на токен z₁). В интерактивных фигурах считаются слова, реальные детекторы считают токены в собственном токенизаторе модели. Форма зависимости та же.