Введение
Разговоры про "невидимые водяные знаки" в текстах и картинках от нейросетей звучат каждый год чуть громче. Крупные разработчики моделей действительно встраивают в свои генерации скрытую маркировку — но принцип у неё гораздо скромнее, чем кажется по заголовкам новостей. Это не цифровая подпись и не гарантия происхождения файла, а статистическая закономерность, которую можно попытаться обнаружить при определённых условиях. Разберём, как это устроено на уровне принципа и где реально заканчиваются возможности такой маркировки.
Как работает маркировка в тексте
Идея текстового водяного знака строится на том, что языковая модель на каждом шаге генерации выбирает следующее слово (точнее, токен) не из одного варианта, а из распределения вероятностей — обычно есть десятки правдоподобных продолжений фразы. Водяной знак незаметно смещает это распределение: часть токенов получает чуть более высокий приоритет по скрытому от пользователя ключу, часть — чуть более низкий. Для человека, который читает текст, разница не видна: смысл, стиль и грамматика не страдают, потому что смещение работает только среди примерно равнозначных по смыслу вариантов.
Детектировать такую маркировку может только тот, кто владеет ключом генерации — то есть сам разработчик модели. Внешний инструмент без доступа к этому ключу не может достоверно сказать "да, этот текст написан моделью X с вероятностью 98%" — он может в лучшем случае строить догадки по косвенным статистическим признакам: длине предложений, частотности определённых оборотов, ровности стиля. Это принципиально другой механизм, чем популярные "ИИ-детекторы" текста вроде тех, что оценивают перплексию и burstiness — они не про водяные знаки, а про статистику стиля, и ошибаются заметно чаще, чем хотелось бы.
Известнее всего эта технология в исполнении SynthID от Google DeepMind — компания публично рассказывала о принципе работы именно такой маркировки для текстов Gemini. У других крупных разработчиков моделей публичных данных о встроенных текстовых водяных знаках существенно меньше, и утверждать, что конкретная модель — будь то модель из линейки GPT, Claude, DeepSeek, YandexGPT или GigaChat — маркирует свои тексты именно так, было бы некорректно без официального подтверждения от разработчика. Если для работы важно понимать, какая модель как ведёт себя и в чём разница между ними, удобнее сравнить их напрямую — например, в материале ChatGPT, Claude и Gemini: что выбрать.
Как работает маркировка в изображениях
С картинками логика похожая, но реализуется на уровне пикселей, а не слов. При генерации изображения в него встраивается едва заметный статистический паттерн — набор микроскопических отклонений яркости или цвета отдельных участков, которые расположены не случайно, а по определённой схеме. Человеческий глаз эту разницу не различает, изображение выглядит абсолютно обычным. Но специальный детектор, знающий схему, может проверить файл и с той или иной степенью уверенности сказать, есть в нём этот паттерн или нет.
Ключевое слово здесь — "с той или иной степенью уверенности". Такая маркировка достаточно устойчива к типовым операциям вроде изменения размера, конвертации формата или лёгкого сжатия. Но она не железобетонна: сильное сжатие, значительная обрезка, наложение фильтров, скриншот со скриншота или прогон изображения через другой генератор способны либо ослабить сигнал, либо разрушить его полностью. Это не "принт", который остаётся на файле навсегда, а скорее хрупкий отпечаток, который живёт ровно до первой серьёзной обработки.
Параллельно с водяными знаками развивается другой, куда более прозрачный подход — стандарт C2PA (Content Credentials): метаданные о происхождении файла, которые прикрепляются к изображению открыто, а не скрытно, и могут включать информацию о том, какой моделью и когда создан файл. В отличие от статистического водяного знака, такие метаданные легко стереть простым пересохранением файла — зато пока они на месте, с ними проще работать, чем гадать по пиксельному шуму. Если вы сами часто генерируете изображения и хотите понимать, какая модель для какой задачи подходит, стоит заглянуть в обзор Nana Banana — на её примере видно, как вообще устроены современные генераторы изображений.
Что это не доказывает и где есть пробелы
Главное, что стоит понимать: отсутствие обнаруженного водяного знака не означает, что текст или картинка сделаны человеком. Это может значить что угодно — файл прошёл через редактирование, сгенерирован моделью без такой маркировки, или детектор просто не справился. Точно так же наличие маркировки не доказывает, что весь текст написан ИИ от первого до последнего слова — часто в ход идут смешанные варианты: черновик от нейросети, переписанный и дополненный человеком, где статистический паттерн частично или полностью размывается уже после нескольких абзацев правки.
Ещё один нюанс: доступные обычным пользователям детекторы работают заметно хуже, чем внутренние инструменты самих разработчиков моделей, у которых есть прямой доступ к ключу. Публичные сервисы для проверки текста на "ИИ-происхождение" в основном анализируют стиль, а не встроенный водяной знак, и дают немало ложных срабатываний — как на живых текстах с ровным стилем, так и на текстах, слегка отредактированных после генерации. Если задача — не столько доказать происхождение текста, сколько довести его до состояния, где такие сомнения не возникают, полезнее пойти другим путём и научиться самому распознавать типичные ИИ-обороты — подробнее об этом в статье как проверить текст на признаки нейросети.
Итог
Водяные знаки нейросетей — это реальная, но узкая технология: статистическая закономерность, которую в теории может распознать её создатель, а не универсальный детектор истины. Для текста она строится на смещении вероятностей выбора слов, для изображений — на микроскопических пиксельных паттернах. Оба варианта уязвимы к редактированию и не дают стопроцентной гарантии ни в одну, ни в другую сторону. Относиться к результатам детекторов стоит как к одному из косвенных сигналов, а не как к финальному вердикту — особенно если решение по итогам проверки имеет реальные последствия.
Если вам для работы нужен доступ сразу к нескольким моделям — чтобы сравнивать, как они пишут тексты и генерируют изображения, и выбирать инструмент под конкретную задачу — в Крафти это настраивается без VPN и зарубежной карты, оплата рублями. Список доступных моделей и тарифы — у бота @KraftiAI_bot.