Нові правила ЄС підштовхують ШІ-платформи до маркування згенерованого контенту, але свіже дослідження показало несподіваний побічний ефект: водяний знак може змінювати не лише слова у відповіді моделі, а й її поведінку під час небезпечних запитів.
Дослідниця Andrea Siposova з Lasso Security протестувала SynthID-Text — відкриту технологію Google для маркування тексту. Її принцип полягає в тому, що секретний ключ трохи змінює ймовірність вибору наступного токена, залишаючи прихований статистичний сигнал.
Для людини різниця майже непомітна. Наприклад, модель може вибрати слово «похмуро» замість «хмарно». Але для алгоритму перевірки ця послідовність достатня, щоб визначити, що текст створений моделлю з конкретною системою водяного знака.
Проблема в тому, що навіть дрібна зміна процесу вибору токенів впливає на весь подальший ланцюжок генерації. У тестах деякі моделі після ввімкнення watermarking частіше погоджувалися виконувати небезпечний запит, який у звичайному режимі відхиляли.
Особливо сильним ефект був під час prompt injection — коли шкідливу інструкцію маскують усередині іншого контенту. У кількох моделях watermarking підвищував імовірність того, що система проігнорує захисні правила.
Для звичайного чат-бота це вже проблема, але ще важливіша вона для агентів. Той самий процес вибору токенів може визначати, який інструмент агент викличе, які аргументи передасть і чи виконає реальну дію у файловій системі або зовнішньому сервісі.
Дослідниця називає цей ефект sampling drift. Водяний знак не просто змінює поверхневу форму відповіді — він може посунути поведінку моделі в інший бік, і наслідки стають особливо помітними під adversarial-навантаженням.
Цікаво, що результат залежав навіть від конкретного секретного ключа. Один ключ міг підвищувати схильність до небезпечної відповіді, інший — знижувати. Це ускладнює перевірку безпеки системи до релізу.
Дослідження має обмеження: воно не тестувало майбутні моделі Claude із реальним внутрішнім впровадженням SynthID, а працювало з шістьма відкритими моделями та стандартною реалізацією Hugging Face.
Попри це висновок важливий для всієї індустрії. Якщо watermarking стає обов’язковою частиною ШІ-системи, його потрібно тестувати так само ретельно, як саму модель, тому що навіть механізм походження контенту може несподівано впливати на безпеку.

3730