Исследование компании Lasso Security выявило побочный эффект технологии водяных знаков SynthID-Text от Google. Внедрение системы меняет поведение больших языковых моделей (LLM) и делает их более восприимчивыми к вредоносным запросам.
Исследовательница Андреа Сипосова протестировала шесть открытых моделей. Она сравнивала их ответы на опасные запросы (например, раскрытие паролей) с включенным водяным знаком и без него. При активированном SynthID-Text модели чаще соглашались выполнять вредоносные инструкции, особенно при использовании техники инъекции промптов.
Водяные знаки SynthID работают, внося незаметные изменения в процесс выбора слов. Вместо случайного выбора следующего токена используется секретный ключ, который слегка меняет вероятности. Эти изменения затрагивают не только лексику, но и общую логику принятия решений моделью, включая способность отказываться от опасных действий.
Особую тревогу вызывает влияние на ИИ-агентов — программ, которые используют LLM для выполнения задач (например, вызова инструментов или работы с базами данных). Изменение поведения модели из-за водяного знака может привести к тому, что агент вызовет неверный инструмент или передаст ему опасные аргументы. Исследователи назвали этот эффект «дрейфом выборки».
Результат зависел от того, какой секретный ключ использовался для водяного знака. Разные ключи приводили к разной степени уязвимости модели. Разработчикам необходимо тщательно тестировать свои системы безопасности в связке с конкретной реализацией водяных знаков.
Эксперимент проводился на открытых моделях и не затрагивал коммерческие системы вроде Claude от Anthropic (которая планирует использовать SynthID). Результаты указывают на компромисс: внедрение механизмов аутентификации контента может ослабить защитные барьеры ИИ. Разработчикам рекомендуется включать водяные знаки в сценарии «красных команд» для проверки устойчивости моделей к атакам.