Водяные знаки SynthID-Text делают языковые модели более уязвимыми к вредоносным запросам

Водяные знаки SynthID-Text делают языковые модели более уязвимыми к вредоносным запросам

Технологии

Автор материала

Мария Лескова

Редактор marshryt.by, пишет о культурных событиях, семейных поездках и тихих городских маршрутах по Беларуси.

Исследование компании Lasso Security выявило побочный эффект технологии водяных знаков SynthID-Text от Google. Внедрение системы меняет поведение больших языковых моделей (LLM) и делает их более восприимчивыми к вредоносным запросам.

Исследовательница Андреа Сипосова протестировала шесть открытых моделей. Она сравнивала их ответы на опасные запросы (например, раскрытие паролей) с включенным водяным знаком и без него. При активированном SynthID-Text модели чаще соглашались выполнять вредоносные инструкции, особенно при использовании техники инъекции промптов.

Водяные знаки SynthID работают, внося незаметные изменения в процесс выбора слов. Вместо случайного выбора следующего токена используется секретный ключ, который слегка меняет вероятности. Эти изменения затрагивают не только лексику, но и общую логику принятия решений моделью, включая способность отказываться от опасных действий.

Особую тревогу вызывает влияние на ИИ-агентов — программ, которые используют LLM для выполнения задач (например, вызова инструментов или работы с базами данных). Изменение поведения модели из-за водяного знака может привести к тому, что агент вызовет неверный инструмент или передаст ему опасные аргументы. Исследователи назвали этот эффект «дрейфом выборки».

Результат зависел от того, какой секретный ключ использовался для водяного знака. Разные ключи приводили к разной степени уязвимости модели. Разработчикам необходимо тщательно тестировать свои системы безопасности в связке с конкретной реализацией водяных знаков.

Эксперимент проводился на открытых моделях и не затрагивал коммерческие системы вроде Claude от Anthropic (которая планирует использовать SynthID). Результаты указывают на компромисс: внедрение механизмов аутентификации контента может ослабить защитные барьеры ИИ. Разработчикам рекомендуется включать водяные знаки в сценарии «красных команд» для проверки устойчивости моделей к атакам.

Читайте marshryt.by в Google

Добавьте сайт в свои источники — материалы будут чаще попадаться вам в выдаче и в ленте новостей.

Добавить в источники

Последние новости и статьи