
Стандартное создание текста и водяных знаков.
Кредит: Лассо Секьюрити.
Стандартное создание текста и водяных знаков.
Кредит: Лассо Секьюрити.
Ключевой особенностью SynthID является так называемая расовая выборка. Подобно спортивной игре, SynthID оценивает большое количество кандидатов на следующий символ слова. Он использует секретный ключ для присвоения оценки вероятности. Пара персонажей соревнуются в раунде. Тот, у кого больше скрытых очков, побеждает и переходит в следующий раунд. Процесс продолжается до тех пор, пока не будет определен последний победивший персонаж. Более подробную информацию о выборе расы можно найти здесь и здесь.
Сипосова протестировала конфигурацию SynthID-Text без искажений с помощью Hugging Face SynthIDTextWatermarkLogitsProcessor без изменений. Он присвоил веса ущерба шести открытым моделям и сравнил ответы при использовании водяных знаков и без них. Эксперименты показали, что водяные знаки изменили реакцию на вредоносные запросы, особенно когда они были сделаны с использованием методов мгновенного внедрения.
«Водяные знаки меняют поведение отклонения вредоносных запросов, но его эффект усиливается, когда те же запросы объединяются с техникой внедрения», — написала Сипосова. «В некоторых моделях водяной знак повышает вероятность того, что модель ответит на вредоносные запросы, которые в противном случае она бы отклонила».
Изменения имеют важные последствия для безопасности, поскольку влияют не только на ответы LLM, но и на последующие действия агентов ИИ, которые полагаются на модель.
«На уровне модели это может изменить поведение безопасности, включая то, отклоняет ли модель вредоносный запрос и сохраняется ли это отклонение при немедленном внедрении», — пишет исследователь. «На уровне агента одни и те же выбранные токены могут определять, какой инструмент вызывается и какие аргументы ему передаются. Мгновенная инъекция соединяет эти две настройки, потому что ослабленное отклонение более эффективно, когда модель может действовать с помощью инструментов. Следовательно, такая процедура нанесения водяных знаков может влиять как на то, что говорит модель, так и на то, что она делает. Мы называем этот поведенческий эффект дрейфом выборки».
Также интересно: примеры ответов различались в зависимости от того, какой секретный ключ использовался.

Водяные знаки меняли правильность отдельных вызовов инструментов, иногда намного больше, чем общий уровень точности.
Кредит: Лассо Секьюрити.
Водяные знаки меняли правильность отдельных вызовов инструментов, иногда намного больше, чем общий уровень точности.
Кредит: Лассо Секьюрити.

Это число указывает типы изменений, внесенных в инструмент водяным знаком. Вертикальные линии показывают точность без водяных знаков, а полосы показывают изменения при применении водяных знаков. Оранжевый цвет представляет изменение от исправления к ошибке, а синий — изменение от ошибки к исправлению.
Кредит: Лассо Секьюрити.
Это число указывает типы изменений, внесенных в инструмент водяным знаком. Вертикальные линии показывают точность без водяных знаков, а полосы показывают изменения при применении водяных знаков. Оранжевый цвет представляет изменение от исправления к ошибке, а синий — изменение от ошибки к исправлению.
Кредит: Лассо Секьюрити.

Влияние смены ключа на поведение модели. Каждая точка представляет собой ключ. Точки справа от нуля указывают на более вредную совместимость по сравнению с водяным знаком; направление влево указывает на низкую степень соответствия. Оранжевые точки представляют 10 дополнительных ключей, а черный ромб — ключ, использованный в основном эксперименте (ключи выбираются случайным образом).
Кредит: Лассо Секьюрити.
Влияние смены ключа на поведение модели. Каждая точка представляет собой ключ. Точки справа от нуля указывают на более вредоносную совместимость по сравнению с водяным знаком; направление влево указывает на низкую степень соответствия. Оранжевые точки представляют 10 дополнительных ключей, а черный ромб представляет ключ, использованный в основном эксперименте (случайно выбранные ключи).
Кредит: Лассо Секьюрити.
Существуют ограничения в исследовании. Он не проверяет, как меняются ответы модели Клода под водяным знаком. Вместо этого он тестирует полдюжины моделей с открытым весом, поэтому у исследователя есть доступ к набору персонажей, которых можно включать и выключать при выборе расы, сохраняя при этом другие настройки. В ходе экспериментов также проверялась реализация SynthID-Text Hugging Face, а не конкретная реализация моделей Claude.
Однако результаты показывают, что по крайней мере некоторые формы использования водяных знаков могут повлиять на безопасность модели и агента. Для хакерских учений красной команды важно протестировать свои платформы, чтобы убедиться, что они работают должным образом при развертывании SynthID.









Leave a Reply