22 сентября 2026 г.
Водяной знак SynthID меняет поведение агента: у 6 из 7 моделей сбился вызов инструментов
Lasso Security прогнала BFCL v4 со знаком и без него: вердикты вызова инструментов разошлись в среднем на 6,5%.

Андреа Сипосова из Lasso Security включила водяной знак у phi-4 и прогнала один и тот же бенчмарк дважды.
При температуре 1.0 разошёлся каждый шестой вердикт вызова инструментов: 16,8%. Точность просела на 2,87 пункта, то есть качество ответов держалось, а решения агента менялись.
Водяной знак ставят ради одного вопроса: писала машина или человек. Замер Lasso от 17.09.2026 добавил к нему второй эффект. Знак меняет и то, как агент вызывает инструменты.
Считали на бенчмарке BFCL v4, 21 комбинация «модель × температура». Метрика простая: доля вызовов, где модель со знаком и без него решает по-разному. В среднем разошлись 6,5% вызовов, у Llama-3.1-8B 9,9% при потере точности 0,87 пункта.
Сильнее температуры. Разброс в поведении агента привычно списывают на температуру. На 4 моделях из 6 водяной знак раскачал вызовы сильнее: у gemma-3-27b расхождение 26,0% против 13,5% от подъёма температуры. На Granite-3.2-8B и Llama-3.1-8B разрыв в ту же сторону.
Под prompt injection хуже. У gemma-3-27b доля разошедшихся отказов выросла с 6,0% на голых вредоносных запросах до 23,5%. Сдвинулось и само решение: без знака модель выполняла вредное на 1,0 пункта реже, со знаком на 12,5 пункта чаще. У gemma-3-12b тот же сдвиг мягче, 9,0 пункта.
Повторить у себя. Тот же знак включается в Hugging Face transformers из коробки: SynthIDTextWatermarkingConfig(keys=[...], ngram_len=5) уезжает в model.generate параметром watermarking_config. На этом переключателе и собирается парный прогон своего агента со знаком и без, на одних и тех же входах.
У Lasso в конфиге 30 tournament-слоёв, sampling table 2^16, история контекста 1024, температуры 0.001, 0.7 и 1.0. Отказы мерили на 200 вредоносных поведениях HarmBench и 100 безобидных контролях JailbreakBench.
Anthropic 14.08.2026 объявила, что будущие модели Claude ставят водяной знак на текстовые выводы под требования EU AI Act. Для кода удар слабее по построению: компания пишет, что код размечается заметно меньше другого текста, а знак ложится туда, где есть свободный выбор слов, например в комментарии.
Тот же парный замер на закрытых моделях не собрать: API детекции Anthropic открыт только регуляторам, медиа, фактчекерам и исследователям.
Первоисточник
