18 сентября 2026 г.
Водяной знак меняет поведение ИИ: на BFCL точность упала у большинства моделей
17 сентября 2026 года Lasso проверила SynthID-Text на BFCL, тесте вызова инструментов: маркировка снизила точность у 6 из 7 моделей. На 1150 задачах при T=1.0 у phi-4 изменились 16,8% решений, а чистая точность упала на 2,87 п.п.; у Llama-3.1-8B эти показатели составили 9,9% и 0,87 п.п.

Раньше Google DeepMind проверяла водяные знаки на почти 20 млн ответов Gemini: в эксперименте 23 октября 2024 года разница с ответами без маркировки составила 0,01% по положительным и 0,02% по отрицательным оценкам, обе оценки были статистически незначимы. Теперь Lasso получила другой сигнал в задачах с инструментами и prompt injection: на gemma-3-27b при T=0,001 churn вырос с 6,0% до 23,5%, а net compliance change сдвинулся с −1,0 до +12,5 п.п.
Ключ меняет картину. На Llama-3.1-8B один ключ повысил долю успешных атак на 3,5 п.п., а 10 других дали в среднем +4,4 п.п. с разбросом от −4,5 до +14,5 п.п.
В документации Google AI от 9 апреля 2025 года SynthID-Text не требует дообучения: нужны Transformers v4.46.0+, SynthIDTextWatermarkingConfig, keys и ngram_len, после чего конфигурацию передают в model.generate(). Lasso тестировала non-distortionary SynthID-Text с 30 Tournament layers, n-gram length 5, sampling table 2^16 и context history 1024; Google рекомендует ngram_len=5 и sampling_table_size не меньше 2^16.
Решение для практики. После включения маркировки Lasso советует заново прогонять benchmark, safety evaluation и red-teaming, а при смене ключа или конфигурации повторять эти проверки.
Для оценки моделей после включения watermarking ключ и конфигурация становятся частью тестового стенда.
Первоисточник
