17 сентября 2026 г.
Claude готовят к скрытой метке: в тестах SynthID изменились 6,5% решений при tool calling
17 сентября 2026 года Lasso Security зафиксировала 6,5% изменений в tool calling при watermarking на 21 сочетании модели и температуры. Anthropic объяснила, как будущие модели Claude будут помечать текст водяным знаком для соблюдения требований EU AI Act. Компания заявила, что вариант SynthID-Text не добавит токены и не повысит цену использования модели.

С 9 апреля 2025 года production-grade SynthID Text доступен в Hugging Face Transformers 4.46.0 и новее. Дообучать модель не нужно: достаточно передать watermarking configuration в .generate() и включить SynthID Text logits processor. Anthropic теперь заявляет, что будущие Claude будут использовать его вариант.
В конфигурации обязательны keys и ngram_len, Google рекомендует ngram_len=5. Для sampling table Google рекомендует размер не меньше 2^16, а увеличение таблицы требует больше памяти во время inference.
Цена метки. Lasso Security проверила немодифицированный SynthIDTextWatermarkLogitsProcessor с 30 Tournament layers, ngram length 5, sampling table 2^16 и context history 1024. Watermarking снизил точность tool calling у 6 из 7 моделей, статистически значимое снижение было у 4.
При T=1.0 у phi-4 изменились 16,8% решений tool calling, а точность упала на 2,87 п.п. У Llama-3.1-8B изменились 9,9% решений, точность снизилась на 0,87 п.п.
Ключ меняет риск. У gemma-3-27b при T=0.001 доля смены отказа выросла с 6,0 до 23,5% на вредных запросах с prompt injection, а итоговое изменение соблюдения запрета сменилось с −1,0 до +12,5 п.п. У Llama-3.1-8B один ключ повысил успешность атаки на 3,5 п.п., ещё 10 ключей дали в среднем +4,4 п.п. с диапазоном от −4,5 до +14,5 п.п.
Следующий рубеж этой истории — выход будущих моделей Claude с вариантом SynthID-Text.
Первоисточник
