27 августа 2026 г.
Gemini впервые проверили вслепую: оценщик не увидел модель, Google не увидела вопросы
Gemini прогнали в шифрованном анклаве, где модель закрыта от оценщика, а вопросы бенчмарка закрыты от самой Google.
Копия Gemini впервые оказалась у внешнего оценщика в открытом виде. Заглянуть в неё не смог никто, включая самого оценщика.
Спор идёт не про одну модель, а про то, чему верить в рейтингах. Xu с соавторами в 2024 году нашли следы бенчмарков примерно у половины из 31 проверенной модели: модель отвечает на вопросы, которые уже видела. Работа «The Leaderboard Illusion» (2025) описала лабораторию, которая прогнала на Chatbot Arena 27 своих закрытых вариантов и опубликовала результат лучшего.
Как это устроено. Обе стороны встречаются в GPU-анклаве: это машина в облаке, где память зашифрована и внутрь не заглядывает никто. Одну такую машину поднимает и оплачивает одна из сторон, дальше каждая заливает своё через клиент PySyft из обычного Python. Код запускается, только когда его одобрили обе стороны.
Хозяин анклава может ровно одно — выключить машину. Вычисления в ней дорожают меньше чем на 5%, посчитали в отчёте пилота (27.08.2026).
Вопросы взяли из резервной части бенчмарка MLCommons AILuminate, которую не прогоняла ещё ни одна модель: кибератаки, язык вражды, самоповреждение, выманивание сценариев насилия. Шифровала их, расшифровывала внутри анклава и оценивала ответы независимая AVERI.
Прогонов было два. Второй сделали с сингапурским институтом ИИ-безопасности, на закрытом наборе вопросов про местный контекст.
Раньше так не умели. В 2024 году OpenMined с британским институтом ИИ-безопасности и Anthropic загнали в анклав GPT-2 и пять строк тестового датасета. Теперь внутри оказались закрытая топовая модель и закрытый бенчмарк целиком.
Повторить процедуру можно уже сейчас: код PySyft открыт и лежит на GitHub, а в описании репозитория есть пошаговый туториал именно про двойной слепой прогон в анклаве.
Первоисточник