27 августа 2026 года Google DeepMind объявила о пилоте, который звучит почти как шутка про экзаменатора и шпаргалку: Gemini проверяли так, чтобы сама Google не видела тестовые вопросы, а внешние оценщики не получали доступ к весам модели. Для рынка, где публичные бенчмарки давно превратились в спорт по натаскиванию на тест, это не декоративная новость, а попытка починить саму механику доверия к AI-оценкам. Для русскоязычной IT-аудитории смысл простой: если метод взлетит, закупать, аудировать и сравнивать закрытые модели станет чуть менее похоже на гадание по красивым табличкам.
О новом подходе сообщает The New Stack со ссылкой на Google DeepMind. Компания называет это первым в мире двойным слепым тестированием для закрытой frontier-модели: в пилоте участвовали Google DeepMind, Singapore AI Safety Institute, OpenMined, AVERI и MLCommons. Внутри защищенной среды Google Cloud Confidential Space запускали Gemini Flash Lite и конфиденциальные наборы проверочных промптов. Идея в том, что оценщик не видит модельные веса, Google не видит сами тестовые вопросы, а обе стороны получают криптографически подтверждаемую изоляцию процесса.
Проблема, которую Google пытается решить, называется benchmark contamination, или загрязнение бенчмарков. В переводе на человеческий язык: чем больше датасетов, лидербордов и публичных тестов гуляет по индустрии, тем труднее понять, демонстрирует ли модель реальную способность решать задачу или просто уже встречала похожие вопросы на этапе обучения и донастройки. Для разработчиков это старая боль под новым брендом. Если модель однажды «подглядела» тест, ее высокий балл говорит не столько о качестве reasoning, сколько о хорошем знакомстве с контрольной. А когда речь идет о безопасности, киберрисках, госзакупках или корпоративном комплаенсе, такая косметика уже стоит слишком дорого.
Как это устроено
До сих пор у внешних оценок закрытых моделей была неприятная развилка. Либо независимая организация передает владельцу модели свои секретные промпты и рискует тем, что те однажды утекут в тренировочные или калибровочные контуры. Либо владелец модели отдает веса и внутренности системы аудитору, а это уже удар по IP и безопасности. Google предлагает третий вариант: обе стороны загружают свои чувствительные артефакты в защищенный enclave-контур, где код выполнения и правила вывода результатов можно криптографически проверить. На выход наружу попадают только разрешенные результаты оценки, а не сырые промпты или модельные параметры.
Это важный сдвиг не потому, что кто-то внезапно изобрел приватность, а потому, что в AI-оценках долго держались в основном на оргмерах: zero-logging, договорных ограничениях, доверии к партнерам и аккуратности процессов. Все это работает до первого неудобного вопроса от клиента, регулятора или совета директоров. Технические и криптографические гарантии не отменяют юридические, но меняют разговор. Теперь можно спорить не о том, «обещали ли вы не смотреть на промпты», а о том, достаточно ли надежно построен контур и корректно ли он аттестован.
Отдельно показательно, кто вошел в пилот. MLCommons предоставила для проверки зарезервированное подмножество safety-бенчмарка AILuminate, причем организация отдельно подчеркивает, что этот набор не использовался раньше для моделей Google DeepMind. AVERI и OpenMined участвовали в защищенном вычислительном контуре, а Singapore AI Safety Institute выступил одним из внешних партнеров по независимой проверке. Такой состав важен сам по себе: Google здесь пытается не просто выпустить еще один корпоративный whitepaper в жанре «поверьте нам», а собрать вокруг процедуры тех, чья репутация завязана на независимости и стандартах.
Что это меняет для рынка
Самое интересное в этой истории не результат Gemini как таковой. Google не продает новость цифрами в духе «модель набрала столько-то баллов», и это как раз хороший признак. Главный продукт здесь не score, а способ получения score. Если двойное слепое тестирование станет воспроизводимым стандартом, выиграют не только крупные labs. Корпоративные заказчики смогут строже проверять поставщиков закрытых моделей на своих чувствительных сценариях, не вынося наружу внутренние данные и тестовые наборы. Для банков, телекомов, интеграторов, разработчиков security-решений и компаний с отраслевым регулированием это уже не академическая красота, а потенциальная часть procurement-процесса.
Для разработчиков и платформенных команд вывод тоже прикладной. В ближайшие годы соревнование моделей будет идти не только по качеству ответов и цене за токен, но и по качеству доказательств. Наличие API, SLA и красивой демки больше не закроет вопрос доверия, если модель нельзя убедительно протестировать на закрытых кейсах. Это особенно заметно на фоне бума агентных систем, где ошибка модели уже не ограничивается странным абзацем текста, а может дотянуться до кода, инфраструктуры, бизнес-процессов и чувствительных данных. Чем выше автономность, тем меньше рынок готов верить в «внутренне мы все проверили».
При этом магии тут нет. Двойное слепое тестирование не исправляет плохой бенчмарк, не гарантирует честность метрик и не делает закрытую модель автоматически безопасной. Если тестовый набор слабый, нерелевантный или плохо обслуживается, защищенный enclave лишь надежно сохранит слабый тестовый набор. Но даже с этой оговоркой сдвиг серьезный: индустрия наконец пробует защищать не только модели и данные, но и саму процедуру проверки. И это, пожалуй, более зрелый разговор об AI, чем очередной релиз с бодрой таблицей «на 3% лучше конкурента».
Теперь вопрос в том, останется ли история с Gemini разовой демонстрацией аккуратности или превратится в новый базовый слой для аудита закрытых моделей. Если второе, то через год обсуждать AI без защищенных внешних evals будет примерно так же неловко, как выкатывать прод без логов и мониторинга. Первоисточник пересказа можно посмотреть у .