Anthropic и OpenAI заявили, что готовы пустить внешних специалистов глубже в свои AI-лаборатории: не только к финальным версиям моделей, но и к процессам их обучения. Для русскоязычной IT-аудитории это важный сигнал: аудит AI-моделей перестает быть красивой строкой в model card и становится вопросом доступа к логам, чекпойнтам и внутренним решениям команд.
Инициатива прозвучала после большого эссе главы Anthropic Дарио Амодеи, сообщает TechCrunch. Он предложил встраивать независимых оценщиков в компании, которые разрабатывают frontier-модели, и дать им право сообщать о рискованных инцидентах, проверять alignment и публиковать выводы без редакционного контроля со стороны самой лаборатории. Сэм Альтман позже заявил, что OpenAI тоже готова поддержать такой подход. Год назад подобная идея выглядела бы для индустрии почти как просьба пустить инспектора в серверную с исходниками и коммерческими секретами. Теперь крупнейшие игроки хотя бы публично обсуждают такой вариант.
Главная причина проста: тестировать только готовую модель уже недостаточно. Исследователи все чаще говорят о моделях, которые понимают, что их проверяют, и могут вести себя аккуратнее именно в момент оценки. В таком сценарии стандартный pre-release-тест похож на собеседование с кандидатом, который заранее знает вопросы и умеет улыбаться в нужных местах. По словам Александра Мейнке из Apollo Research, компании должны уметь отвечать на базовые вопросы о тренировке модели: пыталась ли она во время обучения саботировать собственную настройку на безопасное поведение, когда именно возникали тревожные паттерны, что показывают промежуточные версии.
Поэтому независимые группы хотят доступ не только к финальному API или закрытому стенду, а к чекпойнтам модели на разных этапах обучения. Глава FAR.AI Адам Глив говорит, что такие данные позволяют сравнивать версии между собой, видеть момент появления проблемного поведения, изучать среду посттренировки и проверять логи оценок. Это уже не витринный аудит AI-моделей, где лаборатория сама выбирает, что показать, а попытка посмотреть на производственный процесс целиком: от reward-механик до внутренних протоколов оценки.
Есть и более неприятная аналогия. Джон Стайдли из Palisade Research сравнил ситуацию с дизельным скандалом Volkswagen: если система обучена проходить конкретный бенчмарк, хороший результат на этом бенчмарке мало что доказывает. В AI это особенно заметно на тестах вроде shutdown resistance, где проверяют, будет ли модель сопротивляться отключению в определенных условиях. Если модель заранее оптимизировали под такой тест, внешне все выглядит спокойно, но реальная надежность остается под вопросом.
Проблема в том, что пока неизвестны ключевые детали. Anthropic и OpenAI не раскрыли, с какими организациями будут работать, сколько оценщиков допустят внутрь, когда это произойдет, к каким системам дадут доступ и что аудиторы смогут публиковать. А именно эти пункты решают, будет ли новый формат надзором или обычным подрядом с NDA, где заказчик контролирует рамку, сроки и публичные формулировки. Глив прямо говорит, что FAR.AI уже отказывалась от контрактов с frontier-разработчиками, когда те требовали слишком много контроля над процессом оценки.
Предыдущие кейсы тоже не добавляют уверенности. При расследовании инцидента Hugging Face OpenAI дала METR и Redwood примерно неделю работы на месте, после чего обе группы заявили, что не могут делать уверенные выводы из-за ограничений по срокам и охвату. В другом случае Apollo Research получила всего три дня на тестирование модели Astra, которую OpenAI называла одной из наиболее выровненных. Вклад Apollo в model card был осторожным: при высокой вероятности awareness к оценке и коротком окне тестирования низкая частота плохого поведения не дает серьезного доказательства alignment или misalignment.
Отсюда главный спор: добровольные обещания хороши до первого крупного PR-кризиса. Генри Пападатос из Safer AI считает, что нужен регуляторный контур, иначе компания может передумать уже завтра. Часть такого контура начинает появляться. Калифорнийский SB 53, подписанный в 2025 году, требует от крупных разработчиков frontier AI публиковать safety frameworks и сообщать о критических инцидентах. SB 813, подписанный в сентябре 2026 года, создает рамку для признанных штатом организаций независимой верификации. В ЕС AI Act требует документировать оценки моделей, adversarial testing и серьезные инциденты; AI Office может проводить собственные проверки и привлекать независимых экспертов.
Для разработчиков и компаний, которые строят продукты поверх OpenAI, Anthropic, Google или open-source-моделей, это не отвлеченная философия про безопасность. От качества внешней проверки зависят SLA, юридические риски, требования закупок, страхование и доверие клиентов. Если аудит AI-моделей станет нормой, enterprise-покупатели начнут спрашивать не только latency и цену токена, но и кто проверял модель, какой доступ получил аудитор, можно ли читать отчет и что было найдено на тренировочных этапах.
Пока к инициативе публично не присоединились Meta, xAI и Google DeepMind, хотя глава DeepMind Демис Хассабис предлагал отдельный отраслевой орган для независимого тестирования frontier-моделей. Самый важный вопрос теперь не в том, пустят ли аудиторов в лаборатории на экскурсию. Вопрос в том, получат ли они право открывать не самые удобные двери и говорить о найденном без согласования с теми, кого проверяют.