AI И НЕЙРОСЕТИ

AI-оценщик: новая дорогая роль на стыке разработки и безопасности

$687 тыс. в год предлагают за роли AI-оценщика: разработчикам придется проверять не только модели, но и пайплайны их обучения.

✍️ Редакция iTech News | 17.09.2026 | ⏱ 5 мин | Источник: The New Stack
🧬

AI-оценщик может стать одной из самых дорогих и нервных профессий в новой AI-индустрии: у METR верхняя планка зарплаты для таких ролей доходит примерно до $687 тыс. в год. Речь не о тестировщике чат-ботов, а о специалисте, которому дают почти внутренний доступ к frontier-моделям, тренировочным пайплайнам и практикам безопасности. Для русскоязычных разработчиков это сигнал: экспертиза в ML, безопасности и software engineering начинает превращаться в отдельную карьерную траекторию.

Идею резко вывел в публичное поле CEO Anthropic Дарио Амодеи, сообщает The New Stack. В эссе, опубликованном на выходных 12–13 сентября 2026 года, он предложил компаниям, которые строят передовые AI-модели, допускать внешние команды оценщиков к своим системам на условиях, близких к доступу сотрудников. Их задача — проверять соблюдение заявленных safety-практик, фиксировать инциденты и оценивать не только готовые модели, но и процессы обучения.

Амодеи сравнивает такую роль с встроенными надзорными специалистами в банковской сфере. Логика понятна: если модель уже умеет действовать как агент, писать код, искать уязвимости и принимать многошаговые решения, смотреть только на красивую демоверсию поздно. Проверять надо то, как система обучалась, где ломалась на тестах, какие опасные способности проявляла по дороге и насколько команда честно документировала неприятные результаты.

Повод для дискуссии был не академическим. Бывший специалист по pretraining в OpenAI и Anthropic Джейкоб Коксон 8 сентября опубликовал тред в X, который, по данным The New Stack, набрал 172 млн просмотров. Он заявил, что часть людей внутри индустрии всерьез считает риск катастрофического сценария к концу десятилетия реальным. Формулировки у Коксона мрачные, но реакция рынка показала: это уже не разговор в закрытом чате исследователей безопасности.

К идее Амодеи публично присоединились несколько тяжеловесов. CEO OpenAI Сэм Альтман написал, что согласен с Дарио. Илон Маск тоже поддержал тезис. Демис Хассабис из Google DeepMind назвал направление верным. Марк Цукерберг, со своей стороны, заявил, что Meta Superintelligence Labs уже использует независимых оценщиков и что отрасли нужен более широкий и разнообразный рынок таких специалистов. Когда конкуренты такого масштаба синхронно говорят о замедлении и проверках, хочется спросить: это зрелость или новый способ договориться о правилах гонки?

Скептики уже задают этот вопрос вслух. Глава Palo Alto Networks Никеш Арора написал, что желание замедлиться выглядит странно в условиях жесткой конкуренции, но если замедляется вся система, правила победы остаются одинаковыми для всех. Для стартапов это особенно чувствительная тема: обязательные проверки могут повысить доверие к продуктам, но легко станут барьером входа, если стандарты напишут крупнейшие лаборатории под собственные ресурсы.

Деньги в этой истории тоже важны. METR, некоммерческая организация, которая занимается оценкой рисков advanced AI, ищет специалистов с редким набором качеств: самостоятельность, умение работать в неопределенности, threat modeling для сценариев потери контроля, способность разбирать safety case без готовой инструкции. У Mercor похожие роли оплачиваются скромнее, но все еще заметно — примерно $180–300 тыс. в год. Там от кандидатов ждут степень Ph.D. или M.S. и опыт в computer science, electrical engineering, econometrics или другой STEM-области, связанной с ML и оценкой моделей.

При этом диплом не выглядит единственным билетом. CTO Komodo Кадан Штадельманн, который занимается AI security consulting, говорит, что в реальной работе доступ у оценщика каждый раз разный: где-то контракты ограничивают его узкой зоной, где-то дают почти полный обзор. Он проверяет поведение агентов в реалистичных условиях, смотрит на цепочки рассуждений и промпты, оценивает автономность системы и время выполнения задач. Главное — не просто найти странное поведение модели, а проверить, выполняет ли команда собственные обещания по безопасности.

Для разработчиков это означает довольно практичный сдвиг. Рынку нужны люди, которые умеют читать код, понимать ML-инфраструктуру, проектировать эксперименты, разбираться в security-модели и при этом не теряться на встрече с исследователями, которые уверены в своем графике запуска. AI-оценщик должен быть достаточно техническим, чтобы спорить по существу, и достаточно независимым, чтобы сказать перед релизом: «я не убежден». Это не самая уютная позиция в комнате, зато одна из немногих, где инженерное суждение напрямую влияет на выпуск frontier-модели.

CEO Indie Me Дион Джонсон формулирует проблему жестче: если оценщик может поднимать тревогу только тогда, когда это удобно компании, независимого надзора не получилось. Нужен доступ к неудобным данным: провалам на тестах, неожиданным паттернам поведения, спорным решениям во время обучения, внутренним зонам неопределенности. Иначе индустрия получит еще один слой процесса — аккуратный, дорогой и бесполезный в момент, когда система поведет себя не по сценарию.

Для российского и русскоязычного IT-рынка вывод не в том, что завтра всем надо срочно переименоваться в AI-оценщиков. Но тем, кто уже работает с ML, безопасностью, платформенной инженерией или DevOps для AI-систем, стоит присмотреться к набору навыков: оценка моделей, red teaming, анализ агентного поведения, безопасность тренировочных пайплайнов, воспроизводимые эксперименты, документация рисков. Чем больше бизнес будет встраивать AI-агентов в реальные процессы, тем чаще ему понадобится человек, который проверяет не презентацию, а систему целиком.

Профессия AI-оценщик пока только собирается из кусков: ML-инженерии, аудита, AppSec, исследовательской строгости и неприятной привычки задавать вопросы перед дедлайном. Дальше главный спор будет не о названии роли, а о власти: сможет ли такой специалист остановить запуск, если найдет риск, или его отчет просто ляжет в папку с красивым названием. Подробности и первичный контекст доступны в материале The New Stack.

Поделиться: Telegram X LinkedIn