КИБЕРБЕЗОПАСНОСТЬ

GLM-5.2 почти догнала лидеров ИИ, но отстала по безопасности

GLM-5.2 от Z.ai приблизилась к моделям OpenAI и Anthropic, но в тестах SaferAI не отказала ни в одной опасной кибер- или био-задаче из набора проверки.

✍️ Редакция iTech News | 05.08.2026 | ⏱ 5 мин | Источник: TechCrunch
💀

GLM-5.2 от китайской Z.ai, по оценке SaferAI, отстает от передовых ИИ-систем всего на несколько месяцев по кибер- и биовозможностям. Проблема в том, что open-weight модели уже подбираются к этому уровню заметно быстрее, чем к ним успевают прикрутить защиту от злоупотреблений. Для разработчиков и компаний это означает простой, но неприятный сдвиг: мощный инструмент все чаще можно не только купить по API, но и запустить у себя без внешнего рубильника.

По данным TechCrunch, некоммерческая организация SaferAI проверила GLM-5.2 через публичный API Z.ai и получила результат, который сложно назвать успокаивающим: модель не отказалась ни от одной задачи на наступательные кибероперации и ни от одного биологического сценария двойного назначения. Для сравнения, Claude Opus 4.7 от Anthropic, как утверждает SaferAI, отклонял такие запросы настолько последовательно, что на нем не удалось завершить тест CyberGym. Этот бенчмарк оценивает именно кибервозможности модели, а не умение бодро поддерживать small talk.

Сами open-weight модели важны не только из-за Z.ai. Спор вокруг них долго сводился к вопросу, могут ли они вообще догнать закрытых лидеров по качеству. Теперь формулировка меняется: догоняют, и довольно быстро, поэтому обсуждать приходится уже не статус open source, а то, кто отвечает за риски после публикации весов. Пока модель живет внутри API, разработчик хотя бы теоретически может навесить классификаторы, дообучение на отказах и внешние фильтры. После релиза весов этот набор превращается в рекомендацию, а не в ограничение: модель можно развернуть на собственной инфраструктуре, переписать системные промпты, дообучить под нужный сценарий и снять почти любые предохранители.

При этом у закрытых моделей защиты тоже не выглядят железобетоном. В материале упоминается исследование Far.ai, где у систем уровня xAI Grok 4.5 и Google DeepMind Gemini 3.1 Pro нашли сотни универсальных jailbreak-приемов. Обычно они срабатывают не за счет одной хитрой фразы, а за счет комбинации ролеплея, подмены авторитета, фальшивой истории диалога и добивающих follow-up-запросов. Но у закрытых моделей хотя бы есть слой инфраструктурного контроля: если волна злоупотреблений стала заметной, вендор может централизованно подкрутить поведение сервиса. С открытыми весами такой фокус уже не проходит, потому что каждый запускает модель в своей сборке и по своим правилам.

Исполнительный директор SaferAI Генри Пападатос предлагает смотреть на проблему без романтики про «доступность для всех». По его логике, доступными надо делать полезные функции, а не опасные способности в комплекте. Один из рабочих подходов — фильтрация данных еще на этапе pretraining: убрать из корпуса заведомо вредные материалы, особенно в биологии, и не тащить их в модель с первого дня. Исследования, на которые ссылается собеседник TechCrunch, показывают, что это может снизить опасные биологические знания без заметного ущерба для общей производительности. С кибербезопасностью все хуже: очень трудно натренировать сильную модель для программирования, которая при этом не будет сильной в поиске уязвимостей и построении атакующих цепочек. А код, как ни крути, остается одним из самых коммерчески важных сценариев для генеративного ИИ. Не случайно Anthropic уже пробует более узкие ограничения: например, Opus 5 может искать уязвимости в нескомпилированном исходном коде, но не в скомпилированном ПО.

На этом фоне к Z.ai у SaferAI отдельный набор вопросов. По данным отчета, компания не опубликовала ни рамку безопасности, ни обязательства по предрелизному тестированию, ни публичную оценку рисков для GLM-5.2. Это особенно заметно на фоне политического контекста: на Всемирной конференции по ИИ в прошлом месяце Си Цзиньпин отдельно подчеркивал важность open-weight подхода и необходимость держать ИИ под жестким человеческим контролем. Исследователь китайской AI-политики Грэм Вебстер при этом замечает, что китайское регулирование исторически сильнее сфокусировано на политически чувствительном контенте, дезинформации и социальной стабильности, чем на катастрофических рисках вроде наступательных киберопераций или помощи в биоинженерии. Плюс китайские компании часто координируются с регуляторами не публично, поэтому со стороны сложно понять, что именно они тестируют до релиза, а что предпочитают не выносить на витрину.

Для русскоязычной IT-аудитории здесь есть еще один практический слой. Многие команды смотрят на open-weight модели как на компромисс между качеством и контролем: можно развернуть inference у себя, не отдавать код и данные во внешний API, вписаться во внутренние правила безопасности и не зависеть от капризов зарубежного вендора. На бумаге это выглядит как взрослая стратегия. На практике вместе с автономией компания получает и весь пакет рисков: если такой инструмент помогает разработчику быстрее ревьюить код и искать слабые места, он почти наверняка поможет и злоумышленнику быстрее собирать эксплойты, фишинговые сценарии или инструкции по обходу защит.

Для рынка тут нет удобного ответа. Сторонники открытого подхода напоминают, что open-weight модели полезны и для обороны: их можно локально гонять по внутреннему коду, искать уязвимости и готовиться к будущим атакам без ожидания очередного апдейта от облачного вендора. Скептики отвечают, что атакующие почти всегда адаптируются быстрее защитников: вымогательская группа меняет тактику за неделю, больница или банк — хорошо если за квартал. Поэтому следующий раунд конкуренции в ИИ, похоже, будет идти не только за качество модели, но и за то, кто первым научится отделять полезную мощность от опасной до того, как веса разойдутся по всему миру. Первоисточник с деталями оценки и комментариями участников дискуссии — TechCrunch.

Поделиться: Telegram X LinkedIn