Модель GLM-5.2 от китайской компании Z.ai показала результат на уровне Mythos в тесте по поиску уязвимостей — 39% по метрике F1. В то время как Claude Code и прочие закрытые модели остаются на уровне 32% и ниже, данный факт стал поводом для дискуссий о конкурентоспособности открытых решений против закрытых моделей.
Контекст и предыстория
Запуск GLM-5.2 совпал с тем, что США ограничили доступ к передовым моделям вроде Mythos для иностранных команд, что фактически создало конкурентное преимущество для открытых решений. Исследование, проведенное компанией Semgrep, проверяет, насколько точно модель определяет IDOR-уязвимости, когда пользователь может получить доступ к чужим данным из-за недостаточной проверки прав. Однако это сравнение не отражает полного масштаба возможностей Mythos в более сложных условиях.
Детали и споры
Хотя GLM-5.2 показала сильные результаты в одном конкретном тесте, это не даёт полной картины. Экспортные ограничения на Mythos убирают возможность честного сравнения. К тому же Гильермо Раух, создатель фреймворка Next.js, и другие эксперты выражают сомнения в достоверности выводов, основанных лишь на одной задаче. Один из исследователей даже предложил пари 100 к 1, что на тестовом полигоне GLM-5.2 уступит не только Mythos, но и GPT-5.5.
Проблема в том, что Semgrep изучает только один аспект — уязвимость в отдельно взятом коде, в то время как запросы к более сложным системам требуют иной оценки. Киберполигоны, такие как британский AISI, оценивают модели в условиях, приближенных к реальным, и различия могут быть значительно большими.
Практические выводы для разработчиков
Для российских команд сфера кибербезопасности остается весьма актуальной. Напряжённая ситуация с доступом к передовым ИИ-моделям может заставить рассмотреть более доступные решения, такие как GLM-5.2, особенно когда речь идет о соблюдении норм безопасности. Тем не менее, важно помнить о лимитах открытых решений и проводить глубокие тестирования перед принятием решений об их внедрении.
Дальнейшее развитие крайне важно: нужна пауза для оценки возможностей и ограничений GLM-5.2 на более широком спектре задач, а также анализ потенциальных последствий для рынка кибербезопасности в СНГ.