Открытая модель GLM-5.2 от китайской компании Z.ai продемонстрировала отличные результаты в бенчмарках, обогнав Claude Fable 5 в кодировании с рейтингом 1360 Elo. Этот успех важен, так как GLM-5.2 — единственная модель с открытыми весами в топе, что позволяет разработчикам использовать её без ограничений.
Контекст — Значение открытых весов
Design Arena, платформа для проверки и сравнения моделей искусственного интеллекта, отмечает, что GLM-5.2 поднялась на четыре позиции и увеличила свой рейтинг на 27 пунктов. Это один из лучших результов среди открытых моделей. Так, в категории кода она обошла такие модели, как Claude Fable 5 с её 1350 Elo. Открытые веса модели опубликованы на платформе Hugging Face, что делает её доступной для широкой аудитории.
Бенчмарки и результаты
В бенчмарках Z.ai, GLM-5.2 показала выдающиеся результаты на сложных инженерных задачах. На FrontierSWE, модель уступила Claude Opus 4.8 лишь на 1% (74,4 против 75,1) и обошла GPT-5.5. По сравнению с предыдущей версией GLM-5.1, прирост составляет почти 30% на Terminal-Bench (81,0 против 63,5), и 6% на SWE-bench Pro (62,1 против 58,4).
Разработчики GLM-5.2 оценивают её возможности на уровне между конкурентами Opus 4.7 и 4.8 с сопоставимыми затратами токенов. Однако, полностью догнать закрытые модели, такие как Opus 4.8, ей пока не удалось, что подтверждается результатами на SWE-bench Pro и NL2Repo.
Практическое значение для разработчиков
Для разработчиков это означает, что открытая модель GLM-5.2 представляет собой серьёзную альтернативу закрытым моделям. Она становится доступной для широкого круга пользователей и может быть интегрирована в проекты без дополнительных лицензий. Это также сигнализирует о растущей важности открытых решений в сфере искусственного интеллекта.
Следующий шаг для Z.ai — продолжить улучшение GLM-5.2 и возможно ввести новые функции, которые позволят ей конкурировать с ведущими закрытыми моделями на рынке.