Replit в очередной раз сильнее конкурентов: модель Opus 4.8 от компании заняла первое место в новом бенчмарке ViBench, показав 87,8% в задаче по созданию приложений с нуля. Это важный шаг вперёд, поскольку бенчмарк оценивает не только качество кода, но и полную работоспособность приложений — с базой данных, авторизацией и пользовательским интерфейсом.
Конкуренция на рынке ИИ
Opus 4.8 обошёл OpenAI с GPT-5.5, который показал 86,5%. ViBench был разработан командой Replit в сотрудничестве с Georgian AI Lab и Университетом Карнеги — Меллона. В отличие от других тестов, таких как SWE-bench, новый бенчмарк оценивает способность ИИ создавать полнофункциональное приложение, а не просто дописывать код или исправлять ошибки.
Как работает ViBench
Метрика Pass@1 определяет долю приложений, работающих без ошибок с первой попытки. В свежем прогоне, Opus 4.8 и GPT-5.5 вступили в непосредственное соперничество, с меньшим, чем 2% разрывом. Третье место в рейтинге занял GLM 5.1 с 66,2%. Замыкает список MiniMax M2.7 с результатом 17,6%, но эта модель значительно дешевле: её стоимость за прогон составляет всего 14 центов, в то время как лидеры стоят около двух долларов.
Значение для разработчиков
Для ИТ-команд в России и СНГ этот рейтинг может оказать значительное влияние на выбор инструментов для разработки. Высокая эффективность Opus 4.8 дает надежду на улучшение производительности проектирования программного обеспечения и возможность быстрее выводить продукты на рынок. Предпочтение моделей, которые могут создавать приложения с нуля, становится критическим фактором конкурентоспособности.