Агент Sai от Simular показал 73% успешных выполнений в OSWorld 2.0 — бенчмарке на 108 длинных рабочих задач, где один сценарий у человека может занимать больше часа. Для рынка AI-агентов это не просто очередная табличка с процентами: агент Sai вышел вперед в тесте, который проверяет не чат-ответы, а рутинную офисную работу на реальном десктопе и в вебе.
Об этом сообщает The New Stack. По данным издания, результат Sai опубликован 27 августа 2026 года и, по версии Simular, опережает GPT-5.6 Sol с 62,57% и Opus 5 с 70,57%. Компания отдельно подчеркивает еще один аргумент, который для бизнеса звучит не менее убедительно, чем сам процент: нужный результат, как утверждает Simular, удалось получить примерно за две трети стоимости конкурирующих систем.
Важно, что речь идет не о красивом демо на пять минут. OSWorld 2.0 запустили 26 июня 2026 года, а 8 августа его обновили. Это бенчмарк XLANG Lab из HKU NLP Group при Гонконгском университете, и он устроен заметно жестче, чем первая версия. Если OSWorld 1.0 проверял сравнительно короткие десктопные сценарии, то в 2.0 акцент сместили на длинные, составные и неприятно реалистичные задачи: собрать данные из нескольких источников, отреагировать на изменения по ходу сценария, пройти по инструкции без творческой самодеятельности, разобраться с противоречивой информацией. То есть ровно тот пласт работы, где компании мечтают заменить бесконечное «открой вкладку, проверь письмо, сверь цифры, занеси в форму» на автоматизацию.
Sai здесь интересен не только итоговым баллом, но и тем, как он вообще устроен. Simular позиционирует его как computer agent, который работает с полноценными десктопными приложениями и веб-страницами, умеет вызывать API и писать код. Это важная деталь: рынок уже наелся агентами, которые уверенно чувствуют себя только внутри браузера или в заранее подготовленном tool-calling-контуре. А когда задача упирается в скан документа на рабочем столе, в старое настольное приложение, в неожиданный попап или в не самую дружелюбную форму на сайте, магия часто заканчивается. В комментарии The New Stack сооснователь и CTO Simular Цзячэнь Ян прямо бьет по этой болевой точке: по его логике, агент для повседневной работы не должен стоить как демонстрация инженерной мощи, заточенная под покорение абстрактных математических вершин.
Почему этот результат обсуждают
У Simular на руках сильный нарратив: компания не просто гонится за максимальным качеством любой ценой, а пытается улучшить соотношение «результат к стоимости». Для корпоративного внедрения это звучит куда практичнее, чем привычная гонка моделей за очередной рекорд. По словам Simular, Sai добивается этого за счет нейросимвольного подхода. Если убрать маркетинговый слой, идея понятная: там, где чистая нейросеть каждый раз заново «думает» дорогими токенами, часть решенной работы можно закрепить в более детерминированной форме и переиспользовать. В статье это объясняется на простом примере: сотый инвойс не должен обходиться компании так же дорого, как первый.
С технической стороны Simular говорит о нескольких приемах экономии. Во-первых, Sai делает в среднем примерно в 1,5 раза меньше model calls, чем «чистые» модели, потому что берет больше действий на один ход. Во-вторых, агент ограничивает размер входного контекста через адаптивную суммаризацию, чтобы не раздувать prompt по мере выполнения длинной задачи. В-третьих, для разных подзадач он оркестрирует специализированные модели и интерфейсы: отдельно на локализацию элементов UI, отдельно на рассуждение, отдельно на проверку результата. На бумаге это выглядит как взрослая инженерия вокруг агента, а не просто «давайте дадим LLM курсор и посмотрим, что будет».
Показательные примеры из статьи тоже выбраны не случайно. Один из тестов — Chrome Dino, где агентам нужно не просто кликать по экрану, а добиться целевого результата в повторяющемся real-time-сценарии. По описанию Simular, Sai превратил эту задачу в программную: измерил линию земли, скорость препятствий и собственную задержку ввода по сырым пикселям, написал цикл управления и выполнил его внутри виртуальной машины одним вызовом. Другой пример — Task 28, бронирование вакцинации: письмо с требованиями по прививкам, скан карты вакцинации на рабочем столе и сайт записи с ограничениями по цене, расстоянию и дате. Это уже не игрушка, а типичный workflow из мира «операционки», где ценится не красота рассуждений, а способность дойти до конца без глупой ошибки.
Что это значит для рынка AI-агентов
Самый интересный вопрос здесь не в том, побил ли Sai очередного конкурента на несколько процентных пунктов. Куда важнее другое: OSWorld 2.0 постепенно сдвигает разговор об агентах из жанра «посмотрите, как модель умеет» в жанр «сколько часов рутинной работы можно доверить системе и во сколько это обойдется». Для разработчиков это означает рост спроса на инфраструктуру вокруг агентов: наблюдаемость, трассировку действий, контроль состояния среды, memory management, безопасный доступ к приложениям и нормальные human-in-the-loop checkpoints. Для продактов и IT-директоров это сигнал, что сравнивать агентные продукты только по именам базовых моделей уже бессмысленно. Архитектура исполнения, стоимость одного завершенного сценария и устойчивость на длинных задачах становятся важнее, чем громкость бренда.
Именно поэтому в реакции на Sai звучит не только восторг. The New Stack приводит мнение исследователя Сантьяго Вальдаррамы, который обращает внимание на практическую ценность полного десктопного режима: такой агент может работать там, где обычная браузерная автоматизация упирается в ограничения. Но рядом есть и более осторожные оценки. Балджиндер Лалли пишет, что эффектные демо еще не равны надежности в продакшене, а Джаханзаиб А. напоминает про старую истину агентного рынка: без наблюдаемости и страховочных механизмов команды будут дебажить провалы вслепую. Это, пожалуй, и есть самая взрослая трактовка новости: 73% — впечатляющий результат, но путь от сильного бенчмарка до скучной, предсказуемой и массовой автоматизации все еще проходит через инженерную дисциплину, а не через аплодисменты на запуске.
Если тренд сохранится, рынок AI-агентов в ближайшие кварталы будут делить не те, кто громче всех обещает «цифрового сотрудника», а те, кто сможет доказать три вещи сразу: агент доводит длинную задачу до конца, делает это дешевле человека и не превращает инфраструктуру компании в лотерею. В этом смысле кейс Sai интересен не только самой цифрой 73%, но и тем, что спор вокруг агентов все заметнее смещается от модели как таковой к качеству всей исполнительной системы. Подробнее об этом пишет .