На июньской конференции Build Microsoft снова продавала не приложение, а новую модель вычислений: агент как базовую единицу работы с софтом. На этом фоне агентный рантайм внезапно стал важнее красивого чат-окна, а спор вокруг OpenClaw и Hermes свелся к неприятно практичному вопросу: кто именно держит руки на руле. Как пишет The New Stack, обе системы сходятся в определении агента, но расходятся в том, кто должен задавать правила его работы.
Это не академическая придирка и не спор о терминологии для очередного слайда. Для разработчиков, продактов и IT-руководителей разница упирается в архитектуру, риски и деньги. Если агент понимается как связка модели, инструментов, памяти и права действовать от имени пользователя, то дальше начинается самое интересное: этот контур контролирует сам пользователь, открытая среда исполнения или вендорская платформа, которая выдает доступ по своим правилам.
Судя по разбору The New Stack, OpenClaw и Hermes исходят из одной и той же базовой посылки: агент уже нельзя сводить к чат-боту, который красиво отвечает на вопросы. Речь идет о системе, которая умеет планировать шаги, ходить в инструменты, держать контекст между сессиями и выполнять действия в рабочем окружении. Иными словами, агент здесь ближе к операционному слою поверх сервисов, чем к еще одной вкладке в браузере. Именно поэтому тезис Сатьи Наделлы о сдвиге от приложений к агентам так быстро подхватили не только маркетологи, но и инженеры: если платформа меняется, то меняется и точка контроля.
Дальше начинаются расхождения. В логике OpenClaw контроль тяготеет к пользователю и его среде: агент живет там, где у владельца есть доступ к настройкам, инструментам, навыкам, данным и ограничениям. Это подход из лагеря «пусть будет опасно, зато прозрачно и на моей стороне». Для стартапа или сильной инженерной команды такой вариант выглядит заманчиво: можно быстрее собирать рабочие сценарии, глубже встраивать агента в процессы и не ждать, пока большой вендор разрешит нужный кейс. Но цена свободы известна заранее. Чем шире права агента, тем больнее ошибка в конфигурации, тем сложнее аудит, тем выше требования к изоляции, журналированию и внутренней дисциплине.
Hermes, если судить по этой линии сравнения, смотрит на проблему с другой стороны. Здесь важнее не сам факт, что агент умеет действовать, а то, через какой управляющий слой он это делает. Такой агентный рантайм пытается быть не просто прокладкой между моделью и инструментами, а механизмом дисциплины: распределять разрешения, ограничивать контекст, задавать форму исполнения и делать поведение агента предсказуемее для команды или компании. Для enterprise-аудитории это звучит куда менее романтично, зато заметно ближе к реальности. Когда агент получает доступ к коду, внутренним документам, CRM, почте и инфраструктуре, разговор о «свободе действий» быстро превращается в разговор о комплаенсе, цепочке ответственности и цене инцидента.
Контекст здесь хорошо виден по тому, как рынок вообще начал измерять агентные системы. В мае исследователи из WildClawBench предложили бенчмарк из 60 реальных долгих задач, где агенты работают в нативной среде, а не в игрушечной песочнице. Среднее задание там занимает около восьми минут и требует более 20 вызовов инструментов. Лучший результат в этой выборке, по данным авторов, составил 62,2%, а одна только смена harness-слоя меняла итог модели до 18 процентных пунктов. В июне другая работа, Claw-SWE-Bench, показала еще неприятнее: на задачах по исправлению багов минимальный адаптер для OpenClaw дал 19,1% Pass@1, а полноценный адаптер с тем же базовым model backbone поднял результат до 73,4%. Иначе говоря, спор о контроле уже нельзя считать философией. Harness, runtime и правила исполнения теперь влияют на итог почти так же сильно, как выбор самой модели.
Для русскоязычной IT-аудитории из этого следует довольно трезвый вывод. В ближайшие кварталы конкурировать будут не только модели и не только наборы инструментов, а именно способы упаковки агентного поведения в управляемую среду. Для разработчиков это означает новый слой инженерной работы: политики доступа, трассировка действий, откат изменений, работа с памятью, лимиты на выполнение и стоимость шага. Для продактов вопрос будет звучать еще приземленнее: где проходит граница между «агент реально помогает» и «агент уже слишком много может». Для IT-директоров и HR в IT картина тоже знакомая: автономия без наблюдаемости выглядит бодро только до первого сбоя.
Самое любопытное в этой истории то, что спор OpenClaw и Hermes вряд ли закончится победой одной стороны. Рынок, похоже, идет к развилке, где один сегмент выберет максимально открытый и настраиваемый агентный рантайм, а другой купит более жесткий управляющий слой вместе с гарантиями, журналами и ограничениями. Вопрос уже не в том, станут ли агенты новым интерфейсом к софту. Вопрос в том, кому бизнес согласится доверить право дергать за нитки, когда агент начнет работать не в демо, а в проде.