Децентрализованные ИИ-агенты могут оказаться не академической экзотикой, а способом резко урезать счета за инференс: в Stanford заявили, что их схема DeLM снижает стоимость мультиагентных задач примерно на 50% и дает прирост 10,5% на SWE-bench Verified. Для команд, которые уже собирают пайплайны из агентов для кода, аналитики и поиска по документам, это плохая новость только для одного компонента: центрального «начальника», который до сих пор считался обязательным.
О новой архитектуре, как пишет VentureBeat, рассказали Юйчжэнь Мао и Азалия Мирхоссейни. Их идея выглядит почти вызывающе на фоне нынешнего бума агентных фреймворков: не отправлять каждое промежуточное открытие обратно в главный узел, а дать агентам общий слой знаний, очередь задач и возможность координироваться напрямую. Иначе говоря, меньше менеджмента, меньше пересказов, меньше повторной работы.
Проблема, по версии исследователей, в том, что классическая мультиагентная схема масштабируется не так красиво, как выглядит на слайдах. В центре обычно сидит оркестратор: он дробит задачу, раздает подзадачи, собирает ответы, сводит промежуточные результаты и запускает следующий раунд. Пока агентов немного, модель работает терпимо. Но по мере роста числа веток именно центральный агент становится узким местом: через него проходят полезные находки, частичные гипотезы, ошибки, ограничения и ссылки на доказательства. На каждом таком проходе система платит дважды: деньгами за лишние токены и задержкой за лишнюю координацию. Кроме того, при пересборке контекста главный агент может упростить, потерять или исказить важные детали. Для задач разработки это особенно болезненно: если одна ветка уже выяснила, почему фикс ломает тесты, а другая об этом не узнала вовремя, команда агентов с энтузиазмом оплачивает один и тот же тупик несколько раз.
Как устроен DeLM без центрального диспетчера
DeLM предлагает другой маршрут. Вместо главного координатора система держится на трех опорах: параллельные агенты, общий контекст и очередь задач. Общий контекст здесь не равен свалке логов. Это аккуратно собранное хранилище коротких выжимок, или gist-ов, куда попадают только проверяемые результаты, зафиксированные ограничения, частичные наблюдения и даже документированные провалы. При необходимости агент может развернуть такой gist глубже и добраться до исходных доказательств, но по умолчанию читает компактную версию. В этом и есть ключевой инженерный трюк: не таскать за собой весь хвост рассуждений и файловых дампов, а делиться с коллегами только тем, что уже прошло минимальную верификацию и пригодно для повторного использования.
Процесс выглядит так. Сначала входная задача режется на рабочие блоки и складывается в очередь. Затем агенты независимо забирают подзадачи, параллельно читают общий контекст и добавляют туда новые подтвержденные выводы. После этого результаты сжимаются в короткие выжимки и проверяются по исходным данным; в общий слой попадает не сырой поток мыслей, а компактный артефакт, на который можно опереться. Когда очередь пустеет, последний агент просматривает накопленный контекст и решает, нужны ли еще шаги. Если нет, он отдает финальный ответ. Важная деталь: «последний агент» здесь не начальник в классическом смысле, а скорее тот, кто завершает цикл, не превращаясь в постоянный центр управления для всех остальных.
Для тех, кто строит агентные системы поверх LLM, тут важна не только децентрализация как красивая идея, но и конкретная механика экономии. Исследователи прямо указывают, что агенты в DeLM делятся не только удачными находками, но и неудачами. В обычной параллельной схеме ошибочный путь нередко остается частным горем отдельного воркера. В DeLM провал становится общим знанием: другие ветки видят, что гипотеза уже проверена и не сработала, а значит, не тратят токены на повторное блуждание. То же касается ограничений. Если одна ветка верифицировала, что определенное упрощение ломает глобальные условия задачи, это ограничение сразу становится частью общего состояния. Для отладки, генерации патчей и сложного поиска по коду такой режим выглядит почти более полезным, чем очередной «умный» супервайзер поверх уже дорогих моделей.
Где это уже показало результат
Самый сильный аргумент в пользу DeLM исследователи принесли не в виде красивой диаграммы, а в цифрах с бенчмарков. На SWE-bench Verified, где проверяют, насколько ИИ и агентные системы умеют решать реальные инженерные задачи в кодовых базах, DeLM показал результат на 10,5% лучше сильнейшего базового подхода и при этом сократил стоимость одной задачи примерно вдвое. Это заметный сигнал для компаний, которые считают не только проценты качества, но и цену тестового времени модели. Когда агентная надстройка начинает стоить как отдельный сервис, вопрос «а нужен ли нам центральный оркестратор?» быстро перестает быть философским.
Но история не ограничивается разработкой. На LongBench-v2 Multi-Doc QA, бенчмарке для длинного контекста и ответов по нескольким документам, DeLM показал лучшую точность сразу в четырех семействах моделей: GPT-5.4, Claude Sonnet, Gemini Flash и DeepSeek-V4-Pro. Это важный маркер: эффект архитектуры не завязан на одну-единственную модель или один стек. По сути, Stanford предлагает не новую «сверхмодель», а способ организовать коллективную работу уже существующих моделей так, чтобы они меньше мешали друг другу и реже перечитывали одни и те же данные.
Отдельно любопытна идея «разворачиваемого» контекста. Полная передача сырых трейсов, истории команд, промежуточных правок и неудачных попыток дает максимум информации, но быстро превращает координацию в еще одну задачу длинного контекста. Слишком короткие саммари, наоборот, стоят дешево, но теряют доказательную базу. DeLM пытается усидеть на двух стульях: по умолчанию агентам доступны компактные выжимки, а детали открываются по запросу, когда действительно нужны. Для корпоративных сценариев это звучит особенно прагматично. Чем больше в системе документов, тикетов, логов и кода, тем выше риск, что архитектура утонет не в решении задачи, а в обмене собственными внутренними объяснениями.
Для русскоязычной IT-аудитории тут есть вполне прикладной вывод. Если команда уже экспериментирует с агентами для CI, ревью, triage багов, поиска по внутренней документации или автоматизации поддержки, то главное ограничение может быть не в качестве базовой модели, а в топологии самой системы. DeLM бьет ровно по этой точке: убирает перегруженный центр, заставляет агентов делиться проверенными находками и ошибками и превращает общий контекст в рабочий актив, а не в свалку пересказов. Вопрос теперь не в том, смогут ли децентрализованные ИИ-агенты заменить оркестратор везде. Гораздо интереснее, в каких классах задач бизнес перестанет платить за роль, которая долго считалась обязательной по умолчанию. Проверить первоисточник и детали исследования можно в материале .