53-минутный доклад Аарона Эриксона из NVIDIA на QCon San Francisco оказался полезнее десятка бодрых тредов про «автономных агентов». Речь шла не о том, как дать модели побольше свободы, а о том, как вообще собирать надежные AI-платформы, которые не ломаются при первом же столкновении с реальными данными, редким контекстом и длинными цепочками действий. Для русскоязычных команд это прямой сигнал: в проде выигрывает не самый разговорчивый агент, а система, где у модели есть четкие границы, хорошие инструменты и внятная схема проверки.
Эриксон, основатель Applied AI Lab for DGX Cloud в NVIDIA, в докладе на QCon разбирает, как компания проектирует и тестирует специализированные иерархии AI-агентов, сообщает InfoQ. Главная мысль звучит почти антихайпово: надежность появляется там, где детерминированные инструменты отвечают за «уверенные» действия, а агентный слой используется для поиска, исследования и работы с неопределенностью. Иначе получается знакомый многим сценарий 2023 года: «а давайте просто добавим AI», а дальше токены горят, логика плывет, а продактов просят придумать, почему это вообще должно работать.
У Эриксона для этого есть не теоретическая, а довольно прикладная предыстория. До NVIDIA он строил стартап Orgspace и в 2023 году сделал плагин для ChatGPT, который умел работать с оргструктурой компании: читать JSON-описание, предлагать перестановки сотрудников, формировать план реорганизации и даже черновик письма о ней. История звучит как эпизод «Черного зеркала», и спикер это прекрасно понимает. Но именно на таких экспериментах хорошо видно, где агентный подход полезен, а где быстро превращается в дорогой генератор сомнительных решений. Модель могла собирать данные, писать вспомогательный Python-код и предлагать цепочку событий для реорганизации, но сама постановка задачи требовала очень жестких ограничений и понятной системы действий. Без этого агент не управляет сложностью, а размазывает ее по нескольким вызовам API.
Переход в NVIDIA в 2023 году только усилил этот вывод. Первой задачей Эриксона там стала не генеративная функция для чат-бота, а система распределения GPU-ресурсов между исследовательскими группами. По его описанию, проблема удивительно похожа на HR-системы: есть дефицитные ресурсы, есть сложные иерархии, есть ограничения, есть заявки, есть необходимость принимать решения не в вакууме, а внутри структуры. В случае NVIDIA речь идет о кластерах GPU, облачных провайдерах, регионах, блоках внутри регионов и требованиях к размещению задач обучения так, чтобы сетевые связи между GPU, включая InfiniBand, оставались максимально эффективными. Это уже не игрушка из серии «пусть агент сам разберется», а задача на ограничения, маршрутизацию и качество решения под давлением дефицита. И здесь особенно хорошо видно, почему надежные AI-платформы нельзя строить только на энтузиазме вокруг LLM.
Практический вывод из доклада довольно жесткий: чем критичнее операция, тем меньше у модели должно быть поводов импровизировать. Эриксон противопоставляет «tools for certainty» и «agents for discovery» не как две конкурирующие школы, а как два слоя одной архитектуры. Инструменты нужны там, где результат должен быть воспроизводимым: получить структуру данных, проверить ограничение, вызвать конкретную операцию, зафиксировать изменение. Агент нужен там, где система исследует варианты, пытается понять редкий контекст, строит гипотезы и помогает дойти до решения в неоднозначной среде. Ошибка многих команд в том, что они дают агенту и свободу поиска, и право на выполнение критических действий, а потом удивляются, что система звучит уверенно ровно до момента первой аварии.
Отдельно Эриксон делает акцент на двух темах, которые разработчики часто недооценивают. Первая — rare context, то есть редкий или трудноизвлекаемый контекст, без которого модель принимает формально связный, но практически неверный путь. Для корпоративных систем это нормальная ситуация: правила лежат в нестандартных документах, ограничения прячутся в операционных деталях, а важные зависимости живут не в базе знаний, а в головах людей или в исторических артефактах. Вторая — тестирование. Спикер предлагает подход с LLM-as-a-judge и тестовой пирамидой, где проверка агентных систем не сводится к одному «демо прошло удачно». Смысл в том, чтобы раскладывать поведение по уровням: от более детерминированных и дешевых проверок до более сложных оценок, где модель выступает арбитром качества. Для инженеров это, пожалуй, самая ценная часть: агентная система без тестовой пирамиды быстро превращается в продукт, который нельзя ни уверенно развивать, ни нормально дебажить.
Еще один тезис из доклада хорошо бьет по нынешнему рынку AI-платформ: парадокс выбора. Если у системы слишком много инструментов, маршрутов и степеней свободы, это не обязательно делает ее умнее. Часто становится наоборот: модель тратит ресурс на выбор между опциями, теряет траекторию и производит менее надежный результат. Для архитекторов սա звучит как напоминание о старом инженерном правиле: не всякая гибкость полезна. Иногда правильная платформа — это не универсальный агент на все случаи жизни, а иерархия из нескольких специализированных ролей с понятной областью ответственности. Такой подход хуже продается на сцене, зато лучше переживает встречу с продом, SLA и людьми, которые потом будут дежурить по инцидентам.
Для российских команд, которые сейчас либо строят собственные AI-слои поверх корпоративных систем, либо пытаются встроить агентов в продукты и внутренние процессы, главный вывод предельно практичный. Если модель должна искать путь в неоднозначной среде — дайте ей пространство для исследования. Если она должна менять состояние системы, распределять ресурсы, принимать операционные решения или выполнять чувствительные действия — уприте ее в строгие инструменты, ограничения и тесты. Вопрос уже не в том, будут ли компании использовать агентов, а в том, сколько из них согласятся признать неприятную истину: надежность появляется не там, где агенту разрешили больше, а там, где архитектура заранее решила, в каких местах ему вообще можно доверять.