20 июля 2026 года InfoQ выпустил подкаст о Strands Agents — open source SDK, который внутри AWS вырос из Python-библиотеки в полноценную обвязку для продакшн-агентов. Для русскоязычной IT-аудитории здесь важен не сам факт очередного SDK, а тезис покрепче: чем лучше становятся модели, тем меньше пользы от громоздких workflow-движков и тем выше цена лишней инженерной самодеятельности вокруг LLM.
Технический лидер проекта Clare Liguori, Senior Principal Engineer в AWS, рассказала, что Strands сначала делали как внутренний инструмент для агентов, помогающих пользователям AWS. По данным InfoQ, команда быстро уперлась в типичную проблему ранних агентных платформ: построить демо можно быстро, а надежного агента для продакшна — уже нет. Внутренний проект оказался полезен не только для одной команды, а затем в мае 2025 года его открыли как open source. Базовая идея у Strands Agents предельно простая: агенту нужны системный промпт, набор инструментов и выбранная модель. Всё остальное, по версии AWS, должно добавляться только по необходимости, а не потому, что разработчику тревожно отпускать модель без десятка промежуточных if/else.
Главный тезис Liguori звучит почти как укол по рынку агентных фреймворков образца 2024-2025 годов. По ее словам, многие из них слишком рано пытались формализовать поведение агента через сценарии, графы и жесткие workflow. На бумаге это выглядело как дисциплина, на практике — как хрупкость. Пользователь задает составной вопрос, перескакивает между задачами или слегка меняет формулировку, и аккуратно нарисованный pipeline начинает рассыпаться. В AWS пришли к модели, где reasoning и выбор цепочки tool calls лучше делегировать самой LLM. Поворотным моментом Liguori называет период выхода Claude Sonnet 3.7, когда модели стали заметно лучше в tool calling, планировании шагов и связке нескольких вызовов подряд. Результат для команды был прагматичным: новые агенты удавалось доводить до продакшна не за полгода, а за недели.
При этом AWS не продает наивную идею «давайте просто отпустим модель в свободное плавание». В разговоре много места заняли guardrails, но реализованы они не через тяжелый оркестратор, а через evals и hooks. Liguori говорит, что команда выпустила Strands Evals Kit в preview в декабре 2025 года, а к моменту подкаста он уже дошел до версии 1.0. Смысл простой: сначала нужно измерить, как часто агент правда уходит не туда, а не бороться с воображаемой катастрофой в каждом запросе. Для контроля в рантайме Strands использует hooks, в том числе схему с inline LLM-as-a-judge. Перед финальным ответом или перед вызовом инструмента можно прогнать дополнительную проверку отдельной, более дешевой моделью. В подкасте в качестве примера упоминается GPT-oss:20b: его, по словам Liguori, достаточно, чтобы отфильтровать ответ, который нарушает поведенческие ограничения, или остановить нежелательный tool call. Это, кстати, нормальная инженерная мысль на фоне вечной паники вокруг стоимости агентов: не каждую проверку нужно делать frontier-моделью за все деньги мира.
Самая интересная часть разговора касается не guardrails, а того, как AWS пытается добавить агенту немного детерминизма, не превращая его обратно в обычный BPMN под соусом LLM. Для этого в Strands есть подход под названием steering hooks. В отличие от обычных хуков, они видят не только текущий вызов, но и весь ledger — историю предыдущих действий агента. Это позволяет проверять не только отдельный шаг, но и контекст. Пример из подкаста нарочито прикладной: агент может не просто проверять лимит ипотечного одобрения, но и удостоверяться, что до этого уже была выполнена верификация дохода. Такой stateful-контроль выглядит куда полезнее, чем любимый корпоративный жанр «запретим всё в системном промпте заглавными буквами и будем надеяться на лучшее».
Liguori подкрепляет позицию цифрами, и это редкий момент, когда разговор об агентной архитектуре перестает быть философией. В одном из внутренних кейсов команда прогнала сотни evaluation-запусков, сравнивая разные способы steering: короткие инструкции, workflow, очень длинный промпт и steering hooks. По ее словам, короткие инструкции из четырех предложений дали pass rate 82,5% и оказались точнее workflow. А steering hooks показали 100% accuracy. Здесь, конечно, нужен здоровый скепсис: это не универсальный закон природы, а результат конкретного кейса и конкретного набора задач. Но даже в таком виде вывод неприятный для многих платформенных команд: обилие процедурного кода вокруг агента не гарантирует качество, а иногда просто делает хуже и дороже в сопровождении.
Еще один практический слой — продакшн-эксплуатация. Strands можно запускать где угодно и с любым провайдером моделей, а не только в Amazon Bedrock: Liguori прямо перечисляет Anthropic, OpenAI и локально размещенные модели. Для энтерпрайза это важнее, чем звучит. Прототип часто собирают на одной модели, а в продакшне внезапно выясняется, что компания хочет гнать трафик через свой утвержденный LLM endpoint, внутренний gateway или более дешевую модель. Если смена провайдера требует переписывать полсистемы, это не фреймворк, а ловушка. Отсюда же тезис про наблюдаемость: Strands поддерживает OpenTelemetry, а трассировки для агентов, по мысли AWS, даже важнее, чем для классических сервисов, потому что именно по цепочке tool calls и промежуточным ответам модели видно, где все поехало. Команда приводит и приземленный пример из AWS Console: до запуска чатбота они ожидали в основном вопросы уровня «что такое S3» или «что такое EC2» и под это настраивали краткие ответы. В реальном трафике пользователи начали спрашивать «как подключить EC2 к S3», то есть просили уже не справку, а инструкцию. Пришлось пересобирать evaluation dataset под живое поведение людей, а не под фантазии команды о живом поведении людей.
Наконец, Strands постепенно уходит от статуса просто framework к тому, что Liguori называет agent harness. Разница, по ее версии, в том, что обычный framework помогает агенту крутиться в цикле «следующий ход модели — вызов инструмента — следующий ход модели», а harness рассчитан на долгие и сложные задачи. В подкасте речь уже идет о контекстных окнах до миллиона токенов, управлении памятью, проактивном суммировании истории, сохранении и возобновлении состояния, а также встроенных task list и to-do list для длинных сценариев. Иными словами, AWS делает ставку на мир, где агент — это не чатик в боковой панели, а процесс, который может работать часами и переживать сбои вычислительной ноды. Если этот сценарий действительно станет массовым, рынок агентных платформ ждет не очередной виток визуальных редакторов workflow, а болезненная переоценка того, сколько кода вокруг модели вообще нужно писать вручную. Подробности разговора — в подкасте .