Strands Decider 2B — новая открытая модель AWS на 2 млрд параметров, которая не пишет текст, а выбирает из заданных вариантов и возвращает оценку уверенности. Для команд, строящих AI-агентов, это важный сдвиг: часть решений можно вынести из дорогих LLM-вызовов в локальную, быструю и более предсказуемую прослойку.
AWS запустила модель 1 октября 2026 года, сообщает The New Stack. Релиз вышел на фоне свежего интереса к decision models: несколько недель назад TypeSafe AI представила Jev, затем появились Kev, imajev, Laya и похожие проекты, а OpenAI во вторник показала Decisions API в ограниченном превью. Разница в подходе заметная: OpenAI предлагает hosted API, а AWS выложила скачиваемую модель вместе с весами, данными и скриптами обучения.
Смысл decision-моделей проще объяснить через то, чего они не делают. Они не генерируют произвольный текст, не пишут код, не ведут полноценный диалог и не пересказывают документы. Вместо этого разработчик задает состояние и набор допустимых ответов: выбрать команду для тикета, решить, можно ли вызвать инструмент, оценить тональность по шкале, определить, нарушает ли запрос политику. Модель обязана ответить в рамках предложенных вариантов, а не сочинять третий путь с уверенным видом.
Для agentic workflow это не мелочь. Большая часть инфраструктурных решений вокруг агентов состоит не из «напиши красивый абзац», а из скучных, частых и дорогих микрорешений: какой инструмент вызвать, хватает ли аргументов, нужно ли уточнение у пользователя, какой LLM выбрать для следующего шага, можно ли пропустить действие через guardrail. Если каждый такой шаг отправлять в крупную языковую модель, растут задержки, счет за инференс и шанс получить ответ, который придется дополнительно парсить и проверять.
Strands Decider 2B построена на базе Qwen3.5-2B: у исходной LLM убрали языковую «голову», то есть способность генерировать текст, и заменили ее pointer head примерно на 1 млн параметров. Эта надстройка сравнивает скрытое состояние позиции ответа с вариантами, которые передал разработчик. В результате модель делает один прямой проход без цикла декодирования. AWS также использовала LoRA-адаптер ранга 16 для донастройки основы.
В репозитории AWS указывает, что первая модель семейства фактически имеет 1,9 млрд параметров. На JevBench v1 public set из 231 задания версия v19 показала accuracy 0,723, то есть 167 правильных ответов из 231. Для простых задач в собственной разбивке репозитория заявлены 100% правильных ответов, для standard — 0,875, для hard — 0,505. Здесь лучше не устраивать гонку табличек: сам проект предупреждает, что 231 задача — маленькая выборка, а разницу меньше примерно 10 заданий между одиночными запусками стоит считать шумной.
По задержке картина интереснее для практиков. AWS пишет о медиане 115 мс на Nvidia RTX 3090 под WSL2 и 299 мс на 95-м перцентиле для JevBench-вопросов. На Apple Silicon M3 Pro медиана для коротких задач — около 153 мс, а по всем задачам — 234 мс. Это не магия, а плата за урезанную свободу: модель быстрее именно потому, что не пытается быть универсальным собеседником. Своего рода «да/нет/выберите одно» с калиброванной уверенностью, только не на регулярках и if-else.
Практический сценарий AWS показывает на примере агента с погодным инструментом. Если пользователь спрашивает «какая погода», но не называет город, типичный демонстрационный агент может бодро угадать локацию и вызвать tool. Decider-модель проверяет два вопроса перед вызовом: основаны ли аргументы инструмента на фактах из пользовательского запроса и не слишком ли рано выполнять действие. Если аргумент придуман, агент возвращается к пользователю с уточнением, а не делает вид, что все под контролем.
Для разработчиков это может стать нормальным паттерном: крупная LLM занимается сложными рассуждениями, планированием и генерацией, а маленькая decision-модель сидит на горячем пути и фильтрует рутинные решения. В продуктовых командах это применимо к маршрутизации обращений, triage инцидентов, выбору модели по стоимости и качеству, проверке tool-calls, классификации политик безопасности и быстрым evals. Для бизнеса плюсы тоже понятны: меньше задержка, ниже стоимость, проще объяснять, почему агент выбрал именно этот путь.
Но у подхода есть границы. Decision-модель хороша там, где пространство ответов заранее задано и вопрос сформулирован аккуратно. Она плохо подходит для задач, где нужно построить новое объяснение, написать код, обобщить длинный документ или выбрать стратегию в неопределенной ситуации. Иными словами, это не «убийца LLM», а специализированный компонент для тех мест, где LLM часто используют от безысходности или лени архитектуры.
Главный вопрос теперь не в том, заменят ли decision-модели большие языковые модели. Не заменят. Интереснее другое: насколько быстро разработчики начнут проектировать AI-агентов как связку разных типов моделей, где генерация, проверка, маршрутизация и политика живут в отдельных слоях. Если эта архитектура приживется, Strands Decider 2B и Jev окажутся не модной веткой AI-инструментов, а первым признаком взросления агентных систем; подробности исходного релиза собрал .