AWS 1 октября выпустила открытую по весам Strands Decider 2B — и запустила её через endpoint /v1/systemone, совпадающий с интерфейсом стартапа TypeSafe AI. Модели принятия решений быстро получают общий API: для разработчиков это шанс менять поставщика или переносить часть ИИ-логики в свой контур без переписывания интеграции.
Как сообщает The New Stack, Strands Decider 2B построена на Alibaba Qwen3.5 и распространяется по лицензии Apache 2.0. AWS — не единственная компания, работающая с этим форматом. Upstage отдаёт свою Solar Decide по схеме System One, а Ollama добавила endpoint /v1/systemone в версии 0.35. При этом OpenAI остаётся заметным исключением: её Decisions API находится в ограниченном предварительном доступе, а публичной спецификации интерфейса компания пока не выпустила.
Речь не о ещё одном чат-боте. Модель решений получает состояние приложения — например, сообщение клиента и фрагмент политики возврата — и возвращает структурированный ответ. Система может выбрать вариант из списка, дать оценку по шкале или ответить на вопрос «да/нет» с вероятностью. Она не пишет письмо пользователю и не объясняет ход рассуждений: её задача — быстро выдать значение, на котором приложение построит ветвление.
Для агентных систем это отдельный, довольно полезный слой. Большая языковая модель способна составить ответ в поддержку, вызвать инструменты и спланировать последовательность действий. Но перед каждым из этих шагов возникают небольшие вопросы: отправлять ли тикет оператору, какой инструмент разрешить, достаточно ли данных, какой маршрут выбрать. Прогонять их через полноценную генеративную модель дорого и не всегда удобно для контроля. Модели принятия решений обещают стать вероятностным аналогом привычного if в приложении.
Интерфейс стандартизируется раньше рынка
TypeSafe AI первой предложила API System One вместе со своей хостируемой моделью Jev. В запросе можно объединить три типа вопросов: выбор одного варианта, оценку по упорядоченной шкале и бинарный формат noul. Ответ включает вероятности и показатель уверенности. Последний нельзя читать как гарантию правильности: он описывает концентрацию распределения вероятностей, а не шанс, что конкретный ответ верен. Пороговые значения всё равно придётся калибровать на данных конкретного продукта.
Сходство интерфейсов уже даёт практический эффект. Клиентские библиотеки TypeSafe могут работать с сервером, реализующим System One, если поменять базовый URL. В теории команда может начать с хостируемого Jev, а затем перенести классификацию на локальную Strands Decider или другой совместимый вариант — например, если появились требования к размещению данных или вырос объём запросов. На практике тестировать придётся всё: отличаются лимиты, качество ответов и то, как поставщики считают уверенность.
Параллель с рынком LLM здесь очевидна. API Chat Completions от OpenAI годами копировали vLLM, Ollama, OpenRouter и множество других сервисов — он стал фактическим стандартом ещё до формального процесса стандартизации. Позже сама OpenAI представила открытую спецификацию Open Responses. У System One меньше поверхность: три типа вопросов вместо ролей сообщений, стриминга и вызова инструментов. Поэтому интерфейс легче воспроизвести, но и расколоть на похожие несовместимые варианты — тоже легче.
Уже сейчас единообразие не полное. OpenRouter предлагает собственный Decisions API для Jev, сохраняя совместимый маршрут для клиентов TypeSafe. Perplexity поддерживает сходные типы задач, но использует другой путь. OpenAI пошла ещё дальше в сторону собственного интерфейса. Победа схемы System One не означает, что каждый сервис будет иметь одинаковый URL, модель тарификации или поведение на пограничных случаях.
Открытые веса снижают цену входа, но не риск ошибок
AWS заявляет медианную задержку 115 миллисекунд на один вопрос для 1,9-миллиардной Strands Decider при запуске на RTX 3090. Компания также сообщает, что на коротких задачах классификации, которых модель прежде не видела, ответы с уверенностью от 0,9 оказались правильными примерно в 95% случаев. Это не универсальный бенчмарк и не обещание точности для любого бизнеса, но ориентир для команд, выбирающих между лёгкой специализированной моделью и вызовом крупной LLM.
На другом полюсе — хостируемые сервисы. Upstage построила Solar Decide на Solar Mini 4: это MoE-модель с 35 млрд общих и 3 млрд активных параметров. Perplexity 1 октября представила открытые веса pplx-decider и хостируемый API, а 6 октября выпустила версию 1.1. В карточке модели указан рост Decision Index с 56,4 до 61,56. Сопоставлять такие цифры напрямую нельзя: публикация The New Stack отдельно предупреждает, что таблицы производителей и авторов используют разные наборы тестов. Ближе всего к нейтральной точке отсчёта пока JevBench с открытой лицензией MIT.
Дешёвый и переносимый классификатор особенно интересен командам, где агент делает тысячи мелких проверок в час: маршрутизация запросов между моделями, фильтрация вызовов инструментов, проверка полноты формы, первичная обработка обращений. Но автономность не отменяет защиту. Исследователь из Университета Южной Калифорнии показал, что добавленный в контекст естественный текст способен целенаправленно склонять решения Jev к неверному ответу. Для уже верных решений атака сработала в 61,4% из 508 случаев; у одной из открытых Qwen-моделей показатель достиг 72,6%.
Эти результаты не означают, что агент будет ошибаться с такой вероятностью в обычном диалоге. Они напоминают о более скучной, но важной инженерной работе: разделять недоверенный пользовательский текст и управляющий контекст, оставлять проверки правил на детерминированном коде, ставить лимиты на полномочия и направлять спорные случаи человеку. Вероятность от модели — вход для политики, а не замена политики.
Если TypeSafe опубликует System One как открытую спецификацию, рынок может получить для агентных решений то, чем Chat Completions стал для LLM: общий язык интеграции. Если OpenAI выведет наружу несовместимую схему, разработчикам достанется знакомая картина двух API и адаптеров между ними. Сам технический контракт уже выглядит почти товаром; конкурентная борьба смещается к качеству, калибровке и безопасности моделей. Подробности о реализации и сравнении поставщиков собраны в материале .