AI-агенты тратят токены не только на ответы пользователю, но и на внутренние развилки: выбрать инструмент, поднять задачу на эскалацию, пропустить действие через safety-проверку. Новая open-source-семья Kev предлагает более прямой путь: экономия токенов за счет решений без генерации текста, сообщает The New Stack.
Kev выпустил разработчик Джаред Палмер: в новой линейке есть модели на 0,8 млрд, 4 млрд и 9 млрд параметров, построенные на базе Qwen 3.5. Идея простая и довольно болезненная для текущей агентской архитектуры: не каждое решение агента заслуживает полноценного текстового ответа от большой LLM. Если системе нужно выбрать один вариант из списка, генерация фразы вроде «я выберу поиск» выглядит как дорогой ритуал, после которого приложение все равно парсит текст обратно в машинное решение.
Kev работает иначе. Это prefill-only модель: она получает состояние, вопрос и набор кандидатов, делает один forward pass и возвращает вероятности через pointer head. Без авторегрессионного цикла, где модель токен за токеном сочиняет ответ. Для выбора инструмента результат может выглядеть как распределение вероятностей: поиск — 0,82, база данных — 0,13, калькулятор — 0,05. Агент может ошибиться, но он не выдумает четвертый инструмент, которого нет в списке. Для продакшена это скучная, но ценная гарантия.
Модель поддерживает три типа решений: Noul для yes/no, Choice для выбора из кандидатов и Score для упорядоченных уровней. Эти примитивы повторяют API System One от TypeSafe, где ранее появился Jev. Kev совместим с форматом запросов и ответов /v1/systemone, так что приложения, уже написанные под этот интерфейс, теоретически можно направить на локальный сервер Kev. Разница в открытости: Kev выпущен под Apache 2.0, вместе с весами, кодом обучения и инструментами оценки. У Jev веса и обучающие данные публично не раскрыты, поэтому честное сравнение между ними пока затруднено.
Главный практический сценарий — агентские циклы, где много мелких решений появляется до единственного пользовательского ответа. Маршрутизация между инструментами, ранжирование вариантов, проверка риска, выбор следующего шага, решение «делать самому или звать человека» — все это часто не требует связного текста. Большая модель остается там, где нужна свободная формулировка, рассуждение или финальный ответ. Kev пытается занять слой решений, где экономия токенов важнее красноречия.
В документации Палмера 4B-модель обрабатывает три вопроса за 277 мс в bf16 на M5. Это интересная цифра, но ее нельзя читать как доказательство многократного ускорения: в источнике нет контролируемого сравнения с Qwen, генерирующей эквивалентные ответы на том же железе. Более сильный аргумент здесь не рекорд по миллисекундам, а архитектурная логика. Если задача сводится к выбору из заданных кандидатов, автогенерация текста добавляет лишний этап, лишние токены и лишние места, где интеграция может сломаться.
Есть и ограничения, причем важные. Kev-9B, по данным карточки модели Палмера, показал 83,7% accuracy на закрытом out-of-domain тесте. Но это benchmark от разработчика проекта, а не независимая проверка. Кроме того, вероятности Kev не всегда хорошо калиброваны на незнакомых распределениях. Для агентских систем это не академическая придирка: если продукт исполняет действие при вероятности выше порога, плохо откалиброванная уверенность превращается в баг бизнес-логики. Высокий score не равен безопасному действию.
Еще один компромисс — специализация. Fine-tuning под решения может ухудшать общие способности, унаследованные от базовой модели, включая знания и арифметику, особенно у меньших вариантов. Но Kev и не претендует на роль универсального собеседника. Скорее это служебная модель рядом с большой LLM: та пишет, рассуждает и объясняет, а Kev решает, куда идти дальше. Для разработчиков это означает дополнительный компонент в стеке, зато с более предсказуемым контрактом: вход — состояние и кандидаты, выход — вероятности.
Для бизнеса вопрос упирается в unit economics агентских продуктов. OpenAI-исследователи, по данным статьи, уже описывали расходы порядка $7 тыс. в день на агентские нагрузки. Это не универсальный чек для всех команд, но хороший сигнал: когда агентов становится много, внутренние решения перестают быть бесплатной мелочью. Экономия токенов на маршрутизации и проверках может оказаться не оптимизацией ради красоты, а способом удержать продуктовую маржу от тихого испарения.
Kev не отменяет большие языковые модели и не делает AI-агентов надежными по щелчку. Он подсвечивает более взрослый тренд: агентская инфраструктура начинает разделять разговор, рассуждение и машинные решения на разные слои. Следующий спор будет не о том, может ли одна большая модель делать все, а о том, сколько задач мы зря заставляли ее проговаривать словами.