Ollama добавила поддержку Jev-подобных моделей: они не генерируют длинный текст, а выбирают ответ из заданных вариантов и возвращают оценки вероятностей. Для разработчиков это полезно там, где нужна быстрая локальная классификация без похода в облако: модерация, маршрутизация тикетов, выбор модели под запрос. О появлении функции в версии 0.35 сообщает Habr / Новости.
Сейчас в Ollama доступны три такие модели. Первая — Nimble от Bespoke Labs с 9 млрд параметров. Ещё две — экспериментальные Tev1 от Together AI: на 4 млрд и 0,8 млрд параметров. Все три основаны на дообучении Qwen 3.5. Самая компактная Tev1 после загрузки занимает 812 МБ на диске, то есть её можно держать рядом с приложением, а не превращать инфраструктуру в отдельный проект.
Главная идея Jev-подобных моделей — ограничить пространство ответа заранее. Вместо свободного текста модель получает набор допустимых вариантов и должна выбрать один из них, дополнительно вернув вероятности. Это ближе к практической классификации, чем к привычному чат-боту. Например, система поддержки может распределять обращения по очередям, модераторский пайплайн — относить контент к категориям риска, а оркестратор ИИ-сервисов — решать, какую модель вызвать для конкретного запроса.
Ollama реализовала интерфейс по образцу API Jev от TypeSafe. Поддерживаются три режима: выбор из списка, оценка по заданной шкале и бинарный ответ «да» или «нет». На практике это закрывает большую часть задач, где бизнесу не нужен красивый абзац, а нужна проверяемая машинная метка. Чем меньше свободы у модели, тем проще строить вокруг неё продуктовую логику, мониторинг и тесты.
Локальный запуск здесь не просто приятная галочка. У таких сценариев часто есть чувствительные данные: обращения клиентов, внутренние документы, спорный пользовательский контент, технические логи. Если Jev-подобные модели работают на машине или сервере компании, данные не уходят к внешнему провайдеру ради каждого решения. Это не отменяет требований к безопасности внутри контура, но убирает целый класс вопросов про передачу данных третьей стороне.
Вторая причина — задержка. Команда Ollama оценивала скорость на примере принятия решений в Pac-Man: Nimble 9B на MacBook Pro с M5 Max в среднем справлялась за 91 мс. Это не универсальный бенчмарк для всех задач и железа, но порядок величины понятен. Когда модель не ждёт сетевой запрос и не платит накладные расходы облачного API, её можно встраивать в интерактивные сценарии: от пользовательских интерфейсов до локальных агентов.
Есть и ограничение, которое разработчикам лучше заметить до пятничного деплоя. Для работы нужен новый API-адрес /v1/systemone или официальный Python SDK TypeSafe, настроенный на локальную Ollama. Встроенные библиотеки Ollama для Python и JavaScript пока этот режим не поддерживают. Значит, если проект уже завязан на привычные SDK Ollama, интеграцию придётся писать аккуратнее: не всё сведётся к смене имени модели в конфиге.
Для бизнеса этот релиз интересен не тем, что «ещё одна модель умеет отвечать да или нет». Интереснее сдвиг в сторону маленьких специализированных локальных компонентов. Не каждый ИИ-сценарий требует большой универсальной модели, длинного промпта и платы за каждый вызов. Иногда системе нужно быстро и повторяемо выбрать категорию, оценить риск или направить запрос дальше. Если такие задачи получится закрывать локально, часть LLM-инфраструктуры станет менее дорогой и более предсказуемой.
Для русскоязычных команд, которые собирают внутренние ИИ-инструменты, Jev-подобные модели в Ollama выглядят как удобный промежуточный слой между классическими классификаторами и большими языковыми моделями. Следующий вопрос — насколько хорошо эти модели поведут себя на реальных корпоративных данных, русском языке и пограничных кейсах, где вариант ответа формально есть, но уверенности у системы быть не должно.