AI И НЕЙРОСЕТИ

IBM добавила reasoning в Granite 4.2, но не ушла в тяжёлые схемы

IBM 25 августа выпустила Granite 4.2 в версиях 3B, 8B и 30B: open-weight-модели получили reasoning, tool calling и ставку на dense-архитектуру.

✍️ Редакция iTech News | 26.08.2026 | ⏱ 5 мин | Источник: The New Stack
🔬

IBM Granite 4.2 вышла сразу в трёх размерах — 3, 8 и 30 млрд параметров — и получила режим reasoning без ухода в модные гибридные архитектуры. Для русскоязычной IT-аудитории это не просто ещё один релиз open-weight LLM: IBM пытается доказать, что корпоративным командам нужны не самые громкие бенчмарки, а предсказуемые модели, которые можно развернуть локально, подключить к инструментам и не разориться на инференсе.

Новая линейка появилась 25 августа, и, как пишет The New Stack, IBM сознательно продолжает курс на dense, decoder-only Transformer вместо гибридов Mamba/attention и других сложных схем, которыми увлеклись конкуренты. В семейство вошли модели на 3B, 8B и 30B параметров, все с открытыми весами и лицензией Apache 2.0. Для enterprise-сегмента это важная деталь: модель можно не только попробовать в демо, но и дообучить, втащить в свой стек и выпустить в прод без лицензионной экзотики.

Главное изменение в IBM Granite 4.2 — нативное reasoning. У моделей есть режимы thinking и non-thinking, а между ними IBM добавила ещё и low-effort mode: короткий бюджет на рассуждение для простых запросов. Логика понятная и довольно земная. Не каждую задачу в корпоративном контуре надо решать длинной цепочкой рассуждений; часто важнее предсказуемая задержка, вменяемый расход токенов и нормальная работа tool calling. IBM явно пытается усидеть на двух стульях: дать reasoning там, где он реально помогает, и не превращать каждую генерацию в дорогое философское эссе.

При этом компания делает акцент не на чат-режиме, а на агентных сценариях. По данным IBM, модели 8B и 30B прошли дополнительный этап agentic reinforcement learning для задач software engineering, terminal-based coding и search-driven workflows. Проще говоря, их отдельно учили не просто отвечать, а действовать: выбирать инструменты, вызывать их в нужной последовательности, проверять результат и продолжать работу в многошаговом процессе. Для разработчиков это звучит куда важнее очередного «улучшенного общения с пользователем»: корпоративный интерес сейчас не в красивых диалогах, а в том, чтобы агент не ломался на второй команде в терминале.

Есть и конкретика по обучению. Технический разбор IBM на Hugging Face говорит о предобучении примерно на 15 трлн токенов. В модель также добавили около 1 трлн токенов синтетического кода из пайплайна CodeAlchemy. Контекст у релизных конфигураций заявлен на уровне 131 072 токенов, а сама тренировочная схема, по словам IBM, расширяет окно до 512 тыс. токенов. Плюс компания использовала многоступенчатое RL-дообучение: базовый этап для всех моделей и отдельный agentic-блок только для 8B и 30B. Маленькая 3B-версия выглядит как entry point для reasoning и tool use, а не как полноценный инженерный агент.

Почему IBM снова делает ставку на dense

На фоне гонки за MoE, гибриды и всё более замысловатые архитектуры решение IBM выглядит даже немного контринтуитивно. Но у него есть рациональная подкладка. Ещё в релизе Granite 4.1 компания объясняла, что dense-модели проще в дообучении и гибче для downstream-задач. В Granite 4.2 эта линия не сломалась: IBM добавила reasoning поверх плотной архитектуры, а не стала перестраивать весь стек под очередной архитектурный хайп. Для корпоративного заказчика это, возможно, важнее, чем звучит. Чем проще модель в эксплуатации, тем ниже цена эксперимента и тем легче объяснить её выбор IT-директору, который потом будет отвечать за SLA, безопасность и бюджет.

Показатели IBM тоже раскрыла достаточно подробно, хотя без фанфар про абсолютное лидерство. У Granite 4.2 30B, например, заявлены 57,0 на SWE-Bench Verified, 33,29 на SWE-Bench Pro, 29,24 на Terminal-Bench 2.1, 89,17 на AIME 2025 и 66,41 на GPQA. У 8B-версии результаты ниже, но тоже уже похожи на рабочую базу для агентных сценариев: 47,67 на SWE-Bench Verified и 20,56 на Terminal-Bench 2.1. Это важный момент: IBM не продаёт Granite 4.2 как «убийцу всех моделей», а скорее как набор практичных open-weight-инструментов под enterprise AI. В таком позиционировании меньше маркетингового блеска, зато больше шансов попасть в реальные пилоты.

Отдельно IBM вместе с Granite 4.2 показала и новые speech-модели Granite Speech 5.0 Turbo CTC и 5.0 Turbo CTC NC размером 470 млн параметров. Формально это соседний релиз, но логика общая: компания строит не один большой универсальный интеллект, а семейство относительно компактных специализированных моделей под разные узкие участки enterprise-контура. Для тех, кто собирает внутренние AI-сервисы из нескольких компонентов, такой подход обычно полезнее, чем ещё одна гигантская модель «на все случаи жизни».

Что это меняет для разработчиков и бизнеса

Для разработчиков IBM Granite 4.2 интересна не столько самим словом reasoning, сколько упаковкой. OpenAI-совместимый function calling, интеграция с агентными harness'ами, Apache 2.0, несколько размеров модели, акцент на код, терминал и поиск — всё это снижает порог для пилота. Для бизнеса сигнал тоже читается без переводчика: reasoning перестаёт быть фичей только для frontier-моделей и спускается в более управляемый класс open-weight-систем. А значит, спор в enterprise постепенно смещается с вопроса «какая модель умнее всех» к вопросу «какая модель решает задачу дешевле, стабильнее и без лишней юридической боли».

Теперь интрига в другом: хватит ли рынку reasoning-моделей среднего размера, если они нормально работают с инструментами и не требуют чудовищной инфраструктуры. Если ответ окажется положительным, то следующий виток конкуренции в AI пойдёт не вокруг максимального числа параметров, а вокруг того, кто лучше упакует агентную работу в удобный и дешёвый production-формат.

Поделиться: Telegram X LinkedIn