128 ускорителей в одной стойке, 1,7 экзафлопса вычислений в 4-битном режиме и 27,5 ТБ памяти HBM4. Чип OpenAI Jalapeño, который компания показала на конференции Hot Chips 25 августа 2026 года, выглядит не как еще один эксперимент «на будущее», а как вполне прагматичная попытка откусить кусок у Nvidia и AMD на самом денежном участке AI-инфраструктуры: инференсе. Для разработчиков и IT-руководителей это важный сигнал: крупнейшие игроки уже не просто арендуют GPU, а строят собственное железо под конкретную задачу.
О новой архитектуре, разработанной OpenAI вместе с Broadcom, сообщает The Register. По данным издания, Jalapeño станет первым в серии кастомных ускорителей компании, причем речь не о замене всех внешних поставщиков сразу. OpenAI по-прежнему нужны универсальные GPU для обучения моделей, а собственный чип нацелен прежде всего на инференс, где решают не только «сырые» флопсы, но и задержки, пропускная способность памяти и стоимость ответа в пересчете на токен. И вот здесь у OpenAI логика довольно холодная: если генеративный ИИ превращается в постоянную сервисную нагрузку, то держать ее целиком на чужих GPU становится роскошью.
На уровне одной стойки цифры у Jalapeño действительно агрессивные. Система из 128 ускорителей, по информации The Register, выдает 1,7 exaFLOPS в 4-битных вычислениях, несет 27,5 ТБ HBM4 и обеспечивает почти 2 ПБ/с пропускной способности памяти. Каждый отдельный чип, как утверждается, развивает 13,4 petaFLOPS в формате MXFP4 и оснащен 216 ГБ HBM4 с пропускной способностью 15,4 ТБ/с. Если сравнивать не с абстрактным «рынком», а с конкретными стойками Nvidia GB200 NVL72 и GB300 NVL72, то по общей вычислительной мощности системы Nvidia и AMD все еще могут выглядеть быстрее, местами в 1,46-2 раза. Но у OpenAI ставка не на универсальность, а на узкую специализацию: компания пытается выиграть за счет памяти, локальности данных и более предсказуемой работы именно на стадии вывода.
Это хорошо видно по тем метрикам, которые OpenAI вынесла вперед. В тестах на наборе InferenceX от SemiAnalysis система на Jalapeño, по предварительным данным компании, показала в 1,5-1,9 раза больше «AI work» на пиковом throughput и в 1,7-3,6 раза более низкую сквозную задержку на моделях GPT-OSS-120B, DeepSeek R1 и Kimi K2.5. В сценариях сверхнизкой задержки, где инфраструктурные провайдеры сейчас особенно активно воюют за клиентов, заявленное преимущество составляет 2,1-4,1 раза. Такие цифры, конечно, нужно читать с профессиональным скепсисом: тесты были показаны самой OpenAI, а сравнение, как отмечает The Register, не включало speculative decoding, то есть популярную технику ускорения инференса через маленькую draft-модель. Иными словами, это пока не окончательный приговор Blackwell и не повод срочно вычеркивать Rubin из планов, а очень громкая заявка на место за столом.
Технически в Jalapeño нет магии, но есть здравый инженерный расчет. Архитектура строится по rack-scale модели, уже знакомой по системам Nvidia NVL72 и AMD Helios. Самое интересное, похоже, в том, что OpenAI старалась минимизировать перемещение данных между ресурсами. Компания прямо говорит, что проектировала систему так, чтобы держать состояние модели, включая KV-кэш, как можно ближе к вычислениям и не гонять его лишний раз по шине и сети. The Register предполагает наличие крупного SRAM-кэша, и это вполне укладывается в логику специализированных AI-ускорителей: чем меньше ты таскаешь данные туда-сюда, тем меньше теряешь на задержках и энергопотреблении. Отдельно важно, что чип OpenAI Jalapeño не заточен только под одну фазу работы модели. Обычно железо может блеснуть либо на prefill, когда система переваривает входной промпт, либо на decode, когда генерирует выходные токены. OpenAI утверждает, что пыталась сбалансировать обе фазы, потому что красивый результат на одном участке легко разваливается, если на втором все упрется в память.
Есть и еще одна деталь, которая звучит почти неизбежно для 2026 года: OpenAI использовала собственные модели, чтобы проектировать и оптимизировать сам чип, а также inference-serving engine и кастомные kernels под новые модели. По словам компании, путь от идеи до tape-out занял девять месяцев. Это эффектно, но без мистики: и AMD, и Nvidia уже давно используют похожие подходы внутри своих инженерных процессов. Настоящая проверка здесь не в красивой истории про «AI designed by AI», а в том, сможет ли OpenAI масштабировать платформу на сотни тысяч ускорителей, удержать вменяемую программируемость и нормально довести производство до объемов 2027 года. У GPU по-прежнему огромное преимущество в зрелости экосистемы, инструментах и гибкости. Поэтому сценарий на ближайшие годы выглядит довольно приземленно: обучение frontier-моделей останется на AMD и Nvidia, а собственное железо OpenAI будет постепенно забирать инференс там, где важны себестоимость, задержка и контроль над стеком.
Для рынка это уже не просто новость про еще один чип. Это подтверждение, что AI-инфраструктура входит в фазу вертикальной интеграции, где крупнейшие модельные компании хотят владеть не только API и дата-центрами, но и архитектурой ускорителей. Для разработчиков это значит рост числа оптимизаций под конкретное железо, для бизнеса — новую гонку за цену инференса, а для Nvidia и AMD — неприятный, но логичный вопрос: что произойдет, если самые прожорливые клиенты начнут не только закупать GPU, но и постепенно уходить от них на собственные платформы? Подробнее о показе Jalapeño можно прочитать в материале .