OpenAI 25 августа раскрыла первые измеримые результаты Jalapeño, и главный тезис тут не про очередной «свой чип», а про старую боль AI-инфраструктуры: задержки. Чип OpenAI Jalapeño, представленный еще 24 июня, по данным компании дает от 1,5 до 1,9 раза больше AI-работы на ватт и снижает сквозную задержку в 1,7-3,6 раза по сравнению с системами на Nvidia GB200 и GB300. Для русскоязычной IT-аудитории это важно по простой причине: чем больше бизнес уходит в агентные сценарии, тем дороже становится каждая лишняя миллисекунда.
О новых результатах, как пишет The New Stack, OpenAI рассказала спустя два месяца после анонса Jalapeño. Речь идет о первом кастомном inference-чипе компании, разработанном вместе с Broadcom. Это не ускоритель для обучения моделей, а специализированный ASIC для инференса, то есть для запуска уже обученных моделей в проде: генерации ответов, вызовов инструментов, цепочек действий и прочих вещей, из которых теперь состоят AI-агенты. Именно поэтому OpenAI бьет не в абстрактную «мощность», а в сочетание пропускной способности и задержки: агенту мало быстро выдать один ответ, ему нужно пройти десятки шагов подряд, и просадка на каждом шаге складывается в очень неприятный UX.
Компания мерила Jalapeño на публичном бенчмарке InferenceX от SemiAnalysis. В тестах использовались GPT-OSS 120B, DeepSeek R1 и Kimi K2.5 1T. По заявлению OpenAI, на этих моделях чип OpenAI Jalapeño показал от 1,5 до 1,9 раза больше производительности на ватт на пиковых режимах и от 1,7 до 3,6 раза меньшую end-to-end latency, чем лучшие коммерчески доступные системы в сравнении. На GPT-OSS 120B компания приводит, например, 85 448 против 44 960 mixed TPS на киловатт и 1,03 секунды против 1,80 секунды по задержке. На DeepSeek R1 разница по latency еще заметнее: 1,65 секунды против 5,99 секунды. У Kimi K2.5 1T картина похожая: 1,56 секунды против 5,31 секунды.
Если убрать маркетинговый соус, посыл OpenAI довольно прагматичный. В обычном чат-режиме пользователь еще может простить лишнюю секунду. В агентном режиме лишняя секунда на каждом промежуточном действии быстро превращается в разъехавшийся сценарий: агент дольше думает, дольше ходит в инструменты, дольше подтверждает промежуточные шаги и чаще упирается в системные лимиты. OpenAI прямо говорит, что для таких workloads задержки «накапливаются по всей задаче». Отсюда и ставка на архитектуру, которая не заставляет выбирать между throughput и latency. Вице-президент OpenAI по железу Ричард Хо формулирует это как попытку получить «best of both worlds» там, где рынок обычно жертвует либо скоростью отклика, либо объемом обслуживаемых запросов.
Контекст здесь не менее важен, чем сами графики. К лету 2026 года почти все крупные игроки в AI либо уже строят собственные чипы, либо хотя бы публично показывают такие планы. Причина банальна: зависимость от Nvidia стала слишком дорогой и слишком стратегической. Когда спрос на инференс растет быстрее, чем успевают строиться дата-центры, а агенты добавляют к нагрузке длинные многошаговые цепочки, любая оптимизация в ваттах, задержке и утилизации превращается в деньги. OpenAI в июньском анонсе говорила, что вывела Jalapeño от дизайна до production за девять месяцев, а сам чип должен стать первой ступенью многопоколенной платформы. В той же логике компания описывает и свою «full-stack» стратегию: проектировать модели, софт обслуживания, память, сеть и железо как одну систему, а не собирать инфраструктуру из чужих кубиков в надежде, что оно само срастется.
При этом OpenAI не разыгрывает карту «мы теперь обойдемся без Nvidia». Наоборот, компания довольно аккуратно признает, что Jalapeño не заменит весь текущий парк ускорителей. По словам Хо, OpenAI продолжит широко использовать Nvidia и других партнеров и для обучения, и для инференса. Более того, массового разворота прямо сейчас не будет: Jalapeño планируют развернуть в небольших объемах до конца 2026 года, а заметное наращивание поставок перенести на 2027-й. Это, кстати, важный холодный душ для тех, кто любит читать каждую презентацию чипа как мгновенный переворот рынка. Нет, переворота не будет. Но если OpenAI действительно получила рабочий first-party silicon с внятными метриками, она уже усилила переговорную позицию относительно поставщиков и стоимости инфраструктуры.
Для разработчиков и продуктовых команд из этого следует довольно прикладной вывод. Следующая гонка в AI будет не только про качество моделей, но и про экономику их запуска. Если у провайдера появляется железо, которое лучше держит latency и производительность на ватт в агентных сценариях, это бьет по нескольким точкам сразу: ниже себестоимость выполнения задач, стабильнее SLA, меньше очередей в пиковые окна и выше шанс, что сложные agentic-фичи вообще будут окупаться. Для CTO и платформенных команд это сигнал смотреть не только на бенчмарки моделей, но и на то, как устроен inference-стек поставщика. Для стартапов сигнал еще проще: «умный агент» без предсказуемой инфраструктурной экономики быстро превращается в дорогую демку.
Чип OpenAI Jalapeño интересен не тем, что OpenAI тоже вошла в клуб производителей железа, а тем, что компания пытается решить проблему, которую сама же и помогает разгонять: рост агентных нагрузок. Если в 2024-м и 2025-м рынок в основном спорил о том, какая модель пишет код лучше, то в 2026-м спор постепенно смещается к другому вопросу: кто способен прогонять эти модели быстро, дешево и без просадки под реальной многокроковой нагрузкой. В этом смысле Jalapeño пока не финал истории, а ранний индикатор того, что борьба за AI-сервинг окончательно ушла с уровня API в уровень инфраструктуры. Подробности бенчмарков и цифры OpenAI опубликовала отдельно: .