AI И НЕЙРОСЕТИ

AMD и Cerebras готовят ответ Nvidia в гонке AI-инференса

AMD и Cerebras обещают до 5 раз повысить энергоэффективность AI-инференса, объединив Instinct GPU и ускорители WSE для агентных нагрузок.

✍️ Редакция iTech News | 24.07.2026 | ⏱ 4 мин | Источник: The Register
🤖

AMD собрала новый альянс против Nvidia в самом нервном сегменте рынка ИИ: компании объявили о партнерстве с Cerebras, чтобы ускорить AI-инференс для агентных систем и, по их оценке, поднять эффективность по токенам на ватт до 5 раз. Для разработчиков и инфраструктурных команд это важный сигнал: борьба за ИИ давно идет не только за самые мощные GPU, но и за то, кто быстрее и дешевле отдает токены в проде.

О партнерстве AMD и Cerebras, как пишет The Register, объявили со сцены во время keynote главы AMD Лизы Су на мероприятии Advancing AI 23 июля 2026 года. Идея довольно прагматичная: тяжелую вычислительную часть, связанную с обработкой промпта, оставлять на GPU линейки Instinct, а более чувствительную к памяти фазу генерации токенов выносить на ускорители Cerebras Wafer Scale Engine. Такая схема должна дать сверхнизкую задержку для агентных нагрузок, где важна не только общая пропускная способность, но и ощущение «живого» ответа системы.

Технически ставка делается на разницу в архитектуре памяти. GPU хороши в обучении и в большом классе универсальных задач, но в инференсе узким местом часто становится не чистая математика, а то, как быстро система умеет крутить память под генерацию токенов. Cerebras продвигает здесь свой старый, но теперь особенно востребованный тезис: wafer-scale ускорители не завязаны на HBM4 так же, как традиционные GPU-системы, а используют встроенную SRAM, которая на порядки быстрее по доступу. На этом фоне Cerebras уже успела заработать репутацию одного из самых быстрых провайдеров AI-инференса: компания заявляет скорости, которые нередко превышают 2000 токенов в секунду.

В AMD эту историю не продают как замену GPU. Скорее наоборот: компания признает, что одной универсальной архитектурой рынок больше не закрыть. На сцене глава Cerebras Эндрю Фельдман сформулировал это почти рекламно, но по сути верно: у AMD в стойке Helios есть сильные позиции по производительности и объему памяти, у Cerebras — лидерство по SRAM и пропускной способности памяти, а вместе это должно дать конфигурацию без прямого аналога. Конкретных бенчмарков, цен и параметров конфигурации компании пока не раскрыли, и это важная оговорка. Обещание «до 5 раз» по токенам на ватт звучит громко, но без тестов на реальных моделях и профилях нагрузки его пока стоит читать как ориентир, а не как гарантию для дата-центра.

При этом рыночный контекст делает новость заметно интереснее обычного партнерского анонса. AMD явно закрывает дыру в своем AI-портфеле, которая особенно бросалась в глаза после того, как Nvidia в декабре потратила $20 млрд на acquihire Groq. В марте 2026 года Nvidia уже показывала Groq 3 LPU рядом с системами Vera Rubin как ответ на ту самую проблему: инференсу нужна бешеная скорость работы с памятью, а не только грубая вычислительная сила. И вот теперь AMD, не имея собственного Groq-подобного блока, приводит в экосистему Cerebras — компанию, которая решает похожую задачу, но иным способом.

Сравнение с Groq здесь напрашивается не только политически, но и инженерно. По данным The Register, роль ускорителей Cerebras в новой схеме похожа на роль LPU Groq 3 в стеке Nvidia. Разница в масштабе особенно броская на бумаге: если для обслуживания модели на триллион параметров вроде Kimi K2.5 системе Nvidia, как утверждается, может понадобиться около двух тысяч LPU Groq с SRAM, то AMD и Cerebras рассчитывают обойтись максимум несколькими десятками своих ускорителей. Это сильное заявление, и именно его отрасль теперь будет разбирать с лупой: какие допущения заложены в оценку, какая точность модели, какой batch, какой контекст, какая стоимость владения и на каких задачах этот разрыв вообще воспроизводится.

Для русскоязычной ИТ-аудитории здесь важен не только сюжет «еще один выпад против Nvidia». Намного важнее то, что рынок AI-инференса все быстрее уходит от идеи одной серебряной пули. Если в 2023–2024 годах почти все разговоры крутились вокруг дефицита GPU и объемов HBM, то в 2026-м инфраструктурный стек дробится на специализированные слои: отдельно обучение, отдельно prompt processing, отдельно генерация токенов, отдельно orchestration для агентных сценариев. Это меняет требования к архитектуре сервисов. Для разработчиков LLM-продуктов это означает, что оптимизация inference pipeline снова становится инженерной задачей, а не просто вопросом закупки «побольше ускорителей». Для CTO и фаундеров — что при выборе облака и железа придется смотреть не на маркетинговый TOPS, а на задержку, стоимость токена, энергопотребление и поведение под реальной многопользовательской нагрузкой.

Отдельно показательно, что AMD подает все это через идею открытой экосистемы. Лиза Су после keynote прямо сказала, что компания готова работать и с другими игроками, если их технологии помогают полезно разделять нагрузки. Иными словами, Cerebras может быть не разовой сделкой, а частью более широкой стратегии workload disaggregation, где GPU перестают быть единственным центром AI-инфраструктуры. Если этот подход взлетит, рынок ждут не столько новые монолитные суперсистемы, сколько связки из специализированных компонентов, собранные под конкретный тип модели и профиль трафика. Для Nvidia это плохая новость не потому, что у нее внезапно закончились козыри, а потому, что конкуренты наконец перестают играть с ней в одну и ту же игру. Проверить исходные заявления и цитаты можно в материале The Register.

Поделиться: Telegram X LinkedIn