DeepSeek и Huawei выпустили открытые инструменты Ascend для AI-разработчиков: библиотеки вычислений, коммуникаций между чипами и нативную поддержку Ascend 950 в TileLang. По данным Tom's Hardware, цель набора вполне прямая: дать разработчикам рабочую альтернативу части экосистемы Nvidia, где CUDA годами была не просто SDK, а почти пропуском в большую лигу машинного обучения.
В релиз вошли DeepGEMM-Ascend и DeepEP-Ascend. Первая библиотека отвечает за матричные операции и другие вычисления, которые используются в моделях DeepSeek. Она поддерживает BF16, FP8 и FP4, а интерфейсы сохранены совместимыми с уже существующей DeepGEMM. Для команд это важная мелочь с большим эффектом: при переносе нагрузки на Ascend не нужно переписывать весь слой вызовов ради нового железа.
DeepEP-Ascend закрывает другую боль больших моделей — обмен данными между ускорителями. Библиотека рассчитана на обучение и инференс, включая маршрутизацию данных к разным экспертам в mixture-of-experts-моделях и сборку их результатов обратно. MoE-архитектуры экономят вычисления, но требуют аккуратной логистики: если данные бегают между чипами медленнее, чем ускорители считают, дорогой кластер превращается в набор очень горячих ожидателей.
DeepSeek и Huawei тестировали эти инструменты Ascend на системе supernode из 128 чипов Ascend 950. В таких конфигурациях производительность определяется не только тем, насколько быстро каждый ускоритель умножает матрицы. Не менее важно, успевает ли сеть внутри узла кормить чипы данными, синхронизировать работу и не превращать распределенное обучение в марафон блокировок. Поэтому релиз выглядит не как косметическая обвязка вокруг железа, а как попытка закрыть два базовых слоя AI-инфраструктуры: вычисления и коммуникации.
Отдельный кусок новости — TileLang. Это высокоуровневый язык для написания оптимизированных ядер, который уже работал с Nvidia и другим железом, а также имел адаптеры для Huawei Ascend. Обновление от 30 сентября добавило нативную поддержку Ascend 950: генерацию кода, автоматическое планирование и синхронизацию. DeepSeek описывает подход как более простой для разработки, чем CUDA. Тут лучше без фанфар: CUDA не стала стандартом по недоразумению, у нее годы зрелости, огромная база библиотек и армия разработчиков. Но появление удобного слоя поверх Ascend снижает порог входа, а это ровно то, чего обычно не хватает альтернативным ускорителям.
Набор строится поверх CANN — программной платформы Huawei для запуска AI-нагрузок на Ascend. Это важный контекст: конкуренция с Nvidia идет не только в ваттах, FLOPS и доступности чипов. Главный ров вокруг Nvidia — софт. CUDA, cuDNN, NCCL, профилировщики, готовые рецепты оптимизации, привычки инженеров и тысячи строк кода в production-пайплайнах. Железо можно объявить быстрее на слайде, но если команда потратит месяцы на портирование и отладку, экономия быстро станет бухгалтерской фантазией.
Для китайского рынка этот релиз ложится в понятный тренд: снижать зависимость от американских ускорителей и связанных с ними ограничений. DeepSeek получает шанс плотнее оптимизировать свои модели под локальную аппаратную базу, Huawei — более убедительный аргумент для разработчиков, которым нужны не только чипы, но и нормальные инструменты. Для русскоязычных IT-команд практический вывод шире: мультивендорность в AI-инфраструктуре перестает быть красивой архитектурной мечтой и становится вопросом доступа, стоимости и политических рисков.
При этом TileLang сохраняет поддержку нескольких платформ, включая Nvidia. Это делает историю менее похожей на закрытый китайский остров и более похожей на попытку встроиться в реальный рынок, где компании не хотят выбирать стек на годы вперед с паяльником у виска. Если один и тот же язык помогает писать ядра под разные ускорители, разработчик получает хотя бы шанс сравнивать железо по делу, а не по тому, где меньше боли при миграции.
Анонс вышел через две недели после того, как Huawei представила новое поколение AI-процессоров и supernode-систем. Компания заявляла, что рассчитывает на широкое использование своих AI-систем для обучения моделей в 2027 году. DeepSeek и Huawei уже работали вместе над DeepSeek V4, preview-версия которой вышла в апреле с поддержкой Ascend; Huawei также говорила, что supernode на Ascend 950 полностью поддерживает V4, а ее чипы использовались при обучении части облегченной V4-Flash.
Главный вопрос теперь не в том, можно ли собрать альтернативу CUDA на бумаге. Можно. Вопрос жестче: хватит ли DeepSeek, Huawei и сообществу терпения довести инструменты Ascend до уровня, где разработчик выбирает их не из патриотизма или дефицита Nvidia, а потому что задача действительно считается быстрее, дешевле или предсказуемее.