AI И НЕЙРОСЕТИ

Tensordyne ставит на логарифмы в гонке AI-чипов с Nvidia

17-кратный рост токенов на ватт обещает Tensordyne: стартап делает AI-ускоритель Napier на 3 нм и идет против Nvidia через логарифмическую математику.

✍️ Редакция iTech News | 20.06.2026 | ⏱ 5 мин | Источник: The Register
🎯

Стартап Tensordyne отправил в производство на 3-нм техпроцессе TSMC свой первый коммерческий чип Napier и сразу заявил амбиции уровня Nvidia: до 17 раз больше токенов на ватт и до 13 раз выше пропускная способность на стойку по сравнению с системами Blackwell. Для русскоязычной IT-аудитории здесь важен не только сам ускоритель Tensordyne, но и подход: компания пытается переиграть рынок AI-железа не числом CUDA-ядер, а другой математикой в основе вычислений.

Об этом сообщает The Register. По данным издания, Tensordyne развивает архитектуру вместе с Juniper Networks и Broadcom и делает ставку на логарифмическое представление чисел. Идея старая, почти школьная: умножение можно заменить сложением логарифмов. Для AI-нагрузок это звучит как инженерская провокация, потому что вся современная гонка ускорителей крутится вокруг того, как быстрее и экономичнее выполнять массивные матричные умножения.

В обычной цифровой логике сложение дешевле умножения. Tensordyne пытается этим воспользоваться на уровне железа: вместо классического multiply-accumulate, то есть блока MAC, чип оценивает логарифмы и антилогарифмы значений, а затем сводит тяжелую часть операции к сложению. На бумаге идея красивая, но всегда упиралась в точность. Делать это через таблицы поиска было бы слишком дорого по площади кристалла, поэтому компания, по словам сооснователя Жиля Бакхуса, выбрала приближение Митчелла и добавила аппаратный механизм секционной коррекции ошибки. Заявление смелое: итоговая точность должна соответствовать FP16, при этом сам Napier также поддерживает FP8 и 4-битный block floating format.

Если отбросить математическую экзотику, по базовым характеристикам Napier выглядит как серьезный, но не запредельный ускоритель. У него номинальный TDP 300 Вт, 144 ГБ памяти HBM3e в четырех стеках, пропускная способность памяти 4,7 ТБ/с и до 2,1 петафлопс плотной производительности в FP8. The Register сравнивает это скорее с Nvidia H200, а не с самыми новыми флагманами рынка. Но в заявлении Tensordyne важнее другое: компания утверждает, что добивается сопоставимого класса производительности при почти на 60 процентов меньшем энергопотреблении. Для операторов дата-центров именно ватт, киловатт и требования к охлаждению уже давно стали не менее важны, чем пиковые FLOPS в презентации.

Ставка не на один чип, а на стойку

Сама Tensordyne не пытается продать Napier как «убийцу GPU» в формате одной карты. Компания строит аргументацию вокруг масштабирования. Каждый чип получает около 1 ТБ/с межсоединения, а система TDN72 собирает до 72 ускорителей в одном pod. Конфигурация выглядит так: восемь вычислительных blade-модулей, в каждом по одному 10-ядерному Intel Xeon-D и девять ускорителей Napier. Сзади стоят шесть фирменных fabric switch blade, которые Tensordyne разрабатывает вместе с Juniper. Топология напоминает Nvidia GB200 NVL72: идея та же, сделать из множества ускорителей один большой вычислительный контур с максимально плотным обменом данными.

Главное отличие в том, что Tensordyne обещает более приземленную эксплуатацию. TDN72 рассчитана на 30 кВт и не требует жидкостного охлаждения. Для владельцев старых корпоративных и колокейшн-площадок это не мелочь. Новые AI-кластеры часто упираются не только в цену железа, но и в банальную инженерную реальность: электропитание, плотность мощности, HVAC, готовность к liquid cooling. По словам Бакхуса, в одну большую 52U-стойку можно установить до четырех таких систем, то есть получить 608 петафлопс FP8 в пределах 120 кВт. В пересчете на стойку компания заявляет примерно в 1,68 раза более высокую плотность FP8-вычислений, чем у Nvidia GB200 NVL72. Но и здесь есть важная оговорка: у Nvidia есть ускорение NVFP4, тогда как у Napier речь идет только о FP4-весах. А пиковые FLOPS, как все уже усвоили, плохо описывают реальную жизнь моделей.

Для разработчиков и продактов этот сюжет интересен не тем, что появился еще один производитель чипов, а тем, где он пытается прорваться. Рынок AI-ускорителей давно перестал быть гонкой «кто выпустит плату». Почти все молодые игроки обещают много вычислений на ватт. Но выиграют те, кто одновременно решит три задачи: доставит железо, обеспечит масштабирование по сети и не заставит клиента переписывать половину ML-стека. Tensordyne, судя по материалу, поняла это рано. Прототипы компании еще несколько лет назад требовали quantization-aware training, чтобы модели вообще считались корректно. Для запуска крупных LLM это был почти приговор. Теперь компания утверждает, что ее компилятор может адаптировать уже существующие модели под новое железо напрямую.

Софт по-прежнему решает

Именно здесь начинается самая дорогая часть любой такой истории. Tensordyne делает собственную inference-платформу и runtime, но при этом обещает совместимость с привычными серверами инференса вроде vLLM. Поддержка PyTorch еще в разработке. Для отрасли это важнее, чем красивая математика с логарифмами. История последних лет показала, что даже очень сильные чипы можно утопить в сыром SDK, неудобном компиляторе и бесконечном списке «эта модель пока не поддерживается». AMD, Intel и ряд стартапов уже убедились, что разработчик простит меньший theoretical peak, но не простит больную интеграцию и непредсказуемую производительность в проде.

При этом Tensordyne не скрывает, что делает смелые заявления до выхода продукта на рынок. Бакхус говорит о производительности выше 1000 токенов в секунду без speculative decoding и multi-token prediction. Неоклауд-провайдеры Cirrascale и BlueSky Compute уже проявили интерес к будущим поставкам. Это хороший сигнал, но пока именно сигнал, а не рыночный verdict. Napier должен выйти только во втором или третьем квартале 2027 года, а конкурировать ему придется уже не с Blackwell как таковым, а с системами Nvidia следующего поколения Vera Rubin и Vera Rubin Ultra. То есть окно на ошибку у стартапа короткое: если софт, поставки или реальная эффективность окажутся слабее обещаний, рынок просто не будет ждать.

Для индустрии здесь важен более широкий вывод. Похоже, эпоха, когда AI-железо соревновалось почти исключительно размером GPU и пропускной способностью HBM, заканчивается. Новые компании снова лезут в фундамент: меняют арифметику, схему интерконнекта, компромисс между точностью и энергопотреблением. Если ускоритель Tensordyne хотя бы частично подтвердит заявленные цифры, давление на рынок вырастет не только для Nvidia, но и для всех, кто строит AI-инфраструктуру по привычному рецепту. Если нет, это будет еще одно напоминание, что в серверной AI-экономике выиграть нужно сразу на трех фронтах: кремний, сеть и софт. Подробности первоисточника доступны в материале The Register.

Поделиться: Telegram X LinkedIn