AI И НЕЙРОСЕТИ

SK hynix показала memristor-чип для edge AI, но есть нюанс

21,3 TOPS/Вт на 65-нм техпроцессе: SK hynix и TetraMem показали memristor-чип для edge AI, но не раскрыли его реальную общую производительность.

✍️ Редакция iTech News | 11.07.2026 | ⏱ 5 мин | Источник: Tom's Hardware

SK hynix, TetraMem и исследователи из Университета Южной Калифорнии собрали экспериментальный чип для edge AI на memristor-памяти и заявили энергоэффективность до 21,3 TOPS/Вт. Цифра выглядит сильно, особенно для 65-нм техпроцесса, но с производительностью все не так гладко: авторы показали, что идея работает, однако не доказали, на что этот SoC способен в полной конфигурации.

По данным Tom's Hardware, речь идет о system-on-chip для запуска инференса легких нейросетей на периферийных устройствах, где важнее не абсолютная скорость, а баланс между энергопотреблением, площадью и достаточной точностью. Проще говоря, это не соперник серверным GPU и не замена полноразмерным NPU в ноутбуках класса Copilot+, а попытка сделать вычисления ИИ дешевле по энергии там, где каждый милливатт на счету: в камерах, датчиках, компактной робототехнике и другой встраиваемой электронике.

Ключевая идея проекта в том, что вычисления выполняются прямо в памяти, по модели in-memory computing. Для нейросетей это важный трюк: чем меньше данных гоняется между памятью и вычислительными блоками, тем ниже энергозатраты. В данном случае команда использовала memristor-массивы, которые умеют выполнять аналоговое умножение векторов на матрицы внутри самих ячеек памяти. На бумаге это выглядит почти как давняя мечта железячников: меньше перемещений данных, меньше потерь, выше эффективность. На практике же все упирается в то, как именно такая архитектура справляется с реальными слоями нейросетей, а не с красивыми формулами в презентации.

И здесь авторы попытались закрыть довольно конкретную проблему. Легкие модели семейства MobileNet активно используют depthwise convolution, а такой тип свертки плохо ложится на обычные crossbar-массивы: повторное использование данных ограничено, загрузка массива получается неидеальной, эффективность падает. Поэтому в новом SoC сделали не просто набор стандартных IMC-блоков, а отдельный NPU, оптимизированный именно под depthwise convolution. Всего в чипе 10 NPU и встроенный RISC-V-процессор, который распределяет нагрузку. Девять NPU обслуживают pointwise и dense-операции, а десятый выделен под depthwise convolution.

Обычные девять NPU используют crossbar 256 × 256, а также наборы 8-битных DAC и ADC: первые переводят цифровые активации в аналоговые напряжения, вторые возвращают результат обратно в цифровую форму. Специализированный блок для depthwise convolution устроен иначе. Вместо стандартной топологии там применены восемь zig-zag crossbar-блоков размером 252 × 28. За счет диагональных линий выбора такая схема позволяет параллельно выполнять 28 независимых сверток 3 × 3 и при этом использовать массив под хранение весов полностью, без привычной для таких задач потери полезной площади. Если убрать инженерную поэзию, то главный технический результат проекта именно здесь: команда придумала, как лучше упаковать неудобную для IMC-архитектур операцию в memristor-железо.

Есть и еще один интересный момент. Memristor-ячейки в этой реализации программируются с эффективной точностью лишь немногим выше 2 бит. Для нейросетевых весов этого маловато, поэтому исследователи применили схему компенсации на двух подмассивах и подняли эффективную точность примерно до 4 бит. Отдаленно это напоминает общую логику последних индустриальных экспериментов с низкой разрядностью: рынок все активнее соглашается, что не каждая ИИ-задача требует тяжелого FP16 или INT8, если архитектура и калибровка позволяют удержать приемлемую точность. Только здесь решение не цифровое, а аналоговое, со всеми его плюсами и неизбежной головной болью.

Для демонстрации чипа авторы запустили кастомную сеть MobileNetV1Small на бенчмарке Visual Wake Words. Модель содержит около 36 тысяч параметров: depthwise-слои отправили на специализированный NPU, а pointwise-слои разложили по стандартным блокам. Итоговая точность инференса составила 80,36% и совпала с соответствующей 4-битной программной моделью. Это важный результат, потому что он показывает: вся аналоговая экзотика не развалила точность сильнее, чем уже заложено в низкоразрядной квантизации. Для разработчиков edge-решений это, пожалуй, более содержательный сигнал, чем сама маркетинговая цифра TOPS/Вт.

С цифрами производительности картина уже менее праздничная. Один NPU выдает пиковые 0,254 TOPS, а энергоэффективность достигает 21,3 TOPS/Вт на 100 МГц и 11,9 TOPS/Вт на 400 МГц. Авторы работы утверждают, что это выглядит выгодно на фоне опубликованных SRAM-ускорителей класса compute-in-memory и даже превосходит Nvidia A100 в режиме INT8 по эффективности на порядок. Но здесь начинается та часть, где инженер читает статью и задает неприятные вопросы. Демонстрация не использует все 10 NPU одновременно: задействованы один специализированный и пять стандартных, а еще четыре стандартных остаются без работы. То есть публикация не показывает полную пропускную способность всего SoC, не раскрывает устойчивую производительность на реальной сети при полной загрузке и даже не отвечает прямо, можно ли вообще одновременно насытить все 10 блоков.

Из-за этого теоретический потолок в 2,54 TOPS для всего чипа остается именно теорией. Для сравнения: даже сам источник напоминает, что такой максимум примерно в 16 раз ниже требований Microsoft к устройствам класса Copilot+. Для российского читателя из мира разработки и продуктовых команд смысл здесь довольно приземленный. Этот чип для edge AI не про ноутбук с локальным ассистентом и не про серверную инференс-ферму. Он про класс устройств, где важнее, чтобы модель распознала событие локально и не посадила батарею за полдня. Если архитектура масштабируется, у нее есть шанс попасть в датчики, камеры и промышленные контроллеры. Если нет, она останется красивым академическим кейсом про то, что memristor-подход в принципе жизнеспособен.

Для рынка полупроводников здесь есть еще один практический вывод. SK hynix в последние годы ассоциируется прежде всего с памятью для ИИ-бумов вроде HBM, но такие проекты показывают, что производители памяти хотят застолбить место и в следующем раунде аппаратной гонки, где ценность будет не только в гигабайтах и пропускной способности, но и в самой логике вычислений рядом с памятью. Вопрос теперь не в том, можно ли собрать рабочий memristor-SoC, а в том, удастся ли превратить лабораторный чип для edge AI в платформу с предсказуемой производительностью, понятным стеком разработки и экономикой, которая переживет встречу с обычными цифровыми NPU. Исходные детали проекта можно проверить в материале Tom's Hardware.

Поделиться: Telegram X LinkedIn