AI И НЕЙРОСЕТИ

Разработчик запустил LLM на ESP32-S3 и получил почти 10 токенов/с

9,88 токена в секунду на ESP32-S3: разработчик уместил LLM на микроконтроллере с 512 КБ SRAM и 8 МБ PSRAM, вынеся 25 млн параметров во flash.

✍️ Редакция iTech News | 05.08.2026 | ⏱ 4 мин | Источник: The Register
🤖

9,88 токена в секунду на ESP32-S3 с 512 КБ SRAM и 8 МБ PSRAM, так выглядит очередной аргумент в пользу того, что LLM на микроконтроллере уже не мем, а рабочий инженерный трюк. Для русскоязычных команд, которые делают IoT, встраиваемые устройства и офлайн-функции на краю сети, это важный сигнал. Граница между игрушечной демкой и локальной AI-логикой снова сдвинулась.

По данным The Register, разработчик под ником SlvDev запустил на плате ESP32-S3 N16R8 собственную 28,9-миллионную языковую модель, обученную на датасете TinyStories. Вся генерация идет локально, без сервера и API, а текст выводится на подключенный экран со скоростью 9,88 токена в секунду. Исходники, замеры и прошивка лежат в открытом репозитории esp32-ai, который по состоянию на 4 августа 2026 года набрал около 3,4 тыс. звезд на GitHub.

Фокус тут не в том, что еще один энтузиаст запустил что-то AI на экзотическом железе. ESP32-S3 в конфигурации автора, это плата примерно за $8, дает всего 512 КБ SRAM, 8 МБ PSRAM и 16 МБ flash. Для генеративной модели это почти издевательство: если хранить веса в 16-битном виде, модель такого размера потребовала бы около 60 МБ памяти. SlvDev сначала уронил точность до 4 бит и сжал веса до 14,9 МБ, но даже после этого модель целиком не помещалась в быструю память.

Дальше начинается инженерия, ради которой этот кейс и обсуждают. Автор взял Per-Layer Embeddings из семейства Gemma 3n: самые толстые части модели не держат в RAM, а кладут в flash и подгружают малыми порциями. В его схеме 25 млн параметров живут в flash-таблице объемом около 12 МБ, а на каждый токен чип вытаскивает примерно шесть строк, то есть около 450 байт данных. Внутренняя SRAM занята тем, что часто трогается во время вычисления, PSRAM держит output head и рабочие буферы, а flash служит складом для большой таблицы. По замерам из RESULTS.md, случайное чтение строки из flash занимает 20,3 микросекунды, а сама таблица стоит примерно 0,12 мс на токен. Для сравнения, один последовательный проход по output head в PSRAM съедает около 17,3 мс. Иначе говоря, бутылочное горлышко оказалось не там, где его обычно ждут.

Контекст здесь важнее самой демки. В 2026 году локальные модели на ноутбуках и смартфонах уже никого не удивляют, а крупные вендоры продвигают те же идеи экономии памяти для on-device AI. История про LLM на микроконтроллере идет еще дальше: она показывает, что спор теперь не только про FLOPS, но и про то, как именно разложить параметры по уровням памяти. Для сравнения, сам автор приводит предыдущий публичный ориентир на таком классе чипов, около 260 тыс. параметров на ESP32-S3. Его конфигурация хранит 28,9 млн параметров, так что разница измеряется уже не процентами, а примерно двумя порядками величины.

Тут, впрочем, полезно не дорисовывать лишнего. Эта модель не превращает ESP32 в карманный чат-бот: она пишет короткие простые истории и в основном держит связность, потому что обучена именно на таком домене. Она не предназначена для ответов на произвольные вопросы, не умеет писать код и не тянет агентные сценарии. Для бизнеса это не повод срочно пересобирать продукт вокруг ESP32, а для разработчиков хороший маркер, куда движется edge AI. Если такой разнос параметров по SRAM, PSRAM и flash работает на дешевой плате, следующим предметом экспериментов станут не универсальные ассистенты, а очень узкие офлайн-функции, где важнее приватность, задержка и автономность, чем общий интеллект.

Следующий вопрос уже не в том, можно ли вообще запустить LLM на микроконтроллере. Вопрос в том, сколько пользы удастся выжать из подобных узких моделей до того, как упрешься не в RAM, а в качество данных, энергопотребление и здравый смысл продуктовой команды. Если рынок научится упаковывать такие схемы в предсказуемые toolchains и понятные SDK, edge AI получит еще один маршрут мимо облака и дорогих SoC. Исходный разбор и ссылка на репозиторий разработчика есть у The Register.

Поделиться: Telegram X LinkedIn