Два разработчика собрали ручной ИИ в коробке на Raspberry Pi 5: чтобы получить ответ голосового ассистента, устройство нужно буквально крутить рукой. На запуск уходит около 30 секунд, а встроенный блок конденсаторов держит систему без подзарядки лишь примерно 20 секунд. Для русскоязычной IT-аудитории это не курьез про «нейросеть на ручке», а наглядная демонстрация того, сколько вычислений реально нужно небольшим локальным моделям и где заканчивается магия облака.
Проект CrankGPT, как пишет The Register, сделали компьютерный ученый Катрин Томанек и Алекс Кауффманн, бывший технический руководитель Google ATAP, а сейчас сооснователь компании Squeez. Формально это шутка с хорошим инженерным вкусом: голосовой агент, переводчик и несколько режимов работы в 3D-печатном корпусе, которому для жизни нужна человеческая мускульная сила. Но шутка здесь служебная. Авторы через ручной ИИ показывают идею Squeez: специализированные, приватные и экономичные модели, которые можно запускать локально на дешевом железе, а не каждый раз отправлять запрос в гиперскейлер.
Железо у CrankGPT вполне земное. Внутри стоит стандартный Raspberry Pi 5 с 8 ГБ памяти и охлаждающим HAT, а за аудиоввод и вывод отвечает отдельная плата для голосовых ассистентов на RPi. Питание идет от серийной ручной зарядки на 20 Вт с переключаемым напряжением, изначально рассчитанной на аварийную подпитку USB-устройств. Между генератором и платой разработчики поставили самодельный модуль на конденсаторах, который сглаживает работу системы, но не превращает ее в автономную: если перестать крутить, запас энергии заканчивается быстро. По словам Кауффманна, в этом и есть самый интересный эффект: нагрузку можно буквально почувствовать рукой. Когда устройство простаивает и ждет голосовую команду, ручка идет легче. Когда модель генерирует ответ, сопротивление заметно возрастает.
Софт тоже собран без тяги к излишествам. Устройство работает на максимально облегченной сборке DietPi, которая, по словам авторов, загружается в рабочее пользовательское пространство примерно за три секунды. Голосовой агент написан с нуля: разработчики сознательно сократили число зависимостей, чтобы понимать систему целиком, от питания до инференса. Для распознавания речи выбран Moonshine, потому что он быстрый, а для синтеза речи — Piper, потому что хорошо работает в edge-сценариях с ограниченными ресурсами. В роли «мозга» используются компактные модели: Liquid LFM2 1.2B отвечает за общий диалоговый режим, а Gemma 3 1B — за перевод. Сбоку на корпусе есть ручка переключения режимов, кнопка и тумблер, чтобы без терминала менять сценарии работы: от обычных вопросов до игр вроде «две правды и одна ложь».
Локальный ИИ без дата-центра
В истории про CrankGPT важна не экзотика, а контекст. За последние два года рынок привык мерить ИИ по размеру дата-центра, числу ускорителей и счету за электричество. На этом фоне локальные модели долго выглядели компромиссом для энтузиастов: медленно, узко, «не как в облаке». Но именно такие проекты хорошо показывают, что для заметной части практических задач облачный стек действительно избыточен. Кауффманн формулирует это жестко: просить Claude сложить два числа — все равно что бить по мухе шаровой бабой. Формулировка ироничная, но мысль понятна любому CTO, который видел счета за API и пытался объяснить команде, зачем тратить дорогой inference budget на примитивные операции.
Squeez как раз продает идею не универсального суперразума, а маленьких специализированных моделей под конкретную задачу. В качестве примеров Кауффманн называет распознавание речи для человека с сильным акцентом или речевым нарушением, а также локальных экспертов по темам вроде садоводства или ремонта автомобилей. Такие системы не обязаны знать все на свете и не должны с азартом отвечать на любой вопрос. Их ценность в другом: предсказуемый периметр знаний, приватность, работа без сети и более понятная стоимость владения. Для бизнеса это особенно важно там, где данные нельзя уносить в облако по регуляторным, договорным или просто здравым причинам.
Отдельно показательно, что авторов удивило качество перевода. По словам Кауффманна, они не делали дополнительного дообучения, а ограничились простым промптом на пару строк, и для массовых языков этого оказалось достаточно. Это не значит, что ручная коробка заменит продакшн-сервис перевода или колл-центр. Но это хороший сигнал для разработчиков: часть сценариев, которые еще недавно автоматически отправляли в облако, уже можно пересобирать в локальные пайплайны на компактных моделях. Особенно если требования к latency, офлайн-режиму и приватности важнее, чем универсальность.
Что из этого следует разработчикам и командам
CrankGPT полезен как инженерный тезис, а не как будущий массовый продукт. Сами авторы прямо говорят, что не собираются строить классы с велотренажерами для питания AI-стека девкоманды, хотя и шутят, что двадцать человек на велосипедах могли бы выдать приличную мощность. Зато проект трезво показывает ограничения. Главное узкое место — не только скорость инференса, но и питание: одноплатные компьютеры вроде Raspberry Pi могут в пике потреблять достаточно тока, чтобы сработала защита маленького генератора. Иными словами, edge AI упирается не только в модель и оптимизацию, но и в грубую физику устройства.
Есть и более прикладной вывод. Когда ИИ запускается от человеческой руки, исчезает привычная иллюзия бесплатности запроса. У облачного ассистента стоимость спрятана в подписке, в API-счете или в бюджете на инфраструктуру. Здесь цена ответа ощущается в запястье. Для продактов и техлидов это почти идеальная метафора: любой «быстрый вопрос к модели» что-то стоит, и не всегда рационально гонять ради него тяжеловесный стек. Для разработчиков это еще и напоминание, что хорошая архитектура ИИ-сервиса начинается не с выбора самой модной модели, а с вопроса, какая минимальная модель справится с задачей достаточно хорошо.
С практической стороны проект тоже не выглядит недостижимым. По оценке Кауффманна, сборка сейчас обойдется примерно в 300 долларов, хотя раньше укладывалась примерно в 150 — подорожала память. Авторы обещают выложить схемы и планы сборки, а код голосового агента уже доступен для экспериментов. Устройство, по их словам, уже умеет не только отвечать на вопросы и переводить речь, но и генерировать небольшие изображения, писать плохие стихи и даже код. Последнее, пожалуй, стоит воспринимать без романтики: если код пишет коробка, которую надо крутить вручную, у разработчика появляется редкий шанс вовремя спросить себя, действительно ли эта автогенерация была нужна. Подробности проекта и артефакты авторов можно посмотреть у .