AI И НЕЙРОСЕТИ

ИИ-кодеры подводят робототехнику к массовому входу

Два роботизированных манипулятора LeRobot и ИИ-агент OpenClaw показали, как кодовые модели снижают порог входа в робототехнику.

✍️ Редакция iTech News | 21.05.2026 | ⏱ 5 мин | 👁 3 | Источник: Wired
ИИ-кодеры подводят робототехнику к массовому входу

Порог входа в ИИ в робототехнике снова просел вниз: автор эксперимента с агентом OpenClaw подключил к нему реальный манипулятор LeRobot 101, после чего ИИ помог настроить железо, написать код для захвата объекта и даже поучаствовал в обучении модели для простых операций с предметами. Для русскоязычных разработчиков и продуктовых команд это важный сигнал: роботы все меньше зависят от узких специалистов, а все больше — от качества кода, данных и инструментов вокруг LLM.

Как пишет Wired, речь не о красивой демке в симуляторе, а о попытке дать агенту физическое тело и проверить, насколько далеко его можно довести с помощью современных моделей, умеющих программировать. Автор купил готовый комплект LeRobot 101 — это часть open-source-проекта Hugging Face, рассчитанного на сравнительно недорогой вход в эксперименты с роботами. В наборе два манипулятора: управляющий, которым человек двигает вручную, и ведомый, оснащенный камерой и повторяющий движения. Такая схема нужна не ради зрелища: она позволяет собирать данные для обучения, когда оператор показывает действие, а модель учится связывать картинку с камеры и движение руки.

Самое показательное в этой истории — не то, что робот сумел помахать рукой или схватить красный мяч. Гораздо важнее, сколько инженерной рутины взяла на себя связка OpenClaw и Codex. До этого автор несколько часов пытался сам подключить и откалибровать робот, в какой-то момент едва не перегрев моторы из-за неверных настроек. После подключения ИИ-агента задача сдвинулась: модель помогла разобраться с конфигурацией соединений в терминале, вместе с человеком прошла калибровку суставов и написала Python-скрипт, который использовал несколько библиотек для распознавания объекта и управления захватом. Да, вайб-кодинг с железом по-прежнему опасен: галлюцинации в коде рядом с реальными двигателями, камерами и питанием — это не тот случай, где ошибку можно просто пережить. Но сам факт, что агент довел систему до рабочего захвата предмета, говорит о смене масштаба задачи.

Следующий шаг был уже ближе к тому, что интересует индустрию, а не только энтузиастов. Автор использовал OpenClaw не просто как помощника по скриптам, а как проводника по процессу обучения модели управления манипулятором. Они перебрали несколько подходов, после каждого запуска агент помогал оценивать ошибку модели, а затем корректировать процесс. В итоге роботизированная рука научилась подбирать и перекладывать объекты. До универсального домашнего робота отсюда примерно как от удачного pet-project до стабильного enterprise-продукта, но направление видно довольно четко: ИИ в робототехнике все сильнее смещается от ручной настройки каждой детали к итеративной разработке, где естественный язык, кодогенерация и быстрое обучение работают в одной цепочке.

У этого подхода уже есть исследовательская рамка. Wired напоминает, что еще в 2022 году в научной работе появился термин code as policy — идея о том, что программный код, который генерирует и адаптирует модель, может выступать как практический слой управления роботом. С тех пор качество ИИ-моделей для программирования выросло настолько быстро, что концепция из исследовательской экзотики превратилась в рабочий трек для лабораторий. Робототехник Кен Голдберг из UC Berkeley формулирует это довольно точно: ИИ-кодинг может закрыть разрыв между классическими инженерными методами, которые надежны, но плохо обобщаются, и современными vision-language-action-моделями, которые обобщают лучше, но пока не дотягивают по надежности. Это, пожалуй, и есть главный нерв всей темы: индустрии не нужен еще один эффектный ролик, ей нужен способ совместить предсказуемость промышленной автоматизации с гибкостью генеративного ИИ.

На этом фоне особенно интересно, что исследовательская группа Голдберга вместе со специалистами Nvidia, Carnegie Mellon University и Stanford недавно представила бенчмарк CaP-X для оценки того, как coding-модели справляются с робототехническими задачами. Результат слегка сбивает привычную иерархию обсуждений вокруг LLM: по данным этого бенчмарка, лучшей моделью для программирования роботов оказался не Claude и не ChatGPT, а Gemini. Возможное объяснение в статье звучит логично: Google DeepMind давно тренирует модели на мультимодальность и понимание физического мира, а для робота это не факультатив, а база. Вдобавок исследователи сделали среду CaP-Gym, где кодовые агенты могут управлять и симулированными, и реальными роботами, а также фреймворк CaP-Agent0. По словам авторов, он настолько повышает качество coding-моделей на задачах манипуляции, что те в ряде сценариев обходят модели, обученные напрямую управлять движениями робота.

Для бизнеса и инженерных команд вывод тут практический, без лишней футурологии. Если раньше робототехнический стек начинался с поиска дефицитных специалистов по интеграции железа, низкоуровневому управлению и обучению моделей, то теперь часть этой сложности съедают open-source-наборы, готовые среды и ИИ-ассистенты по коду. Это не отменяет требований к безопасности, тестированию и контролю над физическим устройством. Наоборот, цена ошибки становится выше: неправильный промпт может обернуться не багом в веб-интерфейсе, а перегретым мотором или сломанным захватом. Но меняется экономика входа. Для стартапов это шанс быстрее проверять гипотезы в логистике, ритейле, агротехе и производстве. Для разработчиков — повод смотреть на робототехнику не как на закрытый клуб людей с осциллографами, а как на соседний слой софта, где уже работают знакомые паттерны: дебаг, итерации, датасеты, оркестрация агентов.

Эту мысль в статье прямо проговаривает Спенсер Хуанг, участвующий в исследовательском проекте с Голдбергом и во внутренних хакатонах Nvidia по теме vibe coding для роботов: если почти любой человек сможет управлять роботами голосом, текстовой командой или демонстрацией действия, это станет критическим unlock-моментом для появления роботов в повседневной экономике. Вопрос теперь не в том, научится ли очередной манипулятор брать красный мяч, а в том, кто первым превратит такие эксперименты в устойчивый инструмент разработки. Подробности кейса собраны в материале Wired.

Поделиться: Telegram X LinkedIn