Google DeepMind показала Gemini Robotics 2 — новую версию своей платформы для роботов, которая управляет уже не только руками, но и всем телом гуманоидной машины. Для рынка это важный сдвиг: отрасль снова пытается доказать, что «физический ИИ» умеет не только красиво выглядеть в роликах, но и выполнять связные действия в реальной среде.
В новой демонстрации гуманоидный робот ходит, приседает, тянется к предметам, берет лейку, снимает вещи с полки, завязывает мусорный пакет и выкручивает лампочку. Ключевая мысль здесь не в самой подборке трюков, а в том, что Google пытается собрать единый стек управления движением, восприятием сцены и выполнением задачи.
Что изменилось в Gemini Robotics 2
Главное отличие от предыдущей версии в том, что Gemini Robotics 2 отвечает за движения «от ног до пальцев». Если ранняя модель в основном работала с верхней частью тела, то теперь система координирует ходьбу, наклоны, вытягивание корпуса и точные манипуляции кистями. По данным The Verge, это позволяет роботу не просто дотянуться до объекта, а подойти к нему, занять нужную позу и аккуратно выполнить действие.
Google также усилила точность работы с пятипалыми кистями. В демонстрациях роботы запечатывают пакет, завязывают мусорный мешок и выкручивают лампочку — то есть делают вещи, на которых чаще всего ломаются разговоры о «почти человеческой ловкости». Для робототехники это хороший маркер прогресса: именно мелкая моторика обычно отделяет эффектное демо от задачи, которую можно повторять десятки раз без сюрпризов.
Архитектура, обучение и безопасность
По информации WIRED, Gemini Robotics 2 — не одна универсальная модель, а связка нескольких компонентов. Vision-language model отвечает за понимание сцены и общение с человеком, а две vision-language-action модели управляют движением всего тела и действиями рук. Подход не выглядит романтично, зато выглядит инженерно: в робототехнике модульность обычно полезнее обещаний «одной модели на все».
Google отдельно оговаривает и ограничения. Роботов обучали на смеси телеуправления человеком, видео-примеров и симуляций, то есть речь пока не идет о машине, которая умеет почти все без подготовки. Иначе говоря, это не домашний универсал из научной фантастики, а система, которую доводят под конкретные сценарии. Для бизнеса это даже хорошая новость: на практике быстрее взлетают не «роботы на все случаи жизни», а решения для повторяемых операций в предсказуемой среде.
Вместе с основной моделью Google обновила Gemini Robotics ER 2. Эта версия лучше разбирает окружение, дольше удерживает контекст задачи, понимает начало и конец процесса и может координировать работу нескольких роботов. Еще один важный слой — безопасность. По словам главы робототехники Google DeepMind Каролины Парады, «вопрос безопасности становится еще острее», когда роботов помещают во все более разнообразные ситуации. Для этого компания добавила многоуровневые ограничения, улучшила обнаружение человека рядом с машиной и представила бенчмарк ASIMOV-Agentic для проверки опасных или неопределенных команд.
Почему это важно для рынка
Для русскоязычной ИТ-аудитории вывод довольно приземленный. Ценность в робототехнике смещается от самого «железа» к данным, симуляции, качеству обучения и системам безопасности. Это значит, что спрос будет расти не только на специалистов по ML и компьютерному зрению, но и на команды, которые умеют строить инструменты тестирования, программные прослойки для роботов и инфраструктуру оценки надежности. Для стартапов и интеграторов сигнал тоже понятный: ближайший рынок — не универсальные гуманоиды «вместо человека вообще», а узкие сценарии, где можно посчитать экономику ошибки и повторяемость результата.
Следующий рубеж теперь простой и неприятный: показать, что такие системы работают не один раз в подготовленной сцене, а стабильно в реальной эксплуатации. Первоисточники: , , .