AI И НЕЙРОСЕТИ

Google DeepMind представила Gemini Robotics 2 для роботов-гуманоидов

Три модели, контекст до 128 тыс. токенов и 92% успеха в одном тесте: Google DeepMind обновила Gemini Robotics 2 для гуманоидных роботов.

✍️ Редакция iTech News | 31.07.2026 | ⏱ 4 мин | Источник: Habr / Новости
🧬

Google DeepMind представила Gemini Robotics 2 — новое поколение моделей для роботов, где один контур отвечает за движение, второй за понимание среды и планирование, а третий может работать прямо на устройстве. Для русскоязычной IT-аудитории это важный сдвиг: гонка ИИ уходит из чатов и генераторов кода в физический мир, где ошибка измеряется уже не странным ответом, а падением, промахом мимо полки или сорванной операцией.

Релиз показывает и другое: крупные ИИ-команды теперь соревнуются не только в качестве текста и скорости вывода. Следующий фронт — модели, которые должны видеть сцену, понимать команду и безопасно выполнять действие на реальном железе.

Три модели в одном стеке

В линейку вошли три модели с разными ролями. Gemini Robotics 2 — это основная vision-language-action модель, которая переводит изображение и текстовую инструкцию в моторные команды. Gemini Robotics ER 2 отвечает за пространственное понимание, разбор длинных задач на шаги и координацию действий. Gemini Robotics On-Device 2 рассчитана на локальный запуск на самом роботе без постоянной зависимости от облака.

Это уже не история про «модель, которая распознает предметы на камере». Google собирает полноценный стек для физического ИИ: от понимания сцены и голосовой команды до движения корпуса, кистей и захватов.

Gemini Robotics 2 управляет телом целиком

Главное изменение в базовой модели — переход к управлению гуманоидом «от ступней до кончиков пальцев». Если прошлые версии в основном работали с верхней частью корпуса, то теперь модель умеет координировать ходьбу, приседания, наклоны и манипуляции руками в одной задаче. На практике это значит, что робот может не просто дотянуться до предмета со стола, а пройти к нему, поднять, изменить позу и положить в нужное место.

Официальная демонстрация с Apollo 2 от Apptronik выглядит именно так: робот по команде кладет лейку в зеленый контейнер на нижней полке. Важен не сам бытовой сценарий, а связка действий внутри него: навигация, захват, перенос, контроль равновесия и точное размещение объекта без жестко прошитого сценария на каждый шаг.

Но Google не делает вид, что проблема уже решена. В компании прямо признают: скорости движения роботам пока не хватает. Это, пожалуй, самая полезная часть релиза. Для склада, производства или сервиса мало уметь аккуратно взять предмет в демо-ролике — нужно делать это стабильно и без пауз, из-за которых человек успеет выполнить задачу сам.

Мелкая моторика стала лучше, но до человеческой еще далеко

Вторая заметная часть релиза — работа с кистями. Gemini Robotics 2 поддерживает пятипалую руку SharpaWave с 22 степенями свободы и обычные параллельные захваты. На таких конфигурациях робот умеет завязывать пакет, закрывать пакет с замком и работать с лампочкой.

Цифры здесь важнее рекламных роликов. Во внутренних тестах робот выкручивал лампочку в 92% попыток, но вкручивал только в 36%. Завязывание пакета дало 44%, закрытие пакета с замком — 40%. Вывод простой: грубая манипуляция и захват заметно подтянулись, а вот точные обратные движения с контролем усилия по-прежнему остаются узким местом.

Gemini Robotics ER 2 следит за ходом задачи

Gemini Robotics ER 2 Google называет «высокоуровневым мозгом» робота. Модель построена на базе Gemini 3.5 Flash, принимает текст, изображения, видео и аудио, а контекстное окно достигает 128 тыс. токенов. Главное здесь не красивая цифра, а то, что модель умеет работать с непрерывным видеопотоком и отслеживать прогресс задачи в реальном времени.

Именно это отличает ER 2 от более ранних подходов, где робот часто принимал решение по одному кадру или короткой сцене. Теперь система может понять, когда задача началась, на каком этапе она находится и в какой момент действие действительно завершено. По данным Google, точность определения ключевого момента в видео достигает 91,3%, а классификация прогресса по этапам — 57,4%.

Есть и еще один практический апгрейд: ER 2 умеет координировать несколько роботов. В демонстрации гуманоид Apollo 2 и двухрукий робот Franka Duo работают вместе и делят задачу между собой. Для бизнеса это уже намек не на одного «умного гуманоида», а на будущую оркестрацию всего роботизированного парка как отдельного программного слоя.

Доступ и значение для рынка

Gemini Robotics ER 2 уже доступна разработчикам через Gemini API и Google AI Studio, а также в формате private preview в Gemini Enterprise Agent Platform. Базовая Gemini Robotics 2 и Gemini Robotics On-Device 2 пока отдают только партнерам раннего доступа. Логика прозрачная: модель, которая планирует шаги, проще выпускать наружу, чем контур, который напрямую управляет телом робота в физическом мире.

Для рынка в России и СНГ это сигнал не про то, что гуманоиды завтра выйдут на каждый склад. Сигнал в другом: крупные игроки уже строят стандартный ИИ-стек для робототехники, как раньше строили стек для мобильных приложений и облаков. Для интеграторов, промышленных команд и разработчиков автономных систем это означает рост спроса на локальное управление, безопасность, симуляцию, данные с роботов и программную оркестрацию парка машин.

Следующий вопрос теперь не в том, может ли робот красиво отработать одно демо, а в том, сколько разных сценариев он выполнит подряд без ручной донастройки под каждую новую полку, коробку и лампочку.

Оригиналы: Google DeepMind, Google Blog.

Поделиться: Telegram X LinkedIn