AI И НЕЙРОСЕТИ

Google DeepMind показала Gemini Robotics 2 для гуманоидов

30 июля 2026 года Google представила Gemini Robotics 2 — ИИ-платформу для управления роботами с «полным контролем тела».

✍️ Редакция iTech News | 31.07.2026 | ⏱ 3 мин | Источник: Engadget
🔬

Google DeepMind показала Gemini Robotics 2 — новую версию своей платформы для роботов, которая управляет уже не только руками, но и всем телом гуманоидной машины. Для рынка это важный сдвиг: отрасль снова пытается доказать, что «физический ИИ» умеет не только красиво выглядеть в роликах, но и выполнять связные действия в реальной среде.

В новой демонстрации гуманоидный робот ходит, приседает, тянется к предметам, берет лейку, снимает вещи с полки, завязывает мусорный пакет и выкручивает лампочку. Ключевая мысль здесь не в самой подборке трюков, а в том, что Google пытается собрать единый стек управления движением, восприятием сцены и выполнением задачи.

Что изменилось в Gemini Robotics 2

Главное отличие от предыдущей версии в том, что Gemini Robotics 2 отвечает за движения «от ног до пальцев». Если ранняя модель в основном работала с верхней частью тела, то теперь система координирует ходьбу, наклоны, вытягивание корпуса и точные манипуляции кистями. По данным The Verge, это позволяет роботу не просто дотянуться до объекта, а подойти к нему, занять нужную позу и аккуратно выполнить действие.

Google также усилила точность работы с пятипалыми кистями. В демонстрациях роботы запечатывают пакет, завязывают мусорный мешок и выкручивают лампочку — то есть делают вещи, на которых чаще всего ломаются разговоры о «почти человеческой ловкости». Для робототехники это хороший маркер прогресса: именно мелкая моторика обычно отделяет эффектное демо от задачи, которую можно повторять десятки раз без сюрпризов.

Архитектура, обучение и безопасность

По информации WIRED, Gemini Robotics 2 — не одна универсальная модель, а связка нескольких компонентов. Vision-language model отвечает за понимание сцены и общение с человеком, а две vision-language-action модели управляют движением всего тела и действиями рук. Подход не выглядит романтично, зато выглядит инженерно: в робототехнике модульность обычно полезнее обещаний «одной модели на все».

Google отдельно оговаривает и ограничения. Роботов обучали на смеси телеуправления человеком, видео-примеров и симуляций, то есть речь пока не идет о машине, которая умеет почти все без подготовки. Иначе говоря, это не домашний универсал из научной фантастики, а система, которую доводят под конкретные сценарии. Для бизнеса это даже хорошая новость: на практике быстрее взлетают не «роботы на все случаи жизни», а решения для повторяемых операций в предсказуемой среде.

Вместе с основной моделью Google обновила Gemini Robotics ER 2. Эта версия лучше разбирает окружение, дольше удерживает контекст задачи, понимает начало и конец процесса и может координировать работу нескольких роботов. Еще один важный слой — безопасность. По словам главы робототехники Google DeepMind Каролины Парады, «вопрос безопасности становится еще острее», когда роботов помещают во все более разнообразные ситуации. Для этого компания добавила многоуровневые ограничения, улучшила обнаружение человека рядом с машиной и представила бенчмарк ASIMOV-Agentic для проверки опасных или неопределенных команд.

Почему это важно для рынка

Для русскоязычной ИТ-аудитории вывод довольно приземленный. Ценность в робототехнике смещается от самого «железа» к данным, симуляции, качеству обучения и системам безопасности. Это значит, что спрос будет расти не только на специалистов по ML и компьютерному зрению, но и на команды, которые умеют строить инструменты тестирования, программные прослойки для роботов и инфраструктуру оценки надежности. Для стартапов и интеграторов сигнал тоже понятный: ближайший рынок — не универсальные гуманоиды «вместо человека вообще», а узкие сценарии, где можно посчитать экономику ошибки и повторяемость результата.

Следующий рубеж теперь простой и неприятный: показать, что такие системы работают не один раз в подготовленной сцене, а стабильно в реальной эксплуатации. Первоисточники: Google DeepMind, The Verge, WIRED.

Поделиться: Telegram X LinkedIn