Стартап General Intuition привлек $320 млн при оценке $2,3 млрд и делает ставку на то, что физический ИИ скоро пройдет тот же путь, что и большие языковые модели. Идея простая, но дерзкая: вместо того чтобы годами собирать дорогие данные с реальных роботов, можно обучать базовые модели на миллионах часов из видеоигр, а потом доводить их до нужного поведения буквально на считаных минутах данных из физического мира.
Об этом сообщает TechCrunch со ссылкой на главу компании Пима де Витте и инвестора Винода Хослу. Генеральная ставка General Intuition в том, что отрасль робототехники слишком долго жила в режиме «каждому роботу по собственной модели», а теперь подходит к этапу, когда рынок начнет переходить к foundation-моделям для движения, взаимодействия с объектами и ориентации в пространстве. Если тезис сработает, физический ИИ может стать для робототехники тем, чем GPT-3 и последующие модели стали для обработки текста: не очередной узкой системой, а общей базой, поверх которой строят прикладные продукты.
В центре истории не сам робот и не очередной эффектный ролик с офисной демонстрацией. В центре — обучающие данные. General Intuition говорит, что построила собственную базовую модель, обучив ее на миллионах часов игровых данных, включая информацию о том, какие кнопки на контроллере нажимал человек и в какой момент. По версии компании, именно такая связка «картинка плюс действие» помогает машине выстраивать человеческую интуицию о пространстве и времени. Не просто распознавать сцену, а понимать, какое действие за каким обычно следует, как объект ведет себя при контакте и что делать дальше, если среда меняется.
Это важный сдвиг в логике обучения. До сих пор значительная часть робототехнических команд собирала огромные наборы данных под конкретный корпус, сенсорный стек, помещение и задачу. Отсюда типичная боль отрасли: модель неплохо работает в одном сценарии, но рассыпается при смене комнаты, камеры, освещения или механики. Де Витте формулирует свою ставку жестко: сама по себе способность модели к обобщению и есть продукт. По его словам, именно базовый уровень рассуждения о пространстве и времени в будущем может сделать избыточным сбор сотен тысяч или даже миллионов часов реальных данных для каждого нового робота.
Почему рынок вообще готов слушать такую историю
Параллель с языковыми моделями здесь не случайна. До бума foundation-моделей компании действительно часто строили специализированные NLP-системы под отдельные задачи и обучали их с нуля на дорогих, узких датасетах. Потом пришел рынок общих моделей: сначала берешь большую базу, затем дообучаешь, адаптируешь промптами или добавляешь доменные данные. Для бизнеса это резко снижает порог входа. Не нужно каждый раз поднимать с нуля весь стек исследований. В робототехнике такой переход пока не оформился окончательно, но инвесторы уже готовы финансировать именно эту гипотезу.
В случае General Intuition деньги говорят сами за себя. Раунд на $320 млн при оценке $2,3 млрд — это не формат «посмотрим, что получится в лаборатории», а ставка на инфраструктурного игрока следующего цикла. Причем сам стартап не обещает выпускать собственных роботов на массовый рынок. Его цель куда ближе к модели поставщика платформы: стать базовой моделью для физического ИИ, на которой другие компании будут строить роботов, автономные системы и, возможно, решения смежного класса. Де Витте формулирует это максимально прикладно: компания не собирается делать свою беспилотную автокомпанию, она хочет в десять раз упростить жизнь следующему игроку, который захочет ее построить.
Самый яркий технический аргумент General Intuition пока выглядит как демонстрация трансфера между мирами. По данным TechCrunch, текущая модель компании умеет не только играть в видеоигру часами, но и управлять четвероногим роботом после дообучения всего на восьми минутах реальных робототехнических данных. Отдельно де Витте отмечает, что для запуска использовалась только фронтальная камера, без других сенсоров, а робот работал в офисе, где в сцене появлялись динамические объекты и проходили люди. В компании признают, что такой zero-shot-результат сам по себе стал для них большим сюрпризом.
Здесь, конечно, есть место здоровому скепсису. Робототехника слишком часто продавала публике обещания раньше, чем инженерная реальность успевала догнать презентацию. Один удачный перенос навыка из игрового мира в офис — еще не доказательство, что модель стабильно поедет по складам, фабрикам и дворам с непредсказуемой физикой. Но это уже и не пустая метафора про «ChatGPT-момент». У стартапа есть четкий тезис, капитал под этот тезис и демонстрация, которая хотя бы показывает направление: возможно, дефицит в робототехнике действительно не только в железе, но и в правильном типе предварительного обучения.
Что это значит для разработчиков и бизнеса
Для русскоязычной IT-аудитории в этой истории важнее не конкретный стартап, а меняющаяся экономика разработки. Если подход General Intuition или похожих команд подтвердится, главным узким местом в робототехнике станет не сбор колоссальных объемов реальных логов, а доступ к сильной базовой модели и качественному пайплайну адаптации. Для разработчиков это означает смещение компетенций: меньше ручного конструирования каждой поведенческой модели с нуля, больше работы с дообучением, симуляцией, переносом политики из виртуальной среды в реальную и проверкой устойчивости на краевых кейсах. Для продактов и фаундеров это тоже хорошая новость: порог создания прикладного робототехнического продукта теоретически может снизиться так же, как он снизился у текстовых AI-сервисов после появления мощных общих моделей.
Есть и второй слой. Если индустрия действительно перейдет к foundation-моделям для физического ИИ, добавленная стоимость начнет перетекать вверх по стеку. Часть компаний будет выигрывать за счет базовых моделей и данных, часть — за счет интеграции в конкретные вертикали: логистика, производство, инспекция, сервисные роботы, автономные системы. Тогда вопрос «кто собрал больше всего данных именно на этой машине» перестанет быть главным. Важнее станет, кто умеет быстрее и безопаснее приспосабливать универсальную модель к рабочему сценарию с учетом ограничений железа, цены ошибки и нормативных требований.
Для рынка это неудобный, но полезный вопрос: действительно ли роботам нужны годы дорогой натурной разметки, или часть отрасли просто привыкла решать проблему самым очевидным и самым затратным способом. Если General Intuition права, то следующий большой спор в AI пойдет уже не вокруг текста и картинок, а вокруг того, можно ли научить машину понимать физический мир через симуляцию и игровые действия так же хорошо, чтобы реальный робот потом учился не месяцами, а минутами. Подробности исходной публикации и прямые цитаты CEO можно посмотреть в .