AI И НЕЙРОСЕТИ

Google переделывает курсор: ИИ научили понимать «это» и «то»

Google спустя более 50 лет после появления курсора показала AI-указатель с Gemini, который понимает «это» и «то» прямо на экране.

✍️ Редакция iTech News | 14.05.2026 | ⏱ 4 мин | 👁 3 | Источник: The Register
Google переделывает курсор: ИИ научили понимать «это» и «то»

Google DeepMind взялась за вещь, которую индустрия почти не трогала больше полувека: обычный указатель мыши. Новый умный курсор, представленный 13 мая 2026 года, должен понимать, на что смотрит пользователь, что именно он имеет в виду словами вроде «это» и «то», и выполнять команды без прыжков в отдельное окно чат-бота. Для русскоязычной IT-аудитории это не очередной красивый демо-ролик про ИИ, а намек на то, как могут измениться интерфейсы рабочих инструментов, браузеров и ноутбуков уже в ближайших релизах.

О проекте, как пишет The Register, Google DeepMind рассказала как о первой крупной попытке переосмыслить курсор более чем за 50 лет. Над системой работали исследователи Адриен Баранес и Роб Марчант. Они связали модель Gemini с экспериментальным контекстно-зависимым указателем: система анализирует место клика, объект под курсором и вероятное намерение пользователя. По сути, курсор превращают из безмолвной стрелки в точку входа для AI-взаимодействия. Не «открой чат, вставь скриншот, объясни проблему», а «наведи и скажи».

Техническая идея выглядит довольно приземленно, и именно поэтому может сработать. Указатель работает в связке с микрофоном: пользователь показывает на элемент интерфейса и произносит короткую команду. В демонстрации Google человек наводит курсор на краба и говорит что-то вроде «перемести это сюда», после чего система правильно понимает, какой объект нужно взять и куда его перенести. Для пользователя это почти жестовая речь, только поверх экрана. Для модели же это объединение визуального контекста, позиции курсора и голосовой инструкции в одну команду.

Google объясняет разработку довольно понятной болью: почти все AI-помощники пока живут в отдельной вкладке, боковой панели или чате. Из-за этого пользователь постоянно таскает данные в ИИ вручную: копирует фрагмент текста, перетаскивает картинку, пишет длинный промпт о том, что вообще происходит на экране. Новый умный курсор должен убрать этот лишний слой. Среди принципов, которые описала DeepMind, есть работа «без разрыва потока» между приложениями, снижение зависимости от длинных промптов за счет визуального контекста и превращение пикселей в распознаваемые сущности, с которыми можно что-то сделать. Из примеров: навести на PDF и попросить краткое содержание, указать на таблицу и получить график, превратить фото рукописной заметки в интерактивный список задач или распознать ресторан на стоп-кадре видео и сразу получить переход к бронированию.

На более широком уровне это продолжение большого тренда: ИИ пытаются вытащить из режима «отдельный собеседник» и встроить прямо в рабочую поверхность. За последний год крупные платформы наперебой прикручивали генеративные модели к браузерам, офисным пакетам, поиску и мобильным оболочкам. Но в большинстве случаев пользователь все равно должен явно вызвать ассистента, открыть панель и сформулировать запрос текстом. Google предлагает другой сценарий: интерфейс сам становится промптом. Это важный сдвиг для продуктовых команд и разработчиков интерфейсов. Если модель понимает не только текст, но и экранный контекст, меняется сама логика UX: меньше меню, меньше вспомогательных окон, меньше действий ради действия.

Есть и вполне прикладной вывод для бизнеса. Если такая схема приживется, компании начнут ждать от корпоративного софта не просто «кнопку с ИИ», а нативную работу с экранным контекстом. Для SaaS-продуктов это означает новый уровень требований к структуре интерфейса, доступности элементов, разметке объектов и API действий, которые ассистент сможет вызывать. Для браузеров и десктопных платформ ставка еще выше: тот, кто контролирует указатель, микрофон, страницу и модель, получает очень удобную точку входа в пользовательский сценарий. Неудивительно, что Google уже говорит об интеграции технологии в продукты. По данным компании, функция Magic Pointer скоро появится на будущей ноутбучной платформе Googlebook, а пользователи Gemini в Chrome смогут указывать на конкретные части веб-страницы и задавать вопросы без длинного текстового описания.

При этом у идеи есть и неудобные вопросы, которые разработчикам и ИТ-руководителям лучше задавать сразу, а не после релиза. Чем шире доступ модели к экрану и голосу пользователя, тем выше требования к приватности, разрешениям и прозрачности обработки данных. Если AI-указатель неверно определит объект или намерение, цена ошибки может быть выше, чем у чат-ответа: одно дело получить неточный совет, другое — случайно передвинуть, отредактировать или отправить не тот объект. Кроме того, интерфейсы на реальных корпоративных системах куда грязнее демонстрационных сцен с крабом: перегруженные CRM, старые веб-формы, нестандартные внутренние приложения и куча элементов, которые человек понимает по привычке, а модель — далеко не всегда.

Но сама постановка вопроса у Google любопытная. Компании уже мало просто встроить модель в строку ввода или боковой чат. Следующая конкуренция, похоже, пойдет за базовые элементы интерфейса, которые десятилетиями считались завершенными: курсор, вкладка, поле ввода, файловый менеджер, контекстное меню. Если умный курсор действительно окажется удобнее правого клика и длинных промптов, он станет не декоративной AI-функцией, а новой нормой для десктопной работы. Проверить первоисточник и детали анонса можно в материале The Register.

Поделиться: Telegram X LinkedIn