Google начала тестировать новый сценарий проверки на бота: теперь капча Google в ряде случаев просит открыть доступ к камере и показать рукой указанный жест. Для пользователей это выглядит как мелкая деталь интерфейса, но для разработчиков и продуктовых команд сигнал вполне крупный: классическая капча Google с картинками и текстовыми задачками уже не кажется достаточно надёжной в эпоху генеративного ИИ и автоматизации.
О тесте, как пишет vc.ru, стало известно из материалов Google и пересказов профильных изданий. Суть механики простая: система просит пользователя снять короткое видео с рукой во время выполнения одного или нескольких действий. Дальше алгоритм не хранит сам ролик как медиафайл, а извлекает из него данные о ключевых точках кисти. Речь идёт о 21 суставе руки и их координатах. В компании отдельно подчёркивают, что видео и изображения не сохраняются, с личностью пользователя не связываются, звук не записывается, а после завершения проверки ролики автоматически удаляются.
Если смотреть на это не как на очередную экзотику от Big Tech, а как на инженерное решение, логика у Google вполне читаемая. Обычная капча много лет держалась на задачах, где человеку было проще, чем машине: распознать искажённый текст, выбрать светофоры, автобусы или пешеходные переходы на картинках. Но этот разрыв быстро сокращается. Модели компьютерного зрения и мультимодальные системы заметно прибавили в распознавании изображений, а сервисы для обхода защит давно превратились в отдельный рынок. На этом фоне жест рукой под камерой выглядит не прихотью, а попыткой сместить проверку в сторону живого, непрерывного действия, которое сложнее подделать шаблонным скриптом.
Здесь важен и сам формат сигнала. Текстовая капча проверяет, способен ли пользователь прочитать набор символов. Задача с картинками проверяет, может ли он распознать объекты на статичном изображении. Новый подход оценивает уже не просто результат, а процесс: движение руки, положение пальцев, траекторию, последовательность кадров. Для антибот-систем это более богатый набор данных. Даже если пользователь делает самый простой жест, на стороне сервиса появляется динамический паттерн, который труднее эмулировать, чем один клик по нужной картинке. И это, похоже, главное, ради чего Google вообще идёт на такой спорный с точки зрения UX шаг.
Спорный он по нескольким причинам. Первая очевидна: доступ к камере остаётся одной из самых чувствительных точек в любом цифровом продукте. Какой бы аккуратной ни была формулировка про удаление данных, часть пользователей всё равно увидит в этом лишний риск и лишний повод закрыть вкладку. Вторая проблема касается среды использования. Не у всех камера под рукой, не у всех нормальный свет, не у всех есть желание делать жесты перед ноутбуком ради входа на сайт или подтверждения действия. Третья проблема связана с доступностью. Google утверждает, что для пользователей, которые не могут выполнить жест рукой, сохраняется обычная капча. Это важная оговорка, потому что без альтернативы такая система быстро превратилась бы из защиты в барьер.
Для бизнеса и продуктовых команд из этого вытекает неприятный, но полезный вывод: борьба с ботами всё чаще упирается в обмен между безопасностью, конверсией и приватностью. Чем сильнее защита, тем выше шанс потерять часть нормальных пользователей на входе. Чем мягче проверка, тем легче её автоматизировать. Новый формат от Google показывает, что крупные платформы готовы повышать цену прохождения антибот-барьера, даже если это ухудшает привычный путь пользователя. Особенно это актуально для сервисов, где бот-активность бьёт по деньгам напрямую: массовые регистрации, парсинг, накрутка, выкуп дефицитных товаров, спам, мошеннические обращения в поддержку.
Для разработчиков здесь тоже есть практический слой. Если такие проверки выйдут из статуса теста в более широкое применение, придётся думать не только о встраивании очередного SDK или виджета, но и о продуктовой коммуникации. Пользователю нужно быстро и человеческим языком объяснить, зачем сайт просит камеру, что именно анализируется, хранится ли видео и какая есть альтернатива. Иначе даже технически аккуратное решение будет выглядеть как сомнительная просьба в духе “докажите, что вы человек, подняв руку”. На десктопе и мобильных устройствах такой сценарий ещё и по-разному ощущается: там, где для смартфона камера давно часть базового взаимодействия, на ноутбуке это может казаться лишним вторжением.
Есть и более широкий контекст. Последние годы интернет постепенно уходит от модели, где “человечность” пользователя подтверждается парой кликов, к модели, где система собирает больше поведенческих сигналов. Движение курсора, скорость ввода, история взаимодействия, аппаратные признаки устройства, репутация IP, а теперь ещё и видеожесты. На словах это делается ради защиты от злоупотреблений. На практике граница между антифродом, удобством и наблюдением становится всё менее уютной. Поэтому обещание Google не сохранять ролики и не связывать их с личностью здесь не просто формальность, а ключевой элемент доверия к самой идее.
Пока это тест, а не новый обязательный стандарт для всего интернета. Но сам вектор уже виден: если нейросети и боты научились проходить привычные визуальные проверки, платформы будут искать признаки живого человека в движении, контексте и поведении. Вопрос теперь не в том, исчезнет ли старая капча, а в том, сколько ещё действий придётся сделать реальному пользователю, чтобы доказать машине, что он всё-таки не машина.