Футболка с правильно подобранным принтом может заметно ухудшить работу камер, которые ищут человека в кадре: в исследовании 2019 года такая атака показала 57% успеха в физическом мире против детектора YOLOv2. Для русскоязычной IT-аудитории здесь важен не модный аксессуар, а более неприятный вывод: алгоритмы слежки можно ломать не только эксплойтами и датасетами, но и обычной одеждой.
Как пишет Dark Reading, речь идет о графических футболках с так называемыми adversarial-паттернами, которые путают нейросети в камерах наблюдения. Но тут есть важная оговорка, без которой новость легко превратить в миф про «невидимость для распознавания лиц». В cited research атакуется прежде всего не биометрическая идентификация человека по лицу, а более ранний слой пайплайна: person detection, то есть сам факт обнаружения человека в кадре. Если модель не увидела человека, до распознавания лица дело может вообще не дойти. Для инженеров это куда интереснее громкого заголовка: ломается не финальный модуль, а фундаментальная стадия компьютерного зрения.
Базовый артефакт здесь не новый: на arXiv еще 18 октября 2019 года появился препринт Adversarial T-shirt! Evading Person Detectors in A Physical World авторов Kaidi Xu, Gaoyuan Zhang, Sijia Liu, Quanfu Fan, Mengshu Sun, Hongge Chen, Pin-Yu Chen, Yanzhi Wang и Xue Lin; последняя доступная ревизия датирована 6 июля 2020 года. Авторы описали носимую физическую атаку на системы детекции людей и заявили, что их футболка стала первым примером adversarial-объекта, где учитывается деформация ткани при движении человека. Это ключевой момент: остановить классификатор на картинке проще, чем обмануть модель на видео, где одежда мнется, растягивается и меняет форму буквально в каждом кадре. Поэтому проект интересен не как «антикамера для параноиков», а как практический тест на устойчивость реальных CV-моделей к физическим атакам.
По цифрам работа выглядит не как лабораторный курьез. В аннотации авторы пишут, что их метод дал 74% успешных атак в цифровой среде и 57% в физическом мире против YOLOv2. Для сравнения, более ранний физический подход против детектора людей, если перенести его патч с жесткого носителя на футболку, показывал лишь 18% успеха. Разница объяснима: бумажный или картонный патч ведет себя в кадре предсказуемо, а ткань нет. Команда специально моделировала деформацию одежды с помощью thin plate spline и строила преобразования, которые имитируют складки и изменения формы при движении. Иначе говоря, паттерн проектировали не для идеального скриншота, а для кривой, мнущейся и постоянно меняющейся поверхности. В статье также говорится об ensemble-атаке сразу на YOLOv2 и Faster R-CNN, то есть о попытке пройти не через один конкретный стек, а через несколько популярных архитектур детекции.
У темы есть и понятный исторический контекст. Adversarial ML давно вышел из академического режима «посмотрите, кота приняли за тостер». Раньше исследователи показывали очки, которые сбивают face recognition, наклейки и патчи для дорожных знаков, а также атаки на объектные детекторы через жесткие носители. Но почти все эти сценарии плохо переносились на реальный городской поток, где камера видит человека под углом, на разной дистанции, с шумом, пересветом и окклюзиями. Именно поэтому история с футболкой выглядит важнее мемного эффекта. Она показывает, что алгоритмы слежки уязвимы не только в чистой цифровой постановке, но и на уровне обычной физики мира, где помехой становится не специально взломанный сенсор, а ткань с нужным рисунком.
Для бизнеса и разработчиков отсюда следует сразу несколько неприятных, но полезных выводов. Первый: нельзя считать, что наличие детектора человека само по себе делает систему наблюдения надежной. Если входной этап можно сбить носимым паттерном, дальше рушится вся логика: трекинг, идентификация, подсчет людей, алерты по периметру. Второй: тестирование CV-систем на accuracy в датасете уже давно недостаточно. Нужны adversarial-сценарии, физические red-team-проверки, оценка устойчивости к деформациям, временная согласованность между кадрами и желательно комбинация нескольких модальностей. Третий: для заказчиков систем видеонаблюдения это не повод выкидывать камеры, а повод перестать верить в магию коробочных моделей. Если продукт обещает «умное наблюдение», разумно спрашивать не только precision и recall, но и то, как он ведет себя против физических атак, нестандартной одежды и попыток целенаправленно запутать модель.
Есть и более широкий эффект для отрасли. Чем больше камер завязано на нейросетевую автоматизацию, тем быстрее adversarial-атаки переходят из академической экзотики в прикладную безопасность. Вопрос уже не в том, можно ли напечатать странный принт на футболке, а в том, готовы ли поставщики CV-систем признавать, что их модели живут в среде активного противодействия. Для ИБ-команд это почти классическая гонка «щит против меча», только вместо пакетов и бинарников в ход идут текстуры, складки ткани и уличная оптика. Источник с исходным инфоповодом можно посмотреть здесь: .