Генеративный ИИ снова показал, что хуже всего у него не с креативом, а с границами. Один сюжет касается дипфейк-порно, где жертвами оказываются не только люди, чьи лица подставляют в ролики, но и те, чьи тела ИИ использует как сырье. Второй — про утечки данных ИИ: чатботы уже выдают реальные телефонные номера, и это быстро превращает абстрактный разговор о рисках в очень конкретные звонки на личный мобильный.
Об этом пишет MIT Technology Review, собрав в одном выпуске две истории о том, как генеративные модели вторгаются в частную жизнь с неожиданной стороны. В первом случае речь идет о сексуализированных дипфейках и правах создателей adult-контента на собственное изображение и работу. Во втором — о том, что большие языковые модели, похоже, умеют доставать персональные данные из обучающих массивов заметно лучше, чем хотелось бы их жертвам.
Самый жесткий эпизод в материале про дипфейки начинается не с вирусного скандала, а с вполне бытовой проверки. Женщина по имени Дженнифер, получив исследовательскую работу в 2023 году, прогнала новый профессиональный портрет через систему распознавания лиц. Она хотела понять, всплывут ли старые порновидео с ее участием, снятые больше десяти лет назад. Видео действительно нашлись, но вместе с ними обнаружился ролик, которого она раньше не видела: ее тело осталось прежним, а лицо в кадре уже принадлежало другому человеку. Обычно обсуждение дипфейк-порно крутится вокруг тех, чьи лица без согласия встраивают в откровенный контент. Но этот случай подсвечивает вторую группу пострадавших, о которой говорят заметно реже: людей, чьи тела становятся базой для синтетического контента без разрешения, оплаты и даже уведомления.
Для adult-индустрии это не теоретическая угроза, а прямой удар по правам и доходам. По данным из материала, создатели такого контента считают, что ИИ-системы обучаются на их работах, клонируют их внешность и генерируют новые эротические материалы, на которые они не давали согласия. Проблема тут не только в репутации и не только в этике. Если модель может пересобрать образ человека из старых роликов и штамповать новый контент, традиционные механизмы владения изображением, лицензирования и монетизации начинают разваливаться. Для разработчиков и платформ это неприятный, но полезный урок: когда продукт строится на масштабном сборе данных, вопрос «можно ли технически» очень быстро превращается в вопрос «кто вообще владеет цифровым телом».
Вторая история выглядит менее шокирующей только до первого незнакомого звонка. MIT Technology Review приводит несколько случаев, когда чатбот Gemini выдавал реальные телефонные номера людей. Один разработчик начал получать сообщения в WhatsApp от незнакомцев, которые просили помощи после того, как Gemini показал его номер. Университетский исследователь смог с помощью чатбота получить личный мобильный номер коллеги. Еще один пользователь Reddit рассказал, что Gemini фактически направил на его телефон поток людей, ищущих юристов. С технической точки зрения картина довольно прозаичная: эксперты связывают такие утечки с тем, что в обучающих данных моделей уже содержится персонально идентифицируемая информация. Но генеративный интерфейс меняет масштаб проблемы. Раньше такие данные могли лежать где-то в полуоткрытых документах, старых визитках, индексах и кэшах. Теперь чатбот собирает их в удобный ответ и выдает по естественному запросу.
Именно поэтому утечки данных ИИ выглядят для рынка опаснее, чем классические ошибки поиска. Поисковик хотя бы показывает, откуда информация взялась, а пользователь сам проходит путь до результата. Чатбот, наоборот, убирает трение и создает иллюзию достоверности: если номер появился в связном ответе модели, многие воспринимают его как проверенный факт. При этом у пострадавших, как следует из публикации, почти нет удобного способа остановить распространение таких данных. Даже если исходные следы можно удалить из одного источника, нет гарантии, что информация уже не попала в обучающие выборки, промежуточные базы или производные сервисы. Для компаний это плохая новость не только в плоскости комплаенса. Любой продуктовый сценарий, где модель отвечает на запросы о людях, клиентах, сотрудниках или партнерах, автоматически становится зоной риска для privacy, abuse и юридических претензий.
Для русскоязычной IT-аудитории здесь сразу несколько практических выводов. Разработчикам систем на базе LLM придется жестче фильтровать персональные данные на входе и не рассчитывать, что проблема решится одной строчкой в policy. Продактам придется думать не только о полезности ответа, но и о классе вреда: если модель ошибочно выдала номер телефона или связала человека с откровенным контентом, ущерб наступает мгновенно и без всякой «виральности». HR и корпоративным ИБ-командам стоит учитывать, что публичные профили сотрудников, старые резюме, презентации, контакты на сайтах конференций и служебные страницы теперь могут быть не просто найдены, а переупакованы в ответы ИИ. А стартапам, которые строят поиск по людям, помощников для sales или инструменты генерации изображений, пора закладывать в продукт не декоративную модерацию, а полноценные механизмы жалоб, удаления, аудита и ограничений на чувствительные запросы.
Главный вопрос уже не в том, могут ли модели галлюцинировать. Куда важнее, что они все лучше извлекают реальные следы из цифрового мусора и превращают их в готовый к употреблению результат. Если рынок не научится ограничивать такие сценарии на уровне данных, интерфейсов и ответственности, утечки данных ИИ станут не редким багом, а базовой функцией новой инфраструктуры поиска и генерации.