Итальянский регулятор по защите данных GPDP оштрафовал IQVIA на €7 млн за обработку медицинской информации, которая могла поставить под угрозу приватность примерно миллиона пациентов. В центре решения — анонимизация медицинских данных, оказавшаяся скорее псевдонимизацией: вместо имён компания использовала уникальные коды, но набор сопутствующих сведений позволял выделять и потенциально повторно идентифицировать людей.
Расследование началось в апреле 2025 года, а решение регулятор принял в сентябре 2026-го, сообщает BleepingComputer. Итальянскому подразделению IQVIA предписали за 120 дней привести процессы в соответствие с требованиями GDPR. Для компаний, работающих с аналитикой, ML и отраслевыми датасетами, это ещё одно напоминание: замена ФИО на идентификатор сама по себе не превращает запись в анонимную.
По данным GPDP, база формировалась на основе информации от 800 врачей общей практики. В ней были записи приблизительно о миллионе пациентов: год рождения, пол, диагнозы и симптомы, назначения, исследования, вакцинации, а также данные о местоположении. Каждый пациент был связан с постоянным кодом. Такая связка позволяла наблюдать за одним и тем же человеком во времени, а детальность медицинского профиля и географический контекст делали повторную идентификацию реалистичной при использовании разумно доступных средств.
Регулятор отдельно указал, что у IQVIA не было надлежащего правового основания для части обработки и что пациентов не информировали о ней должным образом. Ещё одна претензия касается сроков хранения: ведомство обнаружило записи, датированные 2001 годом, при этом компания, по его оценке, не установила либо не соблюдала понятные правила удаления данных. В небольшой, но особенно чувствительной части массива — у 3 300 пациентов — присутствовали имена, налоговые идентификаторы, адреса и контактные данные.
Почему код пациента не равен анонимности
Псевдонимизация снижает риск: прямой идентификатор заменяется кодом, а ключ соответствия хранится отдельно или ограничивается в доступе. Но сам по себе постоянный код сохраняет возможность связать события одной персоны. Если рядом лежат редкое сочетание диагноза, возраста, назначения и района проживания, данные могут стать узнаваемыми даже без таблицы с именами. Именно поэтому анонимизация медицинских данных оценивается не по отсутствию одного поля «ФИО», а по всей модели угроз и по возможности сопоставления с внешними источниками.
Для разработчиков это означает, что проверка выгрузки на прямые идентификаторы — только первый слой контроля. Нужно отдельно анализировать квазиидентификаторы: возраст или дату рождения, почтовый индекс и геоданные, редкие диагнозы, временные ряды, комбинации признаков. Важен и контекст использования. Датасет, безопасный для ограниченной внутренней команды, может стать рискованным после передачи партнёру, объединения с CRM или загрузки в сторонний аналитический контур. Особенно неприятный сценарий — когда старые данные постепенно обогащаются новыми полями и меняют профиль риска без нового privacy review.
IQVIA — крупная международная компания в сфере медицинской аналитики, технологий и клинических исследований. На своём сайте она заявляет о работе более чем в 100 странах, 68 петабайтах данных и 1,2 млрд пациентских записей. В комментарии изданию компания заявила, что сотрудничает с итальянским ведомством, считает защиту данных приоритетом, применяет псевдонимизацию и шифрование и оставляет за собой право обжаловать решение. IQVIA также подчеркнула, что спорный набор не использовался в её услугах клинических исследований и не относился к клиническим испытаниям, проводимым для спонсоров.
Что стоит проверить бизнесу
Решение GPDP полезно читать как чек-лист для владельцев медицинских платформ, страховых сервисов и команд data science. Требуются не только технические меры, но и дисциплина жизненного цикла данных: зафиксированная цель обработки, понятное правовое основание, прозрачное информирование субъектов, сроки хранения и доказуемое удаление. При подготовке обучающих выборок и витрин стоит документировать риск деанонимизации, ограничивать гранулярность полей, проверять устойчивость к связыванию записей и разделять доступ к исходникам, ключам и итоговым наборам. Шифрование защищает данные в канале и хранилище, но не исправляет избыточный состав уже выданной выборки.
Штраф в €7 млн не выглядит максимальной санкцией, которую теоретически допускает GDPR, но его смысл шире суммы. Регуляторы всё чаще смотрят на фактическую обратимость обезличивания и на то, как долго организация хранит чувствительные сведения. Компании, которые строят продукты на больших массивах здоровья, должны быть готовы доказывать не лозунг «данные обезличены», а конкретно: от каких атак защищён набор, кто может его связать с внешними данными и когда записи исчезнут из системы. В эпоху всё более точной аналитики именно этот разрыв между «без имени» и «невозможно узнать человека» становится самым дорогим.