Утечка данных Carhartt затронула 12 933 413 аккаунтов, хотя группировка ShinyHunters в середине августа утверждала, что масштаб почти вдвое больше. Для ИБ-команд, разработчиков и тех, кто отвечает за коммуникацию после инцидента, это хороший холодный душ: цифры из постов вымогателей нельзя нести в заголовки без проверки, даже если они выглядят убедительно и подкреплены «50 ГБ слитых данных».
Именно так историю и разобрал Трой Хант, создатель Have I Been Pwned, о чём сообщает The Register. После публикации дампа 13 августа он прогнал массив через собственный экстрактор email-адресов и получил почти 25 миллионов адресов. На бумаге выглядело громко: крупный ритейлер одежды, десятки миллионов записей, очередной шумный кейс вокруг ShinyHunters. Но дальнейшая проверка показала, что внутри набора было много синтетического мусора, который заметно раздул итоговую цифру и сделал утечку «толще», чем она была на самом деле.
Ключевую роль сыграл OpenClaw, инструмент для анализа содержимого утечек, плюс обычная ручная проверка без магии и культа вокруг ИИ. Для ритейлера вроде Carhartt подозрительно выглядели миллионы адресов в доменах .edu и .org, а также шаблонные записи с реалистичными именами и явно случайными доменными хвостами. Хант привёл примеры адресов, которые выглядят правдоподобно только на расстоянии: имя и фамилия как у живого человека, а домен собран словно генератором случайных символов. По данным анализа, это очень похоже на примесь синтетических данных из набора TPC-DS, который часто используют для тестов и моделирования нагрузок. Иначе говоря, в слитый архив кто-то подмешал правдоподобный, но фальшивый цифровой шум.
Дальше началась работа, которую злоумышленники обычно не любят, потому что она убивает красивые headline numbers. Анализ показал аномалии по географии и демографии: среди «клиентов» оказалось непропорционально много записей из стран, которые сложно назвать ключевыми рынками Carhartt, включая Бенин и Черногорию. Более того, в какой-то момент система увидела больше пользователей из Черногории, чем из США, где и базируется компания. Отдельный красный флаг — заметная доля клиентов с датами рождения из начала XX века. Для бренда, который давно живёт не только в рабочей одежде, но и в модной городской культуре, это выглядит как очень странная выборка. После отсечения явно поддельных записей оценка объёма реальных данных упала с 24,8 миллиона до 13,6 миллиона человек.
На этом чистка не закончилась. Хант отдельно убирал дубликаты адресов Microsoft 365, записи, помеченные к деактивации, и другие сомнительные элементы, одновременно продолжая анализ через OpenClaw. Финальная цифра — 12 933 413 аккаунтов — и попала в базу Have I Been Pwned. Ещё один неприятный, но важный штрих: 83% этих записей, по оценке сервиса, уже фигурировали в более ранних утечках. Для пользователя это не делает инцидент безобидным, потому что в массиве есть имена, email-адреса, телефоны и физические адреса. Но для специалистов это меняет оценку ущерба: речь идёт не о полностью «свежем» массиве на 25 миллионов человек, а о частично переиспользованной и дополненной сборке, где злоумышленники явно пытались поднять цену истории.
В этом кейсе особенно показательно поведение самой Carhartt. По информации The Register, компания не ответила на запрос о комментарии по выводам Ханта и вообще публично не комментировала инцидент. С точки зрения кризисных коммуникаций это плохая стратегия: вакуум моментально заполняют вымогатели, реселлеры данных, телеграм-каналы и SEO-охотники за чужими страхами. Если бренд молчит, отрасль начинает ориентироваться на цифры атакующей стороны, а затем тратит время на обратную распаковку реальности. Для российских компаний здесь урок вполне прикладной: если произошла утечка данных Carhartt-масштаба или хотя бы её подозрение, лучше быстро зафиксировать подтверждённые факты и диапазон неопределённости, чем дать преступникам написать первый черновик пресс-релиза за вас.
Для ИБ-рынка эта история важна ещё и как методический кейс. Во-первых, объём слитого архива и число строк внутри него давно перестали быть надёжной метрикой ущерба. Дамп можно раздуть синтетикой, дубликатами, тестовыми данными и техническим мусором. Во-вторых, ИИ здесь полезен не как оракул, а как ускоритель рутины: он помогает находить аномалии по доменам, регионам, шаблонам полей и распределению дат, но окончательное качество разбора по-прежнему зависит от человека, который понимает контекст бизнеса. В-третьих, сервисы вроде Have I Been Pwned становятся не просто «поиском по утечкам», а инфраструктурой верификации, где headline claims сталкиваются с нормальной аналитикой. Это, пожалуй, и есть главный вывод для техдиров, продактов и фаундеров: рынок будет всё чаще видеть не просто публикации о взломе, а соревнование между скоростью паники и скоростью проверки.
История с Carhartt оставляет неприятный, но полезный вопрос: сколько ещё громких «утечек на десятки миллионов пользователей» на самом деле являются смесью реальных записей, старых сливов и аккуратно подмешанной синтетики. Чем чаще вымогатели торгуют не только данными, но и масштабом в заголовке, тем ценнее становятся независимая верификация, прозрачная методика подсчёта и способность компаний говорить фактами раньше, чем рынок успеет поверить в чужую математику.