Британские власти собираются использовать оценку возраста по лицу для проверки просителей убежища, хотя внутренние тесты показали ошибки, которые в буквальном смысле могут отправить подростка во взрослый изолятор. Если для онлайн-сервисов возрастной сканер пока выглядит как еще один раздражающий экран перед входом, то на границе цена промаха уже не про UX, а про базовые права человека.
О планах МВД Великобритании и результатах закрытых тестов сообщает Ars Technica со ссылкой на расследование WIRED и Lighthouse Reports. По данным утекшего отчета Home Office, ведомство проверяло семь алгоритмов facial age estimation на массиве более чем из 2,5 млн изображений и выбрало «лучший» вариант. Даже он, однако, дал серьезные перекосы: система заметно хуже оценивала возраст выходцев из Африки к югу от Сахары, а для женщин из этой группы средняя ошибка составила 4,6 года. В практическом переводе это означает, что девочку 13,5 лет алгоритм может записать в 18-летние взрослые.
Контекст здесь особенно неприятный. На британской границе возраст просителя убежища часто приходится определять без документов: многие приезжают после тяжелого маршрута через Ла-Манш, и у части людей бумаг просто нет. Если человека младше 18 лет ошибочно признают взрослым, он теряет часть правовых гарантий и может оказаться в учреждениях только для взрослых. С 2010 года, по официальной статистике, взрослыми признавали около 40% тех, кто проходил возрастную проверку. Теперь к визуальной оценке сотрудников и интервью хотят добавить ИИ, который, судя по собственным тестам государства, регулярно промахивается именно там, где ошибка наиболее токсична.
Формально Лондон пытается подать это как вспомогательный инструмент. Представитель Home Office заявил, что у ведомства есть «строгие процедуры» проверки возраста, а распознавание лиц должно модернизировать процесс и не заменит человеческое решение. В спорных случаях, по его словам, человека будут считать ребенком до дополнительной проверки. Но за этой аккуратной формулировкой виден старый бюрократический фокус: сначала назвать систему «дополнительной», а потом встроить ее в процедуру так, что без цифровой подсказки сотрудник уже не рискнет принимать решение. Особенно если сверху требуют «быстрее» и «жестче пресекать ложные заявления».
Проблема не только в математике модели, но и в реальных условиях съемки. Внутренний отчет Home Office прямо говорит, что значительная часть тестов опиралась на качественные фото людей с подтвержденным возрастом. На практике же изображения, сделанные в момент первого контакта на границе, часто были заметно хуже. Авторы документа отдельно отмечали, что такие снимки «обычно хуже» последующих фото тех же людей, и по этим данным даже не удалось уверенно отделить влияние плохого качества изображения от влияния физического состояния мигрантов после тяжелой дороги. Для инженеров это довольно понятный сюжет: модель показывала условно приемлемый результат на чистом датасете, а потом вышла в поле, где свет, стресс, усталость и неидеальная камера быстро превращают красивую метрику в юридическую рулетку.
Скепсис к этой технологии звучал и внутри экспертного контура. Тим Коул, почетный профессор медицинской статистики из Института здоровья детей при University College London и бывший участник научного комитета, консультировавшего власти по методам оценки возраста, говорил, что комитет хотел указать на слабые места facial age estimation, но такой возможности ему не дали, а затем сам комитет распустили. Его формулировка была жестче дипломатии чиновников: такие сканы лица он назвал чудовищно неточными. Home Office объяснило роспуск тем, что для новой работы требовались «другие области экспертизы». В переводе с ведомственного языка на обычный это часто означает: неудобные вопросы начали мешать дорожной карте внедрения.
Для IT-рынка здесь важен не только гуманитарный, но и вполне прикладной вывод. Оценка возраста по лицу уже давно расползается из лабораторий в массовые сценарии: от порносайтов и соцсетей до магазинов и баров. Регуляторы требуют проверять возраст, компании ищут способ делать это быстро и без лишней трения, а вендоры продают идею «достаточно точной» биометрии. Но как только технология выходит из онлайн-ворот в офлайн-процессы с высокими ставками, привычная продуктовая логика ломается. Недостаточно сказать, что средняя ошибка составляет около 2,5 года в лаборатории. Нужно отвечать на гораздо менее удобные вопросы: на каких группах модель ошибается чаще, что происходит при плохом освещении, кто оспаривает решение, где хранится изображение, кто несет ответственность за ложный положительный результат и как это все переживает аудит.
Для разработчиков и продуктовых команд эта история тоже довольно прямолинейна. Если система влияет на статус человека, доступ к услуге, условия содержания или правовую защиту, модель нельзя оправдать фразой «это всего лишь один из сигналов». В реальных процессах такой сигнал быстро становится якорем для оператора, а затем и формальным основанием для решения. Поэтому разговор про fairness, quality drift и dataset bias тут не академический. Это вопрос архитектуры ответственности. Когда в пайплайн попадает биометрия уязвимых групп, ошибка модели перестает быть статистикой и становится инцидентом с именем, возрастом и очень конкретными последствиями.
Именно поэтому британский кейс выглядит не как локальная странность, а как черновик для будущих споров по всему рынку цифровой идентификации. Если государство готово внедрять оценку возраста по лицу, заранее зная о перекосах по полу, происхождению и качеству снимков, бизнесу и регуляторам в других странах придется ответить на неприятный вопрос: где проходит граница между «допустимой погрешностью» и автоматизацией системной несправедливости.