АНАЛИТИКА

ВШЭ улучшила прогноз рождаемости с помощью поисковых запросов

Ошибка прогноза рождаемости в России снизилась с 4,62% до 3,2%, если добавить в модель поисковые запросы о беременности и родах.

✍️ Редакция iTech News | 01.07.2026 | ⏱ 5 мин | Источник: CNews
📐

Экономисты НИУ ВШЭ показали, что прогноз рождаемости в России можно заметно улучшить, если добавить в модель поисковые запросы о беременности и родах. В их тестах средняя ошибка на горизонте одного года снизилась с 4,62% до 3,2% — для задач планирования это уже не академическая мелочь, а вполне прикладная разница для регионов, инфраструктуры и сервисов, которые живут по числам, а не по ощущениям.

Исследование выполнили сотрудники факультета экономических наук НИУ ВШЭ Лилия Родионова и Елена Копнова вместе с аспирантами Никитой Родионовым и Светланой Камелендиновой, сообщает CNews. Результаты опубликованы в журнале Populations and Economics. Авторы взяли ежемесячные данные Росстата о числе родившихся в России за 2011–2024 годы и сопоставили их с динамикой запросов Google Trends по темам, связанным с планированием беременности, ее течением, подготовкой к родам и универсальными формулировками.

Технически работа интересна не только демографам. Исследователи собрали корпус из 56 слов и с помощью методов машинного обучения разделили его на четыре смысловых блока. Затем эти блоки использовали как дополнительные предикторы в модели SARIMA. Базовая версия, опирающаяся только на временные ряды рождений, на горизонте в год давала среднюю ошибку 4,62%. В абсолютном выражении это около 4,6 тыс. на 100 тыс. рождений. После добавления поисковых данных ошибка сократилась до 3,2%. Для новостной заметки цифра выглядит сухо, но для реального планирования это означает более точную оценку нагрузки на детсады, школы, медицину и будущий рынок труда.

Самым полезным оказался блок запросов, связанный с подготовкой к родам. Логика здесь довольно земная: запросы вроде «роддом» или «сумка в роддом» чаще ищут не на этапе абстрактных размышлений о семье, а когда беременность уже подтверждена и до родов остается относительно немного времени. По словам Лилии Родионовой, именно поэтому такие запросы оказались особенно сильным сигналом для краткосрочного прогноза. Если перевести это с языка академических публикаций на язык продуктовой аналитики, получается простая вещь: цифровой след пользователя иногда говорит о ближайшем событии точнее, чем инерционная статистика.

Еще один важный момент — лаги, то есть временной сдвиг между появлением интереса в поиске и фактическим числом рождений. Авторы отдельно учитывали этот фактор и получили более сильный эффект. По их оценке, блок «планирование беременности» отражается в модели через 7,4 месяца, а блок «подготовка к родам» — через шесть месяцев. Это похоже на нормальную поведенческую последовательность: сначала люди читают про зачатие и беременность, позже — про дыхание при родах, роддом и список вещей в сумку. Для аналитиков здесь нет магии, но есть полезный урок: сырые пользовательские сигналы без учета контекста и времени часто недооценивают, а именно правильная работа с лагами превращает интересный шум в рабочий индикатор.

На длинной дистанции результаты тоже оказались сильными. При горизонте прогноза в два года лучшая модель снизила ошибку до 2,7%, а при прогнозе на три года — до 2,6%. Причем на больших сроках лучше себя показала конфигурация, где используются все блоки запросов и временные интервалы, а не отдельные тематические кластеры. Это уже важный сигнал для всех, кто работает с социальными данными: комбинированные модели, которые тянут в себя поведенческие и официальные статистические ряды, дают более устойчивый результат, чем ставка на один «самый сильный» показатель. Проще говоря, один запрос может хорошо предсказывать ближайшие месяцы, но на длинном отрезке выигрывает система, которая видит весь путь пользователя.

Контекст у этой истории шире, чем демография. Бизнес и государство уже давно пытаются строить прогнозы не только на традиционной отчетности, но и на данных, которые возникают в повседневном цифровом поведении: поиске, геоданных, транзакциях, активности в приложениях. В ритейле и финтехе это привычная практика, а вот в демографических расчетах такие подходы все еще выглядят относительно свежо для массового обсуждения. Поэтому работа ВШЭ интересна тем, что показывает вполне понятный сценарий переноса инструментов из коммерческой аналитики в социальную сферу. Не потому, что алгоритм «знает будущее», а потому, что люди оставляют достаточно сигналов о своих ближайших действиях сильно раньше, чем это попадет в официальные сводки.

Для российской ИТ-аудитории здесь несколько прикладных выводов. Разработчикам и дата-командам работа напоминает, что value часто лежит не в экзотических архитектурах, а в правильном подборе признаков и аккуратной работе со временем. Продактам и руководителям — что альтернативные данные могут улучшать прогноз даже в консервативных предметных областях, где годами полагались только на государственную статистику. Для HR, edtech и городских сервисов это тоже не абстракция: более точный прогноз рождаемости означает более осмысленное планирование кадров, образовательной нагрузки и региональных инвестиций. Наконец, для стартапов в аналитике и GovTech это хороший пример того, что спрос на модели, умеющие соединять открытые цифровые следы с отраслевой статистикой, в России вряд ли станет меньше.

Авторы отдельно подчеркивают, что модель тестировалась на данных до декабря 2024 года, то есть захватила и пандемию COVID-19, и период геополитической нестабильности. Это важная оговорка: если модель не разваливается на кризисных отрезках, к ней уже можно относиться как к инструменту, а не как к красивому графику для конференции. Но дальше начинается более интересный вопрос. Если поисковые данные улучшают прогноз рождаемости, то какие еще социальные процессы можно предсказывать по повседневным цифровым привычкам граждан, и где проходит граница между полезной аналитикой и переоценкой сигнала только потому, что его удобно считать.

Поделиться: Telegram X LinkedIn