Цены на электричество за прошлый год выросли на 6,9%, а дата-центры, по оценке Goldman Sachs, дадут 40% прироста спроса на электроэнергию до конца десятилетия. На этом фоне энергоэффективность ИИ внезапно упирается не только в новые GPU, охлаждение и стройки подстанций, но и в более скучную вещь: способ обработки данных.
Как пишет The New Stack, один из самых быстрых и относительно дешёвых способов сократить энергопотребление ИИ-нагрузок — перевести больше пайплайнов с пакетной обработки на потоковую. Логика проста: batch-задачи создают резкие пики нагрузки, под которые инфраструктуру приходится держать «с запасом». В результате серверы и сопутствующие ресурсы заметную часть времени простаивают, но всё равно потребляют энергию. Streaming, напротив, размазывает вычисления по времени и делает профиль нагрузки более ровным. Для компаний это не абстрактная архитектурная красота, а вполне прикладной разговор о CAPEX, OPEX и о том, сколько киловатт съедает инфраструктура между реальными задачами.
Автор материала Уоррен Велла формулирует проблему жёстко: у batch-модели наследие эпохи мейнфреймов, когда данные накапливали, складывали в хранилище и прогоняли по расписанию крупными пачками. Для многих аналитических сценариев такой подход жив до сих пор, но в мире ИИ он начинает работать против бизнеса. Когда пакетный джоб стартует, резко подскакивают CPU- и memory-нагрузка, сильнее включаются системы охлаждения, а энергосистема получает короткий, но тяжёлый удар. Потом всё успокаивается — до следующего цикла. С инженерной точки зрения это похоже на постоянные разгоны «в пол» вместо ровного крейсерского режима. Чем больше у компании AI-сервисов, тем дороже обходится такая рваная схема.
На этом фоне потоковая обработка выглядит не как модный архитектурный выбор, а как попытка убрать чистые потери. The New Stack в качестве примеров технологий называет Apache Kafka и Apache Flink, которые давно используются в отраслях с требованием к данным в реальном времени — от финансов до телекома и ритейла. Их плюс в данном контексте не только в низкой задержке. Когда данные обрабатываются непрерывно, по мере поступления, инфраструктуру не нужно проектировать под худший возможный всплеск. Пиковая потребность в вычислениях снижается, резерв простаивающих мощностей сокращается, а масштабирование можно точнее привязывать к фактическому throughput. Для темы энергоэффективность ИИ это важный сдвиг: меньше лишних серверов в ожидании нагрузки, меньше бесполезно сожжённой энергии.
Есть и следующий слой экономии, уже не такой очевидный снаружи. В потоковой архитектуре данные можно чистить, дедуплицировать и нормализовать ещё «на лету», до попадания в хранилища и downstream-системы. Это значит, что в data warehouse уходит меньше мусора и дублей, а запросы к нему становятся легче. The New Stack отдельно упоминает снижение объёма дискового ввода-вывода — а это одна из энергоёмких операций в обработке данных. Плюс event-driven-подход помогает развязать системы: отдельные компоненты могут обрабатывать свои события независимо, не провоцируя каскадные вычислительные цепочки в жёстко сцепленных пайплайнах. Для продуктовых команд и платформенных инженеров вывод неприятно простой: если AI-стек тормозит или дорожает, виноваты могут быть не модели и не ускорители, а старая логика движения данных.
Отдельно интересно, что автор не предлагает переписывать всё сразу. В качестве первого кандидата на миграцию он называет препроцессинг для AI-нагрузок: фильтрацию, агрегацию и нормализацию данных до того, как они попадут в модель. Это позволяет подавать на вход не сырые логи и широкие таблицы, а уже отобранные и более компактные данные. Практический эффект понятен любому, кто платил за inference или за обучение: ниже нагрузка на память, CPU и GPU, меньше бессмысленной обработки, стабильнее производительность. Для агентных и near-real-time сценариев у streaming есть ещё один бонус: модели и агенты получают более свежий контекст. Периодическое обновление статических датасетов в таких системах быстро превращается в бутылочное горлышко, и тогда бизнес начинает оплачивать не только вычисления, но и архитектурную инерцию.
В этой истории важен и управленческий смысл. Железо улучшается, hyperscaler-провайдеры заключают долгосрочные энергоконтракты, операторы сетей в ряде регионов уже говорят о проблемах с мощностью, но ждать нового поколения дата-центров могут не все. А вот поменять слой обработки данных можно заметно быстрее, потому что речь идёт прежде всего о программной архитектуре. Это не отменяет вложений и не превращает streaming в серебряную пулю: не каждая задача должна работать в real time, а миграция старых пайплайнов сама по себе сложна. Но если компании всерьёз интересна энергоэффективность ИИ, вопрос уже звучит не как «какие GPU покупать дальше», а как «зачем мы вообще продолжаем кормить ИИ пакетными всплесками там, где можно работать ровнее и дешевле». И это, похоже, тот случай, когда разговор о sustainability наконец совпал с разговором о нормальной инженерной экономике.