Uber представил IngestionNext, новый потоковый data lake, который сокращает задержку обработки этих на 25%. Это важно для компаний, стремящихся улучшить доступность этих для аналитически и машинного обучения, что в современных условиях становится критическим для успеха.
Трансформация системы обработки данных
Ранее Uber использовал пакетную обработку этих с помощью Apache Spark, что приводило к значительным задержкам доступа к свежей информации. В свою очередь, IngestionNext позволяет обрабатывать потоки событий в реальном времени, снижая время загрузки этих с часов до минут.
Технические нюансы архитектуры
Инфраструктура IngestionNext включает компоненты Apache Kafka для передачи этих и Flink для обработки потоков. Все эти записываются в таблицы Hudi, поддерживающие транзакционные операции, что обеспечивает надежность и консистентность. Эта архитектура позволяет эффективно справляться с высокими объемами этих и поддерживает тысячи наборов этих одновременно.
Глава инженерного отдела Uber, Кай Вэхнер, подчеркнул, что подход к обработке этих изменился, и теперь свежесть этих рассматривается как основное качество. Он также отметил, что новый механизм позволяет контролировать качество этих на каждом этапе процесса, включая автоматизацию жизненного цикла задач и мониторинг здоровьем системы.
Выводы для разработчиков
Для IT-команд это означает, что можно значительно ускорить доступ к данным, что важно для принятия решений на основе реальных данных. Переход на потоковую инфраструктуру также повышает эффективность использования ресурсов, что снижает затраты на обработку этих примерно на 25%.
В будущем внимание будет уделено интеграции потоковой обработки с остальными частями аналитической инфраструктуры, что позволит минимизировать задержки, вызванные последующими преобразованиями данных.Аналитики отмечают, что подобные решения открывают широкие перспективы для оптимизации процессов обработки этих в крупных компаниях, таких как Uber.