Библиотека Hardwood, созданная для работы с Apache Parquet в окружениях Java виртуальной машины (JVM), демонстрирует впечатляющую скорость обработки — до 16,5 млн строк в секунду. Это важное обновление устраняет проблемы традиционных реализаций Parquet, такие как высокий уровень зависимостей и ограниченная производительность при однопоточной обработке.
Что изменилось
Hardwood была запущена в начале 2026 года и недавно достигла версии 1.0. Она предлагает улучшенную обработку Parquet с использованием мультипоточности, вовлекая все доступные ядра процессора. Это существенно снижает задержки, свойственные последовательной обработке. В библиотеке предусмотрена отсутствие обязательных зависимостей, что минимизирует риски атак на цепочку поставок и конфликты классов.
Технические возможности
Hardwood использует многоуровневую архитектуру для адаптации к различным потребностям в обработке данных. Она эффективнее использует ресурсы ввода-вывода и процессора на хост-машине благодаря поддержке многопоточной обработки. Тесты на плоских наборах данных с 8 виртуальными процессорами показали производительность в 16,5 млн строк в секунду.
Кроме того, библиотека поддерживает различные алгоритмы сжатия, такие как LZ4 и GZip, что позволяет подключать их по мере необходимости. Реализована оптимизированная оценка предикатов, что улучшает фильтрацию данных и снижает ошибки предсказания веток при обработке.