РАЗРАБОТКА

«Яндекс» открыл YTsaurus Flow для потоковой обработки данных

«Яндекс» открыл исходный код YTsaurus Flow — инструмента для обработки событий без потерь и дублей в потоках данных.

✍️ Редакция iTech News | 07.10.2026 | ⏱ 3 мин | Источник: vc.ru
💻

«Яндекс» выложил в открытый доступ YTsaurus Flow — компонент для непрерывной обработки больших потоков данных. Система рассчитана на высокую нагрузку и должна гарантировать, что каждое событие будет обработано ровно один раз: без потерь и повторного учёта. Для команд, которые строят аналитику, антифрод или рекомендации на событиях в реальном времени, YTsaurus Flow даёт ещё один открытый вариант вместо сборки подобного контура из набора разрозненных инструментов.

Технология опубликована под лицензией Apache 2.0 и работает внутри открытой платформы YTsaurus для хранения и обработки данных, сообщает vc.ru. В самом «Яндексе» решение уже используют несколько сервисов: «Маркет» применяет его для более оперативного сбора статистики, антифрод — для поиска подозрительных действий, рекламные продукты — для подбора релевантных предложений.

Потоковая обработка нужна там, где данные теряют ценность быстрее, чем заканчивается ночная выгрузка. Клики, просмотры, лайки, заказы и другие события поступают постоянно. Если складывать их в хранилище и запускать обработку пакетами, между действием пользователя и реакцией системы могут пройти часы. Для отчётности такая задержка часто приемлема. Для блокировки мошеннической операции, актуальной рекомендации или оперативного обновления витрины — уже нет.

YTsaurus Flow обрабатывает события по мере появления. В описании «Яндекса» среди сценариев названы подготовка данных для обучения ML-моделей, обновление информации в сайтах и приложениях, а также подсчёт просмотров, кликов и заказов. Это знакомый для индустрии набор задач, но сложность здесь не в самом чтении очереди событий. Нужно переживать сбои, не терять сообщения, не учитывать одно и то же действие дважды и при этом не превращать инфраструктуру в бесконечный конвейер ручных исключений.

Именно гарантия обработки «ровно один раз» выглядит главным техническим обещанием релиза. В реальных потоках дубликаты возникают по вполне прозаическим причинам: повторная доставка сообщения после сетевого сбоя, перезапуск воркера, задержка подтверждения обработки. В аналитике это даёт лишние просмотры и заказы, в антифроде — риск неверного решения, в рекомендательных системах — искажённые сигналы о поведении пользователей. Полностью исключить такие ситуации на уровне прикладного кода можно, но цена обычно выражается в усложнении схем, дедупликации и длинных списках оговорок в документации.

Открытие Flow продолжает линию YTsaurus. В марте 2023 года «Яндекс» опубликовал исходный код самой платформы, которой пользуются большинство сервисов компании. Новый компонент расширяет этот стек в сторону потоковых сценариев: не только хранить и обрабатывать накопленные массивы данных, но и реагировать на изменения без ожидания очередного пакетного расчёта. Для компаний, уже знакомых с YTsaurus, это может снизить число интеграционных швов между хранилищем, расчётами и онлайн-обработкой.

Для российских разработчиков релиз интересен не только кодом, но и происхождением технологии. Это не лабораторный проект, придуманный для презентации, а инструмент, который «Яндекс» описывает через применение в собственных нагруженных продуктах. Впрочем, открытая лицензия сама по себе не отменяет инженерной работы: командам придётся оценить требования к инфраструктуре, эксплуатационные практики и то, насколько Flow вписывается в уже существующие очереди, хранилища и ML-пайплайны. Зато исходный код позволяет проверять эти ответы до закупки лицензий и долгих переговоров с вендором.

Рынок обработки данных постепенно уходит от вопроса «нужен ли стриминг» к более неприятному вопросу «можно ли ему доверять в продакшене». Появление YTsaurus Flow добавляет в российский open-source-ландшафт инструмент для команд, которым важны низкая задержка и корректный учёт событий одновременно. Главная проверка для проекта теперь будет не в заявленных сценариях, а в том, появятся ли вокруг него независимые внедрения, документация и практики эксплуатации за пределами экосистемы «Яндекса».

Поделиться: Telegram X LinkedIn