Expedia представила Service Telemetry Analyzer (STAR) — инновационную платформу, использующую ИИ для ускорения расследования инцидентов в производственной среде. Система анализирует данные об операциях и помогает инженерам быстро идентифицировать причины ухудшения работы сервисов. Это важный шаг для повышения оперативности реагирования на проблемы.
Что такое STAR
STAR объединяет метрики работы сервисов с большими языковыми моделями через заранее определенные диагностические процессы. Это позволяет сократить время выявления источников проблем и ускоряет восстановление. Основная цель проекта — уменьшить время до осознания проблемы (TTK) и время до восстановления (TTR).
Платформа реализована в виде приложения FastAPI и интегрируется с Datadog для получения метрик сервисов. Она использует планирование запросов для выполнения нескольких специализированных анализов перед формированием окончательной диагностики.
Как работает STAR
STAR анализирует такие метрики, как пропускная способность запросов, задержки, частота ошибок по HTTP, gRPC и GraphQL, использование процессора и памяти, а также события перезапуска контейнеров. Это позволяет создать единый обзор по всем сервисам, независимо от языков программирования и фреймворков.
Инженеры проверяют результаты анализа перед применением рекомендаций, что делает STAR вспомогательным инструментом, а не автономной системой. Платформа уже использовалась для расследований инцидентов, постинцидентного анализа и диагностики памяти JVM.
Значение для разработчиков
Для российских разработчиков внедрение аналогичных систем может существенно повысить эффективность команд при работе с инцидентами. Автоматизация диагностики и анализа метрик позволяет сократить время на выявление неисправностей примерно на 30-40%, что критически важно в условиях высокой нагрузки на сервисы.
На горизонте — расширение возможностей STAR. Expedia планирует интеграцию информации о зависимостях сервисов и создание более сложных интерфейсов взаимодействия, что сделает платформу еще более мощной. Таким образом, STAR может сыграть важную роль в дальнейшей эволюции процессов диагностики инцидентов.