Palo Alto Networks представила платформу Cortex XCOR: компания заявляет, что её ИИ-агенты способны расследовать инциденты в среднем менее чем за три минуты. Для команд, уставших от ночных поисков нужного дашборда, ИИ-наблюдаемость Cortex XCOR обещает не просто заметить сбой, а найти вероятную первопричину и предложить действия. Но инженеров система пока всё равно вызывает: автопилот включили, пилота из кабины не убрали.
Как сообщает The New Stack, XCOR разработала команда Chronosphere, вошедшая в Palo Alto Networks после приобретения компании в январе. Платформа должна заменить привычную цепочку из алерта, ручного сбора метрик, логов и трассировок на набор специализированных агентов. После срабатывания оповещения агент получает контекст, разбирает возможные причины и формирует рекомендации по снижению ущерба.
Ключевой элемент продукта — XCOR Operator, разговорный интерфейс для операций. Пользователь формулирует намерение, а за ним работают профильные агенты: один разбирает сам инцидент, другие помогают с настройкой алертов, дашбордов или объёмом телеметрии. Это важная разница с чат-ботом поверх поиска: Palo Alto Networks пытается передать модели доступ к операционному контексту и последовательности действий, а не только к документации.
Компания приводит две метрики, которые стоит читать именно как показатели производителя, а не как независимый бенчмарк. В сложных production-средах агент, по её данным, успешно определял первопричину в 75% случаев; ещё в 19% расследований анализ оказался полезен команде. Для сравнения Palo Alto Networks оценивает ручной старт расследования — поиск релевантной информации, первичного контекста и дежурного инженера — примерно в 20 минут. Даже если реальная экономия окажется скромнее, разница между несколькими минутами и двадцатью для инцидента в проде вполне материальна.
При этом XCOR не начинает с права самостоятельно менять инфраструктуру. По умолчанию продукт работает по модели human in the loop: инженер получает пейдж, заходит в систему и проверяет результат. В Palo Alto Networks объясняют это прагматично: за время входа дежурного в консоль расследование уже должно завершиться. Затем, по мере доверия к выводам агентов, руководитель сможет расширять их разрешения — вплоть до автоматизированного устранения типовых проблем.
Это компромисс, который выглядит здоровее привычных обещаний «полной автономности». Корректно связать высокий latency с неудачным деплоем проще, чем разрешить модели откатывать релиз, менять сетевую политику или масштабировать дорогой кластер в незнакомом контексте. Ошибка в рекомендации неприятна; ошибка в действии с избыточными правами способна превратить локальную аварию в отчёт для руководства. Поэтому ценность ИИ-наблюдаемости Cortex XCOR на первом этапе — в сокращении диагностики, а не в отмене дежурств.
Для работы агентам нужен полный контекст. Его в XCOR Fabric собирают из графа знаний об инфраструктуре, приложениях и бизнес-логике, истории прошлых расследований, runbook’ов, документации и операционных файлов. Туда же попадают данные о действиях опытных инженеров: какие запросы они запускают и какими дашбордами пользуются. Идея понятна: если контекст разрознен между несколькими системами, модель будет лишь уверенно суммировать неполную картину.
Palo Alto Networks также строит вокруг XCOR полнофункциональную наблюдаемость. Ранее компания объявила о намерении приобрести Embrace, поставщика Real User Monitoring, и планирует объединить фронтенд-данные XCOR RUM, синтетический мониторинг XCOR Synthetics, бэкенд и инфраструктурную телеметрию. Такой стек важен для расследований, где жалоба пользователя начинается в браузере, а настоящая причина лежит в API, базе данных или облачной сети.
Для российских команд здесь нет магической кнопки, зато есть полезный ориентир: ИИ в наблюдаемости становится отдельным слоем принятия решений, а не очередным виджетом в Grafana. Однако результат будет зависеть не от качества диалога с Operator, а от чистоты телеметрии, актуальности runbook’ов и аккуратно выданных прав. Главный вопрос для рынка — кто быстрее докажет, что агент может не только красиво объяснить уже известную аварию, но и надёжно работать в хаосе незнакомого production. Детали запуска и заявленные метрики доступны в материале .