У команд, которые выводят AI-сервисы в прод, быстро появляется новый счет: нужно отдельно отслеживать как минимум четыре класса сигналов — расход токенов, задержки, ошибки и качество ответа. Телеметрия ИИ-агентов из nice-to-have превращается в инструмент финансового контроля: без нее невозможно понять, почему агент вдруг стал дорогим, медленным или просто бесполезным.
Об этом пишет The New Stack: по мере перехода компаний от пилотов к автономным агентам в production инфраструктурная проблема смещается с моделей на наблюдаемость. Обычный стек мониторинга плохо объясняет, что именно сделал агент, сколько это стоило и был ли результат вообще оправдан. Для русскоязычных команд это знакомый сюжет: сначала все обсуждают выбор модели, потом приходит счет за inference, а сразу за ним — счет за данные, логи, трассировки и хранение всего этого счастья.
Логика здесь неприятно простая. Классическая observability и без того дорогая дисциплина, особенно в крупных распределенных системах. The New Stack напоминает, что крупные заказчики могут тратить на observability десятки миллионов долларов в год. AI-нагрузки не снижают эту планку, а поднимают ее. Поверх обычных метрик инфраструктуры добавляются токеновая экономика, очереди и загрузка GPU, поведение моделей, многошаговые пайплайны с retrieval и tool calling, а также высокая кардинальность данных. В результате каждая попытка “посмотреть побольше, вдруг пригодится” начинает стоить вполне осязаемых денег.
Главная проблема в том, что агентные системы создают телеметрию другого типа. Если для веб-сервиса еще можно спорить, насколько подробно собирать трейсы, то для AI-агента команде важно видеть не только факт запроса, но и ход выполнения: какие инструменты вызывались, сколько контекста было протащено через цепочку, где выросла задержка, на каком шаге появилась ошибка, почему ответ получился слабым, хотя инфраструктура формально была здорова. И вот здесь обычная схема “соберем все подряд, разберемся потом” начинает ломаться. Чем больше автономии у агента, тем быстрее растет объем телеметрии, а вместе с ним и стоимость ingest, обработки и хранения.
Отсюда и разворот в сторону telemetry pipelines как отдельного уровня контроля. Их задача не просто передавать данные из точки А в точку Б, а отфильтровывать, нормализовать и маршрутизировать сигналы так, чтобы в дорогие системы попадало только то, что реально нужно для эксплуатации и анализа. Идея не новая для мира observability, но с AI она становится почти обязательной. Если агент порождает множество промежуточных событий, не все из них одинаково полезны. Одни нужны для отладки инцидента, другие — для оценки стоимости запроса, третьи — вообще одноразовый шум. Без предварительной селекции компания сначала платит за генерацию этих событий, а потом еще и за право их хранить.
Для бизнеса это уже вопрос не красоты архитектуры, а дисциплины расходов. The New Stack отдельно подчеркивает, что финансисты все внимательнее смотрят на pay-as-you-go-модель observability. И это неудивительно: в AI-сценариях цена ошибки в сборе данных удваивается. Если команда не видит реальную стоимость работы агента по шагам, она не может внятно ответить, почему вырос бюджет. Если видит все, но без фильтрации, бюджет может вырасти уже из-за самой наблюдаемости. В этом смысле телеметрия ИИ-агентов становится частью FinOps-практики: контролировать нужно не только модели и токены, но и саму систему измерения этих расходов.
Для разработчиков и платформенных команд вывод тоже вполне прикладной. Во-первых, AI-обвязку уже нельзя прятать в “черный ящик”, который просто вызывает модель и возвращает ответ. Нужны понятные события на каждом этапе выполнения агента. Во-вторых, стоит заранее решать, какие сигналы действительно нужны для production: не вообще “все логи”, а конкретные поля, уровни детализации и сроки хранения. В-третьих, метрики качества ответа придется ставить рядом с инфраструктурными метриками, потому что для агента успешный HTTP-статус еще не означает успешный результат. Система может быть быстрой, дешевой и при этом стабильно выдавать ерунду. Для обычного APM это зеленая зона, для бизнеса — нет.
Отдельный нюанс — организационный. Пока агентные проекты живут в лабораторном режиме, расходы на телеметрию обычно теряются на фоне общего энтузиазма. Но в production включаются SRE, платформенные инженеры, FinOps и руководители, которым нужны простые ответы на неприятные вопросы: что именно мониторим, сколько это стоит, какие данные реально используются и можно ли сократить поток без потери видимости. Если таких ответов нет, автономный агент быстро превращается из модного инструмента в источник неуправляемых переменных расходов.
На практике рынок подталкивает команды к скучному, но здоровому выводу: в эпоху агентных систем побеждает не тот, кто собрал больше телеметрии, а тот, кто научился собирать достаточно. Следующий этап конкуренции в AI-инфраструктуре, похоже, пройдет не только вокруг моделей и inference, но и вокруг умения доказать, что каждый лог, trace и метка действительно стоят своих денег.