КИБЕРБЕЗОПАСНОСТЬ

Почему одних тестов уже мало для доверия к AI-агентам

Более 1000 пользовательских и атакующих профилей Vijil использует для проверки AI-агентов: одного benchmark’а уже недостаточно для продакшена.

✍️ Редакция iTech News | 29.07.2026 | ⏱ 3 мин | Источник: VentureBeat
💀

Высокие баллы в тестах и аккуратная работа в изолированной среде еще не доказывают, что AI-агент не сорвется в реальной эксплуатации. Именно на этом строит свой тезис стартап Vijil: надежность таких систем нужно проверять не один раз перед запуском, а постоянно, уже в рабочей среде, где меняются данные, пользователи и сценарии атак.

Здесь есть важная оговорка: VentureBeat опубликовал этот материал как партнерский. То есть перед нами не независимое исследование, а позиция компании, которая продает инструменты для проверки и защиты AI-агентов. Но сама проблема от этого не исчезает: бизнес все чаще отдает агентам доступ к внутренним системам, а цена ошибки быстро растет.

Партнерский материал VentureBeat и тезис Vijil

Основатель и глава Vijil Вин Шарма спорит с привычной логикой корпоративного ИТ: протестировали систему перед запуском, поставили отметку о приемке и пошли дальше. С AI-агентами такой подход работает хуже, потому что они не просто выполняют заранее заданный сценарий, а взаимодействуют с меняющейся средой и принимают решения на ходу.

По версии Vijil, у классических тестов три слабых места. Во-первых, наборы задач статичны, а рабочая среда нет. Во-вторых, тест всегда упрощает реальность и не ловит часть сбоев, которые всплывают уже после запуска. В-третьих, популярные наборы задач со временем попадают в обучающие данные новых моделей, и система учится проходить экзамен, а не вести себя надежно в деле.

Отсюда и главный сдвиг в терминологии: Vijil предлагает смотреть не только на способности агента, но и на его надежность как исполнителя. Шарма описывает это через три свойства: компетентность, аккуратность и действие в интересах заказчика. Формулировка местами звучит почти юридически, но смысл приземленный: агент не должен «оптимизировать» задачу ценой утечки данных, нарушения правил доступа или репутационного ущерба.

Почему реальные среды ломают красивые оценки

Vijil делит риск на три части: предсказуемость работы, устойчивость к атакам и ограничение ущерба при ошибке. Итоговую оценку Шарма сравнивает с кредитным рейтингом, только не финансовым, а поведенческим. Для ИТ-директора или руководителя продукта это полезнее абстрактного балла из презентации: вопрос ведь не в том, насколько модель умная, а в том, можно ли ей доверить реальный процесс.

В качестве основы для проверки компания предлагает три блока. Первый связан с целью: тесты должны учитывать конкретную задачу агента, а не усредненный сценарий. Второй блок связан с ролями пользователей и атакующих: система должна выдерживать не только «идеального сотрудника», но и злоумышленника или неаккуратного пользователя. Третий блок связан с внутренними правилами компании: требованиями регуляторов, политикой доступа, правилами работы с данными и другими ограничениями.

Отдельно Шарма указывает на риск связок из нескольких агентов. По его логике, поодиночке они могут выглядеть приемлемо, а вместе создавать новую зону риска. Например, один агент пишет код, второй его проверяет, но пара все равно пропускает дефект или закладку. Для команд разработки и информационной безопасности это уже не спор о качестве подсказки для модели, а вопрос архитектуры контроля.

Что это меняет для компаний в России и СНГ

Для русскоязычного рынка вывод простой: если компания внедряет AI-агентов в поддержку, разработку, аналитику или внутренние операции, смотреть только на демонстрацию и результаты тестов уже опасно. Нужны инвентаризация неучтенных AI-инструментов, отдельные учетные записи и права для агентов, а также постоянная проверка их поведения после запуска. Иначе бизнес получает не автоматизацию, а новый класс операционного риска, который особенно неприятен там, где агенту дали доступ к данным, коду или внутренним системам.

Скорее всего, рынок в ближайшие месяцы будет спорить уже не о том, умеет ли агент решать задачу, а о том, как быстро компания замечает его сбой и насколько дешево умеет его остановить. Оригинал партнерского материала VentureBeat: VentureBeat.

Поделиться: Telegram X LinkedIn