Whatbroke — новая CLI-утилита на TypeScript с лицензией MIT, которая сравнивает два прогона ИИ-агента и показывает, где именно изменилось его поведение. Для команд, которые меняют модель, правят системный промпт или обновляют агентный стек, это практичнее обычного diff по ответам: инструмент ловит пропавшие вызовы инструментов, дрейф аргументов, скачки задержки и рост стоимости.
Смысл простой: агент может по-прежнему писать убедительно, но при этом тихо перестать делать нужное действие. Для разработки это один из самых неприятных классов ошибок: на глаз всё выглядит нормально, а бизнес-сценарий уже сломан.
Проект появился как инструмент для быстрых проверок после смены модели
Whatbroke опубликован на GitHub, а автор проекта Arthi Arumugam отдельно описал сценарий использования в заметке на Zenn. Идея родилась из типовой проблемы агентных систем: после замены модели или небольшой правки промпта ответы проходят «проверку на ощущение», но цепочка действий уже меняется.
Автор приводит показательный пример: после перехода на модель в три раза меньше агент продолжал отвечать правдоподобно, но перестал вызывать функцию отмены подписки. То есть текст выглядел корректно, а реальное действие не выполнялось. Собственно, под такие тихие регрессии и сделан whatbroke.
Утилита сравнивает не слова, а действия агента
Инструмент работает с JSONL-трейсами, где каждая строка — отдельное событие: старт прогона, вызов модели, обращение к инструменту, итоговый ответ, токены, задержка, стоимость. После этого достаточно запустить сравнение двух файлов через CLI и получить отчёт по изменениям.
По описанию репозитория, whatbroke умеет находить несколько типов расхождений: исчезнувшие вызовы инструментов, ошибки в них, изменившиеся аргументы, перестановку шагов, смену финального результата, а также регрессии по задержке и цене. Если инструмент находит критичное изменение, он завершает команду с кодом 1. Это уже не игрушка для демонстрации, а заготовка под CI-проверки.
Есть и ещё одна полезная деталь. Агентные системы нестабильны по своей природе, поэтому один прогон легко превращает обычный шум в ложную тревогу. Whatbroke предлагает запускать один и тот же сценарий несколько раз и помечать серии суффиксами вроде #1, #2, #3. Тогда отчёт показывает частоту находок, например 6/9 пар запусков, и помогает отделить настоящую регрессию от штатной турбулентности модели.
Порог входа ниже, чем у тяжёлых платформ наблюдаемости
У проекта прагматичный подход: сначала собрать минимальный след, а уже потом строить сложную наблюдаемость. Самый быстрый способ — запустить локальный прокси через команду record и направить на него агента через базовый URL OpenAI или Anthropic. Если трассировка уже есть, whatbroke умеет импортировать данные из OpenTelemetry, Langfuse и LangSmith.
На практике это выглядит как инженерный предохранитель, а не как ещё одна «платформа будущего». И это как раз сильная сторона проекта: команде не нужно поднимать отдельную систему ради простого вопроса «что именно сломалось после смены модели».
Для рынка это сигнал, что агентам нужен свой регрессионный контроль
Для русскоязычных команд смысл предельно прикладной. Многие сейчас переключаются между моделями, ищут более дешёвый инференс, тестируют локальные развёртывания и считают задержку для пользовательских сценариев. В каждом таком шаге риск один и тот же: цена падает, а агент незаметно начинает пропускать проверку, ломать вызов API или отправлять неверные аргументы в инструмент. Whatbroke закрывает именно эту дыру между ручной отладкой и дорогой платформой наблюдаемости.
Если такие проверки станут обязательной частью релизного процесса, у ИИ-продуктов появится то, чего им давно не хватает: нормальная дисциплина регресс-тестирования не только по тексту ответа, но и по фактическому действию агента.
Источник: GitHub-репозиторий whatbroke, заметка автора на Zenn.