GitHub презентовал новую модель для валидации поведения своих автономных агентов, таких как Copilot. Это важно для разработчиков, так как предложенный подход помогает устранить «ложные негативы» в тестировании, которые могут останавливать производственный процесс.
Проблемы существующих методов тестирования
Современные методы тестирования программного обеспечения основываются на предположении, что корректное поведение можно воспроизводить. Это сработает для детерминированного кода, но с автономными агентами, такими как GitHub Copilot, это правило часто нарушается. Когда агенты взаимодействуют с реальными средами, такими как пользовательские интерфейсы или браузеры, корректность выполнения задач становится многоуровневой. Примеры сетевых задержек или несоответствия временных рамок могут привести к ошибкам на уровне валидации при выполнении успешных задач.Новая модель валидирования
GitHub предлагает перейти от хрупких пошаговых сценариев к независимому «слою доверия» для валидации поведения агентов. Этот подход будет сосредоточен на основных итогах, а не на жёстких путях выполнения, позволяя более эффективно валидировать выполнение задач в реальных условиях CI/CD. При этом, вместо проверки, «произошло ли это?», новая модель будет акцентироваться на вопросах, что должно было произойти для истинного успеха.Влияние на разработку
Для российских разработчиков такая модель представляет возможность убедиться в надёжности их CI/CD процессов с использованием Copilot. Внедряя модель GitHub, можно избежать множества ложных срабатываний, что существенно ускорит процесс разработки и тестирования. Ожидается, что изменения помогут улучшить качество выпускаемого программного обеспечения, за счёт повышения точности валидации выполнения задач.Следующий шаг для GitHub — продолжение работы над улучшением валидационных процессов для автономных агентов, что должно привести к снижению ошибок при их использовании на практике.