Amazon разработала новый протокол аудита и оценки, который улучшает точность проверки фактов в AI-генерированных отчетах с 60,8% до 90,9%. Это имеет огромное значение для ученых, работающих с большими объемами информации, так как теперь можно более эффективно проверять сложные исследовательские отчеты.
Текущие проблемы с оценкой AI
Современные AI-системы могут создавать детализированные исследовательские отчеты, однако существующие инструменты фактической проверки часто не справляются с этой задачей. Например, стандартные методы оценки оценки требуют одиночных документов для проверки, в то время как AI-отчеты могут сочетать данные из множества источников.
Команда Amazon столкнулась с трудностью создания надежных стандартов для оценки AI-генерированных данных. Вместо того чтобы рассматривать «истинные факты» как фиксированный набор данных, они предложили рассматривать этот процесс как динамический и итеративный. Это изменяет подход к созданию и проверке стандартов в сфере AI.
Протокол аудита и оценки
Протокол, названный «аудит-затем-оценка», позволяет моделям использоваться для анализа и прояснения оценки, а не отвергать данные за несоответствие стандартам. В ходе тестирования с участием специалистов с докторскими степенями мы обнаружили, что точность проверки фактов оставалась на уровне 60,8% без использования данного протокола. Однако внедрение нового метода продемонстрировало результаты до 90,9% качества.
Как это повлияет на оценку AI
Для разработчиков и исследователей в области AI этот новый подход позволит сократить количество ошибок и повысить доверие к AI-генерированным материалам. Для российских команд важно учитывать, что правильная оценка AI сможет облегчить работу с большими объемами информации и повысить качество исследовательских отчетов.
В ближайшей перспективе Amazon планирует далее тестировать и развивать этот метод, расширяя его применение в различных областях исследования и разработки AI.