Alibaba выпустила новую платформу Qwen-AgentWorld, которая улучшила производительность автономных агентов на 35%, что является важным шагом в развитии AI-технологий. Этот релиз расширяет возможности Alibaba в области автономных агентов и покрывает семь различных доменов, таких как MCP, поиск, терминалы и веб-программирование.
Новый подход к обучению
Большинство агентов обучаются реагировать на состояние окружающей среды. Однако Qwen-AgentWorld использует новый метод, в котором акцент сделан на предсказании будущего поведения среды на основе действий агентов. Это уникальный подход, который позволяет учитывать не только текущие, но и предстоящие условия, что значительно увеличивает эффективность.
Модели были обучены на более чем 10 миллионах реализаций взаимодействий с окружением. Первая стадия обучения познакомила модель с поведением различных систем, таких как файловая система и терминальные состояния, в то время как вторая стадия включает предсказание того, что будет дальше. На третьем этапе используется обучение с подкреплением для оптимизации предсказаний.
Результаты и их значение
Тесты показали, что агенты, обученные в контролируемой симуляции, продемонстрировали лучшие результаты по сравнению с теми, кто обучался в реальных условиях. Например, производительность в тесте MCPMark повысилась с 24,6 до 33,8, а в тесте WideSearch F1 Item — с 34,02 до 50,31. Эти результаты показывают, что цель моделирования среды является ключевым аспектом в разработке эффективных автономных агентов.
Выводы для разработчиков
Для разработчиков это означает, что использование новых методов обучения и фокус на предсказание вместо реагирования может значительно улучшить результаты их проектов с автономными агентами. Сделав ставку на Qwen-AgentWorld, компании, работающие в сфере AI, могут повысить свою конкурентоспособность и оперативную эффективность.
В ближайшее время следует ожидать дальнейших обновлений Qwen-AgentWorld, что, возможно, ещё больше увеличит диапазон применения автономных агентов в различных отраслях.