Meta и Университет Иллинойс представили EvoHarness-RL — новую методику, которая обучает ИИ-модели эффективно работать с внешним состоянием и инструментами. Эта разработка позволяет заметно улучшить выполнение сложных многошаговых задач и в одном из тестов вывести 8B-модель на уровень Claude Opus 4.5.
Фундаментальные изменения в работе ИИ
Новый метод EvoHarness-RL добавляет обучаемый слой координации поверх внешней среды агента, что позволяет модели не просто следовать жестким инструкциям, а адаптироваться к изменениям в реальном времени и получать актуальную информацию от среды. Это особенно важно для задач с длительным горизонтом, таких как миграция баз данных, где необходимо отслеживать статус выполнения подзадач и восстанавливаться после возможных ошибок. Нынешние системы, использующие статические инструкции, часто требуют значительных затрат времени и ресурсов на получение обновлений и корректировку логики, что затрудняет их адаптацию к новым условиям.
Технические детали EvoHarness-RL
Исследователи выявили, что ручная настройка логики и внешней памяти является основным препятствием для развития ИИ: «Оптимальные схемы работы системы зависят от особенностей моделей и требуют индивидуального подхода», — отметил Сюйин Нин, соавтор исследования. EvoHarness-RL позволяет объединить управление данными и обучение, снижая вероятность ошибок, связанных с накоплением устаревшей информации. Этот метод предлагает динамическую память, которая минимизирует повторение прошлых ошибок, что может значительно ускорить обработку данных.
Значение для IT-индустрии
Для разработчиков и компаний, работающих с ИИ, использование EvoHarness-RL может стать большим шагом вперёд. Эта методика создаёт возможности для построения более гибких и адаптивных систем, экономя ресурсы на обучение и настройку. Если ваша команда разрабатывает ИИ-продукты, стоит помнить о том, что мощные модели, такие как Claude Opus, могут быть не единственным путём к достижению успеха в сложных задачах. EvoHarness-RL позволяет находить баланс между стоимостью и эффективностью.
Следующий шаг для Meta и партнеров — внедрение EvoHarness-RL в реальных задачах для тестирования его эффективности на практике.