Модель MiniMax M2.5 с стоимостью $0,02 за вызов достигла 78,2% точности на SWE-bench Verified. Это означает, что даже менее дорогая модель смогла показать более высокие результаты, чем ее более дорогие конкуренты, включая Claude Opus 4.5, который занял второе место с 76,8% при ценах $0,75 за вызов.
Что такое SWE-bench Verified?
SWE-bench Verified — стандартный бенчмарк для оценки AI-агентов в реальных задачах программирования. В его составе 500 экземпляров с реальными ошибками, которые были извлечены из открытых Python-репозиториев. Каждая задача включает описание проблемы, снимок кода, золотую правку и тесты для проверки решения.
Результаты бенчмарка показали, что MiniMax M2.5, с применением XCE (Xanther Context Engine), мог бы занять первое место с точностью в 78,2% и стоимостью всего $0,22 за вызов. Это преображает представления о том, сколько могут стоить решения на основе AI, делая их более доступными для разработчиков и бизнеса.
Результаты тестирования и их значение
Тестирование показало, что использование архитектурного контекста через XCE значительно улучшает результаты AI-агентов. Например, Sonnet 4.0, без применения XCE, показал 66% точности, а с ним — 73,4%. Эти эти подчеркивают важность контекстуальной информации для успешного решения задач программирования.
Это улучшение указывает не только на возможности MiniMax M2.5, но и на потенциал снижения затрат на разработку программного обеспечения. Если ваш проект требует обработки ошибок и оптимизации кода, MiniMax M2.5 может снизить затраты на 70% по сравнению с конкурентами.
Потенциал и дальнейшие шаги
С учётом растущей потребности в эффективных инструментах для обработки ошибок, модели, подобные MiniMax M2.5, могут занять ключевую роль на рынке программного обеспечения. В ближайшем будущем стоит ожидать дальнейшего развития технологий, что позволит улучшать качество и доступность AI-решений для программистов по всему миру.