Xiaomi выпустила MiMo-V2.6 и сделала редкий для рынка ход: открытые модели Xiaomi получили не только веса, но и технический отчет, RL-код, среды задач и следы публичного обучения. Для разработчиков и компаний, которые выбирают между закрытым API и локально контролируемой моделью, это важнее очередного места в бенчмарке: появляется материал, который можно проверять, портировать и ломать собственными руками.
О релизе сообщает The New Stack. В линейку MiMo-V2.6 вошли две нативно мультимодальные модели — Pro и Flash, а также дистиллированная версия MiMo-V2.6-Distill-Qwen-9B. Xiaomi заявляет поддержку текста, изображений, видео и аудио, контекст до 1 млн токенов и запуск моделей на открытой платформе MiMo API. На Hugging Face опубликованы веса Pro и Flash, а вместе с ними — технический отчет и исследовательские ресурсы для обучения с подкреплением.
Главная интрига не в том, что еще один китайский вендор выложил open-weight модель. Это уже почти еженедельная рутина: Alibaba, Zhipu, DeepSeek и другие давно приучили рынок к тому, что «открытость» часто означает скачиваемые веса, красивую таблицу результатов и лицензию, написанную мелким шрифтом. Xiaomi пошла дальше: компания раскрыла end-to-end RL-фреймворк, набор мини-харнессов и более 7 тыс. сред для агентных задач — от software engineering и web design до воспроизведения уязвимостей и knowledge-intensive work. Для ML-инженеров это уже не рекламный буклет, а заготовка для воспроизводимых экспериментов.
По данным Xiaomi, этап RL-обучения длился меньше 6 дней. За это время Pro и Flash прошли по 30 шагов, суммарно набрав около 750 тыс. траекторий. Расходы компания оценила примерно в $2,62 млн для Pro и $850 тыс. для Flash. Эти цифры, конечно, остаются вендорскими, а не аудированными: дата-центр сам себе бухгалтер. Но сам факт публикации такого уровня операционных деталей редок. Обычно рынок получает только финальную открытку: «мы обучили модель, она всех победила, верьте графику».
В бенчмарках Xiaomi тоже не скромничает. Компания пишет, что MiMo-V2.6-Pro набрала 46 баллов в Artificial Analysis Intelligence Index и обошла ряд открытых моделей. Для DeepSWE v1.1 заявлен рост примерно с 58,4 до 72,6 у Pro и с 48,8 до 65,7 у Flash. На 9B-дистилляте Xiaomi показывает улучшения сразу на 11 тестах после RL: например, SWE-bench Verified вырос с 61,1 до 66,2, Terminal Bench 2.1 — с 37,1 до 52,8. Все это надо читать трезво: бенчмарк — не контракт на продакшен-качество, а агентные тесты особенно чувствительны к обвязке, подсказкам и среде выполнения.
Реакция сообщества закономерно сфокусировалась не на таблицах, а на прозрачности. Сооснователь Hugging Face Томас Вольф публично похвалил уровень открытости крупного RL-запуска. И тут есть за что зацепиться: открытые модели Xiaomi позволяют изучать не только итоговую модель, но и саму механику посттренинга — как собираются траектории, как устроены reward-сигналы, как харнессы соединяются с агентной средой, где возникают сбои и как команда пытается защищаться от reward hacking. Для исследователей это почти учебник с пометками на полях.
Для бизнеса релиз интересен прагматикой. Если модель действительно сохраняет качество при более низкой цене API, как утверждает Xiaomi, то у команд появится еще один аргумент против безусловной зависимости от дорогих закрытых систем. Но главный сценарий — не «заменить все на MiMo-V2.6 завтра утром». Скорее, это новый базовый набор для команд, которые строят кодовых агентов, внутренние ассистенты, CUA-сценарии, автоматизацию тестирования и R&D-пайплайны. Им важны не только ответы модели, но и возможность понять, почему она ошибается и как ее дообучать под свою среду.
В ближайшие месяцы станет видно, превратится ли такой формат в норму для сильных open-weight релизов. Если открытые модели Xiaomi заставят конкурентов публиковать не только веса, но и код обучения, харнессы, среды и честные логи неудач, рынок получит более полезную гонку: не за самый громкий график, а за модели, которые можно проверять без гадания на презентационных слайдах.