Если ИИ-агент бодро собирает приложение за один присест, это еще не значит, что он переживет серьезный рефакторинг. Xiaomi заявила, что ее MiMo Code обходит Claude Code на задачах длиннее 200 шагов, и для рынка это важный сигнал: кодовые агенты уперлись не столько в генерацию кода, сколько в выносливость на длинной дистанции.
Об этом сообщает The New Stack. Главный тезис публикации довольно неприятен для всех, кто уже мысленно посадил AI в кресло штатного разработчика: агент, который легко строит рабочий каркас приложения, может начать буксовать уже примерно на 30-м шаге, если речь идет не о демо, а о продакшен-рефакторинге. И вот на этом фоне Xiaomi продвигает MiMo Code как систему, которая лучше держит длинную цепочку действий и не так быстро теряет контекст задачи.
Ключевая цифра здесь одна: 200 шагов. Именно после этой отметки, по версии Xiaomi, MiMo Code показывает себя лучше Claude Code. Формулировка важна: речь не о том, что один инструмент безоговорочно сильнее другого вообще, а о сравнении в сценарии, где агенту нужно долго оставаться в теме, не расползаться по побочным гипотезам и не ломать собственный план после серии правок, проверок и возвратов. Для тех, кто уже пробовал внедрять AI-ассистентов в реальную разработку, проблема знакомая. На первых итерациях агент выглядит почти магически: создает структуру проекта, пишет бойлерплейт, поднимает простые интеграции. Но как только задача превращается в многослойную цепочку зависимостей, где нужно помнить старые решения и не портить соседние модули, качество часто резко падает.
Собственно, поэтому история не про очередную табличку с бенчмарками, а про смену критериев оценки. Еще недавно рынок был одержим вопросом, кто быстрее напишет функцию, пройдет тест или исправит баг в изолированном репозитории. Теперь фокус смещается: кто способен провести десятки и сотни последовательных действий без потери цели. Для бизнеса разница принципиальная. Одно дело, когда агент помогает джуну набросать сервис, и совсем другое, когда он участвует в миграции монолита, разруливает каскад изменений в API, схеме данных и CI, а потом еще не забывает обновить документацию. На коротких дистанциях многие модели выглядят убедительно. На длинных начинается настоящая проверка архитектуры агента, механики памяти, цикла верификации и качества инструментов, которыми он пользуется.
Публикация The New Stack фактически поднимает тему, которую индустрия долго маскировала красивыми демо. У кодовых агентов слабое место не в том, что они не умеют писать код, а в том, что они нестабильно ведут длинную работу. Они могут повторяться, уходить в ложные ветки, забывать, зачем сделали предыдущий шаг, или чинить одно место ценой поломки другого. Поэтому заявление Xiaomi выглядит попыткой зайти не в шумную гонку «у кого модель умнее», а в более прикладную нишу: «у кого агент меньше устает». Для корпоративной разработки это даже важнее, чем очередной плюс в тестах на генерацию.
Для русскоязычной IT-аудитории здесь несколько практических выводов. Первый: при выборе AI-инструмента имеет смысл смотреть не только на качество первого ответа, но и на то, как система держит длинную сессию из правок, запусков и проверок. Второй: обещания про автономную разработку по-прежнему нужно читать с холодной головой. Если агент уверенно делает первые 10 шагов, это не гарантирует, что на 40-м он не начнет ломать контракт API, а на 70-м не забудет, зачем вообще менялась схема. Третий: выиграют те команды, которые встроят кодовые агенты в жесткий контур проверки, а не будут ждать от них самодостаточного волшебства. Чем длиннее траектория задачи, тем важнее тесты, линтеры, чекпоинты, ревью и ясная декомпозиция работы.
Есть и стратегический слой. Xiaomi исторически не воспринималась как компания, задающая тон в инструментах для разработчиков на глобальном рынке. Но если ее MiMo Code действительно способен стабильнее проходить длинные сценарии, это хороший пример того, как конкуренция в AI-сегменте выходит за пределы привычной связки OpenAI, Anthropic и Google. Для разработчиков это неплохая новость: рынок перестает мериться только размером модели и начинает спорить о вещах, которые реально болят в продакшене. А именно: сколько шагов агент проходит без деградации, насколько аккуратно работает с контекстом и умеет ли сам себя проверять, прежде чем вносить очередное «исправление», после которого сборка уже не встает.
Следующий этап гонки, похоже, будет не про самый эффектный автокомплит, а про самую устойчивую агентную петлю. Если это направление подтвердится, кодовые агенты станут оценивать почти как инженеров: не по красивому старту, а по способности довести сложную, грязную и длинную задачу до конца без нервного срыва на 30-м шаге.