Mistral Large 4, новая модель французской Mistral AI с 1,05 трлн параметров, получила 38 баллов в Intelligence Index компании Artificial Analysis. Это лучший результат среди моделей, созданных за пределами США и Китая, но пять китайских моделей с открытыми весами всё равно оказались впереди. Для российских команд, которым нужны развёртывание в частном контуре и альтернатива американским API, это важный сигнал: европейский игрок снова приблизился к переднему краю, хотя его экономика пока проигрывает китайским конкурентам.
Модель вышла в статусе Research Public Preview через API Mistral; веса компания обещает опубликовать до конца октября. Как сообщает Tom's Hardware, сейчас Artificial Analysis считает превью проприетарным, поэтому окончательные выводы об открытой версии делать рано. Архитектура mixture-of-experts задействует 49–52 млрд параметров на запросе при общем размере 1,05 трлн. Контекстное окно — 512 тыс. токенов, на вход можно подавать текст и изображения, а на выходе доступен текст.
Результат в 38 баллов ставит Mistral Large 4 на один уровень с GPT-6 Luna в максимальном режиме и почти вплотную к DeepSeek V4.1 Flash с 39 баллами. Однако европейское лидерство здесь имеет чёткую географическую оговорку. Xiaomi MiMo-V2.6-Pro набрала 46 баллов, GLM-5.3 — 45, Kimi K3 — 44, GLM-5.3-Flash — 42. Даже DeepSeek V4.1 Flash опережает французскую модель на один балл.
Триллион параметров — не главный аргумент
Сравнение особенно неприятно для Mistral по цене. По расчётам Artificial Analysis, одна задача из Intelligence Index обходится для Large 4 примерно в $1,13 по базовому тарифу. На первые две недели компания ввела скидку 50%, снижающую показатель до $0,57, но это всё ещё заметно дороже MiMo-V2.6-Pro с $0,13 и GLM-5.3-Flash с $0,25 за задачу. В API Mistral установлены цены $1,36 за миллион входных токенов и $4,18 за миллион выходных; кэшированный входной токен стоит $0,14 за миллион.
Проблема не только в прайс-листе. Для прохождения индекса Large 4 понадобилось около 200 млн выходных токенов при медиане в 81 млн у сравниваемых моделей. То есть модель тратит больше вычислений, чтобы прийти к результату, который китайские open-weight системы часто дают лучше и дешевле. В диаграмме качества и стоимости Artificial Analysis она не попадает на границу Парето — ту самую зону, где нельзя улучшить один параметр без ухудшения другого.
Зато у модели есть заметная специализация в кибербезопасности. В сводном Cyber Index она получила 50 баллов — столько же, сколько GLM-5.3-Flash, и меньше 56 баллов MiMo-V2.6-Pro. Но в тесте CyberGym-E2E-AA Large 4 показала 81,7%: выше 79% у MiMo-V2.6-Pro, 78% у GPT-6 Luna и 74% у GLM-5.3-Flash. Этот результат не стоит превращать в универсальный вердикт о «самой безопасной» или «самой сильной» модели: Cyber Index включает три теста, а на DeepsecBench-AA французская модель набрала 16%, на CWE-Bench-AA — 51%.
Такой профиль может быть полезнее общего рейтинга для компаний с конкретным сценарием: например, для внутренних ассистентов SOC, анализа уязвимостей, проверки кода или обработки регламентированных документов. Mistral заявляет о применимости в кибербезопасности, финансах и праве. Дополнительный аргумент для корпоративного внедрения — обещание открытых весов, которые можно будет развернуть в private cloud или on-premises. Но до публикации весов это именно обещание, а не доступная опция.
Ставка на европейскую инфраструктуру
Large 4 обучали с нуля примерно два месяца на 3 800 GPU Nvidia Grace Blackwell в европейских дата-центрах Mistral. Предыдущая Large 3 была меньше: 675 млрд параметров всего и 41 млрд активных; для её обучения использовали 3 000 Nvidia H200. Компания также сообщала о планах существенно наращивать собственные вычислительные мощности в Европе. Для рынка это не просто соревнование бенчмарков: доступ к железу и возможность обучать крупные модели в собственной юрисдикции становятся частью продуктовой стратегии.
По скорости превью выглядит конкурентоспособно: Artificial Analysis зафиксировала 116,1 токена в секунду и 1,46 секунды до первого токена на API самой Mistral. В тестах документов и изображений модель получила 19% на GDP.pdf — на уровне MiMo-V2.6-Pro и ниже 22% у Kimi K3. При этом это на 18 пунктов выше результата Large 3. Mistral расширила API до 100 изображений в одном запросе вместо восьми у прежних моделей, что делает улучшение практичным для задач с пачками сканов, схем и презентаций, а не только красивой строкой в бенчмарке.
Mistral Large 4 пока выглядит не победителем общего зачёта, а сильным европейским кандидатом для ниш, где важны киберзадачи, мультимодальный ввод и будущий локальный запуск. После выхода весов станет понятно, сохранится ли преимущество в профильных тестах при самостоятельном развёртывании и смогут ли дообучения сократить разрыв с китайскими моделями по цене. Исходные цифры, тарифы и условия публичного превью собраны в материале .