DeepSeek V4 Flash получила обновление с индексом 0731, и это тот редкий случай, когда «облегченная» модель портит настроение собственному флагману. По данным The New Stack, новая версия DeepSeek V4 Flash заметно прибавила в агентных сценариях и в отдельных задачах уже обходит DeepSeek V4 Pro, хотя базовая архитектура семейства при этом не менялась. Для русскоязычных команд это важный сигнал: в гонке ИИ-моделей сейчас выигрывает не только тот, у кого больше параметров, но и тот, кто лучше довел рабочий профиль под код, инструменты и длинный контекст.
История здесь не про красивую презентацию, а про инженерную экономику. Весной, 24 апреля 2026 года, DeepSeek представила V4 Preview и открыла веса двух моделей: V4 Pro и V4 Flash. Старшая версия получила 1,6 трлн параметров при 49 млрд активных, младшая — 284 млрд общих и 13 млрд активных. Обе модели поддерживают контекст до 1 млн токенов, работают через совместимый с OpenAI и Anthropic API и опубликованы с открытыми весами по лицензии MIT. На старте Flash позиционировалась как более быстрая и дешевая альтернатива: проще агентные задачи, меньше задержка, ниже цена. Теперь, судя по публикации The New Stack, эта «бюджетная» роль уже не выглядит второстепенной.
Главное в релизе DeepSeek V4 Flash-0731 — рост агентной производительности без публичного объявления о смене ядра модели. Иначе говоря, DeepSeek показывает то, что отрасль в 2026 году усвоила на практике: большой скачок качества часто приходит не от новой вывески, а от дообучения, настройки режима рассуждений, работы с tool use и оптимизации длинных траекторий. Для тех, кто строит агенты для разработки, поддержки, поиска по внутренним базам и автоматизации бизнес-процессов, это, пожалуй, даже важнее громких цифр в духе «еще на 300 млрд параметров больше». Размер по-прежнему имеет значение, но в продакшене обычно побеждают latency, стабильность и цена ошибки.
Почему это важно не только для исследователей
У DeepSeek V4 Flash и без того были сильные вводные. По официальной документации DeepSeek, модель поддерживает thinking и non-thinking режимы, а также заметно более высокую параллельность, чем Pro: лимит concurrency для Flash заявлен на уровне 2500 запросов против 500 у Pro. По цене разница тоже чувствуется: для API у DeepSeek V4 Flash указаны 0,14 доллара за 1 млн входных токенов без cache hit и 0,28 доллара за 1 млн выходных токенов, тогда как у Pro — 0,435 и 0,87 доллара соответственно. На бумаге это уже делало Flash удобным вариантом для массовых сценариев. Если же модель еще и начинает выигрывать у флагмана в части агентных задач, выбор для многих команд становится почти неловко простым.
Особенно это касается тех, кто давно считает не только качество ответов, но и стоимость одного завершенного действия. В корпоративной среде разработчикам редко нужен «самый умный ИИ вообще». Им нужен ИИ, который стабильно проходит длинный workflow: понял задачу, выбрал инструмент, не потерял контекст, сходил в репозиторий, вернулся с внятным патчем, не разнес тестовый контур. В таких сценариях меньшая модель, лучше обученная под агентное поведение, может оказаться полезнее тяжеловеса, который великолепен в бенчмарке, но дороже, медленнее и капризнее в связке с внешними инструментами.
Для российского рынка здесь есть еще один практический слой. Открытые веса и совместимость с привычным API-стеком означают, что DeepSeek V4 Flash можно не только дергать как внешний сервис, но и рассматривать для собственных контуров, гибридных схем и тонкой настройки под внутренние процессы. На фоне растущего интереса к self-hosted LLM, контролю над данными и предсказуемости затрат это выглядит не как академическая деталь, а как аргумент для архитектурного комитета. Если младшая модель семейства закрывает значимую долю задач дешевле и быстрее, бизнес обычно не спрашивает, почему она не называется Pro.
Что это меняет в гонке моделей
Релиз DeepSeek V4 Flash-0731 хорошо ложится в общий тренд 2026 года: рынок устал от примитивной логики «больше параметров — лучше продукт». Сейчас модели все чаще сравнивают не по абстрактному IQ, а по способности выполнять роль рабочего компонента в системе. Отсюда и сдвиг в сторону агентных метрик, длинного контекста, стоимости реального сценария и качества интеграции с кодовыми и офисными инструментами. DeepSeek здесь играет особенно агрессивно: с одной стороны, компания оставляет 1-миллионный контекст и открытые веса, с другой — подталкивает рынок к мысли, что более компактная модель может быть рациональнее флагмана не в теории, а в ежедневной эксплуатации.
Для конкурентов это неприятная новость по двум причинам. Закрытым игрокам становится сложнее объяснять премию за API, если open-weight модель дает достаточно сильный агентный результат. А разработчикам open-source и open-weight семейств приходится признать, что война идет уже не только за лидерство в таблицах, но и за цену полезного действия. И если DeepSeek продолжит улучшать Flash в таком темпе, вопрос скоро будет звучать не «насколько младшая модель близка к флагману», а «зачем в половине кейсов вообще нужен флагман». Подробнее о релизе и контексте пишет .