DeepSeek V4 Flash стоит $0,14 за 1 млн входных токенов и $0,28 за 1 млн выходных, а по ряду практических сценариев оказывается разумнее, чем старший V4-Pro. Для разработчиков, продуктовых команд и IT-руководителей это важный сигнал: рынок моделей все заметнее делится не на «лучшую» и «дешевую», а на ту, что окупается в реальной работе.
Поводом стал разбор двух моделей DeepSeek, о котором сообщает The New Stack. Суть неожиданности простая: V4-Flash не превращается в убийцу V4-Pro по «чистой» интеллектуальной мощности, но зато ломает привычную логику выбора, где младшая модель нужна только ради экономии. По официальным данным DeepSeek, обе модели семейства V4 были представлены 24 апреля 2026 года, обе работают с контекстом до 1 млн токенов, поддерживают thinking- и non-thinking-режимы и доступны с открытыми весами под лицензией MIT. Но по устройству это разные весовые категории: у V4-Flash 284 млрд параметров и 13 млрд активных на инференсе, у V4-Pro — 1,6 трлн и 49 млрд активных.
Если смотреть на базовые бенчмарки без попыток выдать желаемое за действительное, V4-Pro все еще сильнее. На MMLU-Pro у него 73,5 против 68,3 у Flash, на HumanEval — 76,8 против 69,5, на LongBench-V2 — 51,5 против 44,7. Разрыв особенно заметен там, где нужны знания, длинный контекст и более стабильная работа на сложных задачах: например, Simple-QA Verified дает 55,2 у Pro против 30,1 у Flash. То есть тезис «младшая модель лучше старшей» в лоб не работает. Максимум, что тут можно честно сказать: V4-Flash местами удивляет и иногда отыгрывает свою меньшую массу. У него, например, выше результаты на MGSM — 85,7 против 84,4, и на CMath — 93,6 против 90,9.
Но экономика у этих моделей отличается куда сильнее, чем цифры в таблицах. По актуальному прайсингу DeepSeek, V4-Flash стоит втрое дешевле Pro и на входе, и на выходе: $0,14 против $0,435 за 1 млн входных токенов без кэша и $0,28 против $0,87 за 1 млн выходных. Разница в лимитах параллельных запросов тоже не косметическая: 2500 одновременных соединений у Flash против 500 у Pro. Для команды, которая гоняет массовую генерацию кода, автосводки, AI-проверки pull request, внутренние RAG-сервисы или агентные пайплайны с высоким объемом коротких запросов, это уже не «скидка на инференс», а другой класс операционной модели. Проще говоря, одну дорогую модель для всего подряд становится все труднее защищать перед финансами и перед SRE.
Самое интересное начинается, когда DeepSeek включает режимы reasoning effort. На части «мыслящих» тестов V4-Flash подбирается к Pro куда ближе, чем можно было ожидать по размеру. На MMLU-Pro в режимах High и Max у Flash 86,4 и 86,2, у Pro — 87,1 и 87,5. На GPQA Diamond — 87,4 и 88,1 против 89,1 и 90,1. На LiveCodeBench — 88,4 и 91,6 против 89,8 и 93,5. Для разработчика это означает неприятную для дорогих моделей вещь: во многих задачах программирования и рассуждения старший класс больше не гарантирует пропорциональную прибавку к качеству. Зато на агентных и многошаговых сценариях V4-Pro удерживает преимущество увереннее: на Terminal Bench 2.0 у него 67,9 против 56,9 у Flash, на BrowseComp — 83,4 против 73,2, на MCPAtlas — 73,6 против 69,0. Там, где модель должна не просто ответить, а последовательно работать с инструментами и не терять нить, большой запас мощности все еще решает.
На уровне рынка это еще один неприятный вопрос для OpenAI, Anthropic и остальных игроков с более дорогим стеком. DeepSeek уже не первый месяц давит на цены, но история с V4-Flash показывает, что дело не только в демпинге. Китайская лаборатория пытается сдвинуть сам критерий выбора модели: не «кто выиграл на общем лидерборде», а «сколько стоит достаточное качество на массовом продакшене». Для русскоязычной IT-аудитории это звучит особенно прикладно. Стартапам и продуктовым командам такой сдвиг открывает путь к более агрессивной автоматизации без мгновенного роста счета за API. Для крупных компаний это аргумент в переговорах с вендорами и повод серьезнее смотреть на open-weight-модели, которые можно встроить в собственный контур через vLLM, SGLang или совместимые агентные обвязки.
Похоже, следующий этап конкуренции будет не про одну «лучшую» модель, а про грамотную маршрутизацию нагрузки: быстрый и дешевый DeepSeek V4 Flash на потоковые задачи, V4-Pro — на тяжелые агентные цепочки и сложное reasoning. Если этот сценарий закрепится, выиграет не тот, у кого самая громкая презентация, а тот, кто первым научится считать стоимость не токена, а законченной работы. Подробности разбора — в материале .