Модель DeepSeek V4 Pro продемонстрировала отставание на 8 месяцев от ведущих моделей в независимых тестах. Это может серьезно повлиять на её репутацию и рынок AI.
Контекст: конкуренция на рынке AI
После недавнего анонса DeepSeek V4 Pro, где компания утверждала, что отстает от образцов таких как Anthropic Opus и OpenAI GPT всего на 3–6 месяцев, независимый анализ от NIST показал иную картину. Эти замеры подтвердили, что реальные результаты DeepSeek находятся на 8 месяцев позади, что может вызвать сомнения у пользователей и разработчиков в российском сегменте.
Подробности независимого тестирования
NIST провёл тесты, используя стандарты, которые были заранее определены. Это позволило избежать манипуляций с выбором метрик, как это делала сама DeepSeek в своих отчетах. В то время как DeepSeek V4 Pro показывала хорошие результаты на своих бенчмарках, таких как SWE-Bench и GPQA Diamond, в независимых тестах её производительность значительно упала.
К примеру, на задачах по кибербезопасности модель DeepSeek решила только 32% задач, в то время как GPT-5.5 справилась с 71%. Разрыв также наблюдается в задачи по абстрактному мышлению, где DeepSeek показала 46% против 79% у конкурента.
Влияние на инвестиции и разработчиков
Для инвесторов и разработчиков это важный сигнал: методы выбора бенчмарков могут существенно повлиять на восприятие технологий. Независимые тесты, такие как те, что проводит NIST, становятся актуальными для оценки реальной конкурентоспособности моделей. Не менее важным является и вопрос ценовой доступности: DeepSeek V4 Pro в ряде тестов оказалась дешевле GPT-5.4 mini, что может заинтересовать стартапы с ограниченным бюджетом.
Заключение и рекомендации
В условиях растущей конкуренции на рынке ИИ, внимание к методологии тестирования становится критически важным. Разработчикам в России стоит учитывать не только стоимость, но и качество моделей, основываясь на независимых оценках. Ожидается, что в будущем компании будут более внимательны к выбору бенчмарков, используя независимые стандартные тесты для повышения доверия и оценки своих технологий.