DeepSeek запустил новый режим «зрение» в своем приложении, который позволяет анализировать изображения, как это делает человек. Теперь в инструменте доступны три режима: быстрый, экспертный и зрение. Этот шаг открывает новые возможности для работы с графикой и может существенно упростить понимание сложных сцен.
Что изменилось в DeepSeek
Режим зрения работает на основе подхода «мышление визуальными примитивами». Вместо простой текстовой интерпретации изображений, модель расставляет ключевые точки и рамки, что помогает избегать путаницы при анализе объектов в плотной сцене. Например, как человек, который водит пальцем по картах, расставляя акценты в задании. Это решение позволяет избежать недостатка точности текстового описания, который иногда приводит к неправильным выводам.Технически новая функция строится на модели DeepSeek-V4-Flash. Для оптимизации вычислений служебная память была сжата: каждые четыре визуальных токена теперь объединяются в одну запись. Это значит, что ресурсы, необходимые для анализа картинки, сократились по сравнению с традиционными мультимодальными моделями, что может привести к снижению затрат на использование технологии.
Как это повлияет на рынок
По заявлениям разработчиков, на сложных задачах, таких как подсчет объектов и пространственное рассуждение, DeepSeek демонстрирует приблизительно тот же уровень точности, что и аналогичные решения от GPT-5.4 и Gemini 3 Flash. Однако важно помнить, что эти данные основаны на узком диапазоне тестов и не представляют собой полную картину возможностей модели.Для специалистов в области AI эта новинка может быть весьма полезной. Внедрение компьютерного зрения в инструменты, которые помогают анализировать и понимать графику, безусловно, откроет новые горизонты в разработках и поможет снизить затраты на инфраструктуру для компаний, работающих с визуальными данными.
В ближайшем будущем разработчики DeepSeek планируют расширить функционал модели, открывая доступ к ее весам и улучшая алгоритмы обработки изображений, что может еще больше повысить эффективность работы с визуальными данными.