DeepSeek запустил новую экспериментальную модель V4‑Flash‑Vision‑Exp, обладающую мультимодальными функциями. Эта модель позволяет одновременно работать с текстом и изображениями, что расширяет возможности использования платформы для разработчиков и исследователей.
Преимущества мультимодальности
Теперь пользователи могут комбинировать текстовые и визуальные данные в одном запросе. Модель V4‑Flash показывает результаты, близкие к Opus‑4.8 на мультимодальных бенчмарках. Для работы с новой моделью необходимо указывать параметр model='deepseek‑v4‑flash‑vision‑exp' при отправке запросов.
Созданная параллельно новая версия DeepSeek Harness 0.1.1 поддерживает эту модель, что упрощает интеграцию для разработчиков. Поддерживаемые конечные точки API включают Chat Completions, Messages и Responses. Изображения можно передавать в формате base64, а токенизация для биллинга составляет до 384 токенов за изображение.
Новый файловый API для удобства
Вместе с моделью представлен бесплатный файловый API, который позволяет загружать изображения один раз и использовать идентификатор file_id в последующих запросах. Это экономит трафик и упрощает работу с данными, так как один и тот же файл можно многократно использовать.
Значение для профессионалов отрасли
Появление мультимодальных решений вдохновляет специалистов на создание более сложных и разнообразных приложений. Это важный шаг для компаний, работающих в области AI — такой подход открывает новые горизонты для интеграции различных видов информации и улучшает качество взаимодействия с пользователем.
Следующий шаг для DeepSeek — активная работа над улучшением качества генерации контента и интеграция новых типов данных в систему. Прогнозируется, что это поможет компании привлечь больше клиентов и занять значимую долю рынка мультимодальных AI-речевых решений.