DeepSeek запустила экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp в своей API-платформе. По данным компании, по работе с текстом она соответствует DeepSeek-V4-Flash, включая рассуждения, работу агентов и знания о мире.
Главное отличие — поддержка изображений. DeepSeek заявляет, что на тестах мультимодальных агентов новая модель значительно превосходит V4-Flash и приближается по результатам к Opus-4.8.
Модель поддерживает смешанный ввод текста и изображений через Chat Completions, Messages и Responses. Изображения можно передавать через base64, внешние ссылки или новый Files API. Одно изображение учитывается при тарификации как максимум 384 токена по цене V4-Flash.
DeepSeek также выпустила Harness 0.1.1 с поддержкой новой модели и запустила бесплатный Files API для повторного использования загруженных изображений.