DeepSeek近日宣布,其全新实验性质的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp已正式上线DeepSeek API平台。该模型基于DeepSeek-V4-Flash架构开发,在纯文本处理能力上与正式版保持一致,但在视觉理解任务中展现出显著提升,尤其在多模态Agent能力方面已接近行业领先水平。
基准测试数据显示,新模型在涉及视觉理解的Agent Benchmark中表现突出,相比基础版本实现质的飞跃。开发者可通过简单设置模型参数"deepseek-v4-flash-vision-exp"即可调用其图像理解功能,支持Chat Completions、Messages、Responses三种主流API格式,实现图文混合输入。图片处理采用token化计量方式,单张图片最高按384 tokens计算,定价与文本模型持平,高峰时段处理成本低至0.001152元/张。
为优化开发体验,平台同步推出Files API服务。开发者可预先上传图片获取永久file_id,后续调用无需重复传输,有效降低网络开销。该服务特别适用于需要频繁调用相同图片的场景,如电商商品展示、教育课件制作等领域。
在应用场景方面,新模型展现出强大适应性。实测案例显示,其不仅能准确理解"野性原始""探索感"等抽象视觉风格要求,还可完成复杂的视觉编程任务。例如为官网添加"黑蓝深海""玻璃UI"等特效元素时,生成的动画流畅自然,文字渲染质量达到专业水准。这种能力使非专业开发者也能轻松实现高端视觉设计需求。
技术迭代层面,DeepSeek Harness平台近日完成重要更新,新增对V4-Flash-Vision-Exp模型的原生支持。开发者现在可在适配器中直接配置图片请求参数,实现更高效的模型调用。此次更新覆盖多模态输入、子代理协作、终端交互等多个维度,标志着该平台在全模态Agent支持方面迈出关键一步。
市场观察人士指出,DeepSeek此次补齐多模态能力具有战略意义。虽然入场时间较晚,但其通过差异化定价策略和易用性设计,可能对现有市场格局产生冲击。特别是对于成本敏感型开发者和中小企业,新模型提供的"高性价比+全功能"组合具有较强吸引力。随着生态工具的逐步完善,该模型有望催生更多创新应用场景。


