DeepSeek 上线实验性多模态模型 V4-Flash-Vision-Exp,视觉 Agent 能力大幅跃升
DeepSeek 于 8 月 21 日在 API 平台推出实验性视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,通过 model='deepseek-v4-flash-vision-exp' 即可调用。官方称其纯文本能力与 V4-Flash 持平,而在需要视觉理解的 Agent 基准上显著超越 V4-Flash,多模态 Agent 能力接近 Opus-4.8,公开 AutomationBench 得分为 25.7。
DeepSeek 在其 API 更新日志中宣布,新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已于 8 月 21 日在 DeepSeek API 平台上线。这是一个实验性模型,开发者只需将模型参数设为 deepseek-v4-flash-vision-exp 即可访问,具体用法可参考官方 Vision 指南。
在纯文本能力方面,包括 Agent、推理和世界知识等任务,官方表示该模型与正式版 DeepSeek-V4-Flash 处于同一水平。公开 AutomationBench 得分为 25.7,与 7 月底公测的 V4-Flash(25.1)接近。
差异主要体现在视觉理解上。官方称,在需要视觉理解的 Agent 基准测试中,V4-Flash-Vision-Exp 相比 V4-Flash 实现了显著跨越,多模态 Agent 能力已接近 Opus-4.8 的水平。
官方同时说明了测试条件:公开基准中的 Code Agent 文本任务使用 DeepSeek Harness minimal 模式作为框架,采用 max 努力等级、topp=0.95、temperature=1.0;在 ApexBench 和 Agents' Last Exam 评测中,文本模型 V4-Flash 会忽略其中的多模态元素。
为什么值得关注
DeepSeek 以实验模型形式补齐 V4 系列的视觉短板,若多模态 Agent 能力如官方所述接近头部闭源模型,将加剧多模态 API 市场竞争。