DeepSeek V4 Pro 正式发布:智能体基准大幅提升,同步开源 Harness 框架
据 Memeburn 报道,DeepSeek 将 1.6 万亿参数旗舰模型 V4 Pro 0813 结束预览转为正式可用,智能体基准较 4 月预览版显著提升,DeepSWE 从 12.8 升至 62.7。模型权重以 MIT 许可开源,配套开源智能体框架 Harness 发布数小时获超 2.3 万星。官方同时上调了 API 价格。
据科技媒体 Memeburn 报道,DeepSeek 正式发布 V4 Pro 0813,结束自 4 月开始的测试期。模型现可通过 DeepSeek 应用与网站的 Expert Mode 以及 API 使用,沿用原有模型名称,并发布了面向开发者的迁移文档。
报道指出,此次发布背景颇为微妙:更便宜的 V4-Flash 此前在多个智能体基准上意外超越了 V4 Pro 的 4 月预览版。官方版本旨在弥补这一差距。DeepSeek 公布的数据显示,Terminal-Bench 2.1 从 72.1 升至 87.9,CyberGym 从 52.7 升至 83.3,DeepSWE 从 12.8 跃升至 62.7。公司称架构未变,提升全部来自改进的后训练。
Memeburn 提醒,这些分数均为厂商自报,截至发稿尚无第三方独立复现,benchable.ai 上第三方结果一栏仍为空,应视为竞争力证据而非确认排名。
开发者层面的实用升级包括:原生支持 OpenAI Responses API 格式并内置 Codex 集成,提供一键配置脚本;V4 Pro 与 V4 Flash 均支持低、高、最高三档思考强度;上下文窗口达 100 万 token,最大输出 38.4 万 token,支持思考与非思考两种模式;已可接入 OpenCode Go、Cline、Kilo Code 等编码工具。
同期开源的 Harness 是一个插件优先的智能体框架,定位为模型与开发环境之间的工程层,负责规划、工具调用、文件读写、终端执行与测试反馈,发布数小时内在 GitHub 获得超过 2.3 万星。模型权重以 MIT 许可发布。报道还提到官方 API 价格有明显上调。
为什么值得关注
开源旗舰在智能体能力上逼近闭源前沿,配合 Harness 框架形成完整开源栈,对开发者生态影响显著,但分数待独立验证。