DeepSeek V4 Pro 正式版上线,两个被四舍五入掉的前提
8 月 13 日,DeepSeek 把 V4 Pro 从预览版推进到正式版,同时公布了一张对比表和一份新价格。

8 月 13 日,DeepSeek 把 V4 Pro 从预览版推进到正式版,同时公布了一张对比表和一份新价格。
表里最扎眼的是两个数字:Terminal-Bench 2.1 上,DeepSeek-V4-Pro-0813 拿到 87.9,最右边那一列写着「Claude Fable 5(w/ fallback)」,88.0。只差 0.1 分,而输出价格是后者的五十七分之一。
这两个数字都值得看,只是各自都少说了一个前提。这篇分两半:前半篇讲这次上线里能立刻动手试的东西,后半篇讲那 0.1 分和那 57 倍分别是怎么来的。
DeepSeek 官方公告确认 V4 Pro 正式版于 2026 年 8 月 13 日在 App、网页端和 API 同步上线
0813 这一版换了什么
新版本编号 DeepSeek-V4-Pro-0813,App、网页端和 API 三端同步。网页端要选「专家模式」,API 仍然调用 deepseek-v4-pro。
GA 在这里指 4 月的预览版进入正式服务。开发者不用改模型名,原来的请求会直接落到 0813 上。接入很省事,代价是线上应用会在没有任何代码变更的情况下换掉模型。
成绩涨得很猛。Terminal-Bench 2.1 从预览版的 72.1 涨到 87.9,DeepSWE 从 12.8 涨到 62.7。后者接近五倍,预览版在这项上本来就低得不太正常,正式版补上的更像是工程完成度,而不只是模型能力。
这里有个容易被忽略的细节。很多团队的调用日志里只记了 deepseek-v4-pro 这个名字,以后回看一次失败的调用,很难一眼判断它跑的是预览版还是 0813。至少在这次切换前后,把日期、思考强度和采样参数一起写进日志,后面出现效果波动时才有东西可查。同一个模型名下换掉权重,排查成本是落在使用方这边的。
原生 Responses API 和三档思考强度
比跑分更值得马上动手的是接口这一层。DeepSeek API 现已原生支持 OpenAI Responses API 格式,并针对 Codex 做了适配,还提供一键配置脚本。V4-Pro 和 V4-Flash 的思考模式也开放了三档:low 给简单任务,high 给日常 Agent 任务,max 给高度复杂任务。
已经接入 Responses API 的 Agent 工具,改后端配置就能换过来试。以前接 DeepSeek,经常要在几种消息格式之间自己加一层转换,原生支持能省掉这部分适配。正在跑 Codex 工作流的团队,用现有任务做一轮替换测试的成本不高。
不过接口兼容只解决「接得上」。工具调用能不能稳定跑完是另一回事,尤其是 Agent 连续调用终端、读文件、提交补丁的时候,一次参数理解偏差会在后面的步骤里不断放大。
三档强度也不适合只看谁分数高。简单任务开到 max 反复琢磨,响应时间和 token 消耗都会跟着上去;日常任务压到 low,省下的钱可能还不够补一次返工。合理的做法是挑一批跑过的旧任务,三档各跑一遍,看完成率和耗时的实际分布,再定每类任务的默认档位。这比凭感觉设一个全局值可靠得多,也是这次上线里最容易在一两天内做完的事。
需要提前算一笔账的是,这种复测本身就在烧 token。一次 Agent 任务会反复读取仓库内容,工具调用失败还要重试,缓存和并发很快堆起来。而这笔账的单价,三天后就要变。
88.0 那一列不是 Fable 5 的
回到那张对比表。DeepSeek 把「Fable 5(w/ fallback)」放在最右边,Terminal-Bench 2.1 得分 88.0。
Anthropic 的系统卡里,88.0 记在 Claude Mythos 5 名下,Fable 5 的成绩是 84.3,两款模型在汇总表里各占一列。
Fable 5 那次测试还有一个前提:20.9% 的轨迹触发了安全拒答,后半程改由 Opus 4.8 接着做。所以 84.3 测的是带安全路由的线上产品,Mythos 5 的 88.0 测的是模型本身,两者面向的场景也不同。DeepSeek 没有说明它为什么把 88.0 写在 Fable 5 名下。
评测框架也没有统一。DeepSeek 用自家 Harness 极简模式,推理强度开到 max,top_p=0.95,temperature=1.0。Anthropic 用的是 mini-SWE-agent,89 个任务各跑五次,共 445 次,运行环境和超时限制都写在系统卡里。系统卡还提到,换掉旧 harness 之后超时变少,分数也稳定了不少。
这句话本身就说明了问题:模型没变,只改超时和重试方式,Agent 跑分就能差出几分。现在两边连整套 harness 都不一样,那 0.1 分已经没法说明谁更强。
这类测试测的本来也不只是模型会不会写代码。Agent 要先读懂仓库,决定运行哪条命令,还得在测试超时之后判断是继续等、缩小范围,还是换一种修法。同一个模型若在某套框架里更容易恢复现场,最终完成率就会好看一些。把框架带来的差异压进一位小数,读者看到的精确度远高于这次比较真正能提供的精确度。
V4 Pro 用自家框架跑到 87.9,成绩够强,进候选名单很正常。「已经追平 Fable」这句话,要等同一套 harness 下的复测才能说。
DeepSeek 把 V4-Pro-0813 的 Terminal-Bench 2.1 成绩列为 87.9,最右侧的「Fable 5(w/ fallback)」列为 88.0
8 月 17 日零点之后,成本换一套算法
另一个数字是价格。V4 Pro 每百万输出 token 为 0.87 美元,Fable 5 是 50 美元,后者约是前者的 57 倍。这个倍数成立,但有效期只到本周一。
北京时间 8 月 17 日零点,DeepSeek 启用新价格,并且改成峰谷计价。V4 Pro 每百万输出 token 从 6 元涨到闲时 13.5 元、高峰 27 元。缓存未命中输入由 3 元变成 4.5 元或 9 元。缓存命中涨得最狠,从 0.025 元变成 0.15 元或 0.30 元,是原价的 6 倍和 12 倍。
按国际站价格算,V4 Pro 输出闲时约 1.98 美元,高峰约 3.96 美元。Fable 5 仍然贵得多,但价差会从 57 倍缩到约 25 倍或 13 倍。
换成人民币更直观。同样生成 1000 万输出 token,旧价是 60 元,新价闲时 135 元,高峰 270 元。单次任务看不出多少,持续跑代码审查、仓库扫描或内部 Agent 之后,差额会慢慢显出来。DeepSeek 依然便宜,只是以后讨论成本时得顺手问一句:这个数字按哪个时段算。
DeepSeek 新价格将于北京时间 2026 年 8 月 17 日零点生效,高峰时段是 9 点至 12 点、14 点至 18 点
缓存命中那一列最值得盯。Agent 会反复携带仓库上下文,也要读取前几轮的工具结果,长期任务很吃缓存。高峰时段的缓存价直接变成原来的 12 倍,近乎免费的缓存到此为止。
偶尔聊天花不了多少钱。团队每天跑几百个代码任务,账单会直接受运行时间影响。夜间批量跑一批,成本只有高峰期的一半;需要开发者在线盯着的修复任务,就省不了这笔钱。DeepSeek 划出的高峰期一天共 7 小时,正好盖住国内团队常用的工作时段。代码扫描可以挪到其余 17 小时,报表也能晚点生成,白天处理仓库问题还是得按高峰价算。
顺便说,前面提到的那轮三档强度复测,现在做和下周做,单价差着一倍多。
值得试,但别照着表格下结论
这次上线可以拆成两句话。
能立刻动手的是接口那一层:原生 Responses API 少了一层格式转换,三档思考强度给了成本和效果之间的调节旋钮。这两样不依赖任何跑分,用自己的旧任务跑一轮就能看出值不值。
不适合照单全收的是那两个数字。88.0 是 Mythos 5 在 mini-SWE-agent 下的成绩,不是 Fable 5 的;87.9 是 DeepSeek 在自家 Harness 下的成绩。两个前提不一样,中间那 0.1 分不成立。57 倍这个价差是真的,但它属于 8 月 17 日零点之前。
判断标准其实只有一条:这些数字里,有哪一个是在你自己的任务、你自己的 harness、你自己的用量结构下测出来的。没有的话,它就只是别人的实验条件。