开发者Club开发者Club
资讯AI 资讯

DeepSeek V4 Pro 正式版上线,两个被四舍五入掉的前提

8 月 13 日,DeepSeek 把 V4 Pro 从预览版推进到正式版,同时公布了一张对比表和一份新价格。

开发者Club
DeepSeek V4 ProTerminal-BenchClaude Fable 5API 涨价Responses API
阅读 收藏

封面

8 月 13 日,DeepSeek 把 V4 Pro 从预览版推进到正式版,同时公布了一张对比表和一份新价格。

表里最扎眼的是两个数字:Terminal-Bench 2.1 上,DeepSeek-V4-Pro-0813 拿到 87.9,最右边那一列写着「Claude Fable 5(w/ fallback)」,88.0。只差 0.1 分,而输出价格是后者的五十七分之一。

这两个数字都值得看,只是各自都少说了一个前提。这篇分两半:前半篇讲这次上线里能立刻动手试的东西,后半篇讲那 0.1 分和那 57 倍分别是怎么来的。

DeepSeek V4 Pro 正式版官方发布页面 DeepSeek 官方公告确认 V4 Pro 正式版于 2026 年 8 月 13 日在 App、网页端和 API 同步上线

0813 这一版换了什么

新版本编号 DeepSeek-V4-Pro-0813,App、网页端和 API 三端同步。网页端要选「专家模式」,API 仍然调用 deepseek-v4-pro

GA 在这里指 4 月的预览版进入正式服务。开发者不用改模型名,原来的请求会直接落到 0813 上。接入很省事,代价是线上应用会在没有任何代码变更的情况下换掉模型。

成绩涨得很猛。Terminal-Bench 2.1 从预览版的 72.1 涨到 87.9,DeepSWE 从 12.8 涨到 62.7。后者接近五倍,预览版在这项上本来就低得不太正常,正式版补上的更像是工程完成度,而不只是模型能力。

这里有个容易被忽略的细节。很多团队的调用日志里只记了 deepseek-v4-pro 这个名字,以后回看一次失败的调用,很难一眼判断它跑的是预览版还是 0813。至少在这次切换前后,把日期、思考强度和采样参数一起写进日志,后面出现效果波动时才有东西可查。同一个模型名下换掉权重,排查成本是落在使用方这边的。

原生 Responses API 和三档思考强度

比跑分更值得马上动手的是接口这一层。DeepSeek API 现已原生支持 OpenAI Responses API 格式,并针对 Codex 做了适配,还提供一键配置脚本。V4-Pro 和 V4-Flash 的思考模式也开放了三档:low 给简单任务,high 给日常 Agent 任务,max 给高度复杂任务。

已经接入 Responses API 的 Agent 工具,改后端配置就能换过来试。以前接 DeepSeek,经常要在几种消息格式之间自己加一层转换,原生支持能省掉这部分适配。正在跑 Codex 工作流的团队,用现有任务做一轮替换测试的成本不高。

不过接口兼容只解决「接得上」。工具调用能不能稳定跑完是另一回事,尤其是 Agent 连续调用终端、读文件、提交补丁的时候,一次参数理解偏差会在后面的步骤里不断放大。

三档强度也不适合只看谁分数高。简单任务开到 max 反复琢磨,响应时间和 token 消耗都会跟着上去;日常任务压到 low,省下的钱可能还不够补一次返工。合理的做法是挑一批跑过的旧任务,三档各跑一遍,看完成率和耗时的实际分布,再定每类任务的默认档位。这比凭感觉设一个全局值可靠得多,也是这次上线里最容易在一两天内做完的事。

需要提前算一笔账的是,这种复测本身就在烧 token。一次 Agent 任务会反复读取仓库内容,工具调用失败还要重试,缓存和并发很快堆起来。而这笔账的单价,三天后就要变。

88.0 那一列不是 Fable 5 的

回到那张对比表。DeepSeek 把「Fable 5(w/ fallback)」放在最右边,Terminal-Bench 2.1 得分 88.0。

Anthropic 的系统卡里,88.0 记在 Claude Mythos 5 名下,Fable 5 的成绩是 84.3,两款模型在汇总表里各占一列。

Fable 5 那次测试还有一个前提:20.9% 的轨迹触发了安全拒答,后半程改由 Opus 4.8 接着做。所以 84.3 测的是带安全路由的线上产品,Mythos 5 的 88.0 测的是模型本身,两者面向的场景也不同。DeepSeek 没有说明它为什么把 88.0 写在 Fable 5 名下。

评测框架也没有统一。DeepSeek 用自家 Harness 极简模式,推理强度开到 max,top_p=0.95temperature=1.0。Anthropic 用的是 mini-SWE-agent,89 个任务各跑五次,共 445 次,运行环境和超时限制都写在系统卡里。系统卡还提到,换掉旧 harness 之后超时变少,分数也稳定了不少。

这句话本身就说明了问题:模型没变,只改超时和重试方式,Agent 跑分就能差出几分。现在两边连整套 harness 都不一样,那 0.1 分已经没法说明谁更强。

这类测试测的本来也不只是模型会不会写代码。Agent 要先读懂仓库,决定运行哪条命令,还得在测试超时之后判断是继续等、缩小范围,还是换一种修法。同一个模型若在某套框架里更容易恢复现场,最终完成率就会好看一些。把框架带来的差异压进一位小数,读者看到的精确度远高于这次比较真正能提供的精确度。

V4 Pro 用自家框架跑到 87.9,成绩够强,进候选名单很正常。「已经追平 Fable」这句话,要等同一套 harness 下的复测才能说。

DeepSeek 官方公布的 Agent 基准对比表 DeepSeek 把 V4-Pro-0813 的 Terminal-Bench 2.1 成绩列为 87.9,最右侧的「Fable 5(w/ fallback)」列为 88.0

8 月 17 日零点之后,成本换一套算法

另一个数字是价格。V4 Pro 每百万输出 token 为 0.87 美元,Fable 5 是 50 美元,后者约是前者的 57 倍。这个倍数成立,但有效期只到本周一。

北京时间 8 月 17 日零点,DeepSeek 启用新价格,并且改成峰谷计价。V4 Pro 每百万输出 token 从 6 元涨到闲时 13.5 元、高峰 27 元。缓存未命中输入由 3 元变成 4.5 元或 9 元。缓存命中涨得最狠,从 0.025 元变成 0.15 元或 0.30 元,是原价的 6 倍和 12 倍。

按国际站价格算,V4 Pro 输出闲时约 1.98 美元,高峰约 3.96 美元。Fable 5 仍然贵得多,但价差会从 57 倍缩到约 25 倍或 13 倍。

换成人民币更直观。同样生成 1000 万输出 token,旧价是 60 元,新价闲时 135 元,高峰 270 元。单次任务看不出多少,持续跑代码审查、仓库扫描或内部 Agent 之后,差额会慢慢显出来。DeepSeek 依然便宜,只是以后讨论成本时得顺手问一句:这个数字按哪个时段算。

DeepSeek V4 API 新定价表 DeepSeek 新价格将于北京时间 2026 年 8 月 17 日零点生效,高峰时段是 9 点至 12 点、14 点至 18 点

缓存命中那一列最值得盯。Agent 会反复携带仓库上下文,也要读取前几轮的工具结果,长期任务很吃缓存。高峰时段的缓存价直接变成原来的 12 倍,近乎免费的缓存到此为止。

偶尔聊天花不了多少钱。团队每天跑几百个代码任务,账单会直接受运行时间影响。夜间批量跑一批,成本只有高峰期的一半;需要开发者在线盯着的修复任务,就省不了这笔钱。DeepSeek 划出的高峰期一天共 7 小时,正好盖住国内团队常用的工作时段。代码扫描可以挪到其余 17 小时,报表也能晚点生成,白天处理仓库问题还是得按高峰价算。

顺便说,前面提到的那轮三档强度复测,现在做和下周做,单价差着一倍多。

值得试,但别照着表格下结论

这次上线可以拆成两句话。

能立刻动手的是接口那一层:原生 Responses API 少了一层格式转换,三档思考强度给了成本和效果之间的调节旋钮。这两样不依赖任何跑分,用自己的旧任务跑一轮就能看出值不值。

不适合照单全收的是那两个数字。88.0 是 Mythos 5 在 mini-SWE-agent 下的成绩,不是 Fable 5 的;87.9 是 DeepSeek 在自家 Harness 下的成绩。两个前提不一样,中间那 0.1 分不成立。57 倍这个价差是真的,但它属于 8 月 17 日零点之前。

判断标准其实只有一条:这些数字里,有哪一个是在你自己的任务、你自己的 harness、你自己的用量结构下测出来的。没有的话,它就只是别人的实验条件。

资料来源

评论

登录后即可发表评论

登录账户

加载评论中...