DeepSeek 82.7 分,模型榜单该换算法了

小岛AI 2026 / 07 / 31

82.7。

今天 DeepSeek-V4-Flash 正式版 API 开始公测,这个数字很容易抢走全部注意力。它来自 Terminal Bench 2.1,一个让模型在真实终端里改代码、装依赖、跑命令、处理多步任务的 Agent 基准。

好家伙,一个主打便宜和速度的 Flash,成绩直接冲到了前沿梯队。官方还说,它在多项 Agent 基准上远超 V4-Pro 预览版。

如果只看到这里,文章大概已经可以收工了。参数表贴一遍,跑分排一排,再写一句国产模型又追上来了,齐活。

DeepSeek 的更新日志 里,还有两行更有意思的话。

第一行,DeepSeek-V4-Flash-0731 跟预览版采用相同的模型架构和规模,本次只重新做了后训练。

第二行,公开代码 Agent 基准使用的是 DeepSeek Harness minimal mode,推理强度开到 max,top_p 设为 0.95,temperature 设为 1.0。更关键的是,这套 Harness 还没发布。

我看到这里,注意力就从 82.7 挪到了脚注。

因为这次真正值得聊的,可能不是一个模型又涨了多少分,而是我们已经很难把「模型能力」和「围绕模型搭的运行系统」分开算了。

很多朋友可能不熟悉 Harness。用人话讲,它就是给模型搭的脚手架,让模型不只在聊天框里回答,而是能看文件、调工具、执行命令、接住报错、重试、继续往前跑。

同一个底座模型,换一套系统提示词,换一种工具描述,换一个上下文压缩策略,是否允许并行调用,失败后重试几次,什么时候让它停下来检查,最后出来的效果可以差得很离谱。

模型像发动机,Harness 是变速箱、底盘、仪表盘和维修手册。拿裸发动机马力去预测整车圈速,本来就有点悬。Agent 基准却经常把整车跑出来的成绩,全部记在发动机名字下面。

厉害了,营销上省事,工程上埋雷。

4 月的 V4 预览版公告 还说,Flash 在简单 Agent 任务上跟 Pro 旗鼓相当,到了困难任务就会拉开差距。三个多月后,模型架构和规模没换,正式版却在 Terminal Bench 2.1 拿到 82.7,还被描述为远超 Pro 预览版。

这里至少有三股力量叠在一起。

一股是重新后训练。预训练更像让模型读完世界上的书,后训练则是在教它怎么做事。面对终端任务,知道 Linux 命令只是起点,真正难的是看懂当前状态,选择下一步工具,发现方向错了再回滚,把一个半小时的长链条走完。

另一股是推理预算。官方把 reasoning_effort 开到 max,等于允许模型在困难任务上花更多推理 token 和时间。分数高了当然是能力,但延迟和成本也会一起进账。只抄 82.7,不抄 max,多少有点像看赛车圈速时把比赛胎和油耗那一栏裁掉。

还有一股就是 Harness。DeepSeek 暂时只告诉我们用了 minimal mode,没有公开它的提示词、工具协议、重试逻辑、上下文管理和停止条件。坦率讲,在这些细节补齐之前,外部团队很难做严格复现。

这不是在说成绩不可信。官方已经把测试条件写进脚注,比只甩一张榜单强得多。只是 82.7 应该被读成「DeepSeek-V4-Flash 正式版加 DeepSeek Harness 加 max effort 的系统成绩」,不是一块可以从系统里拔出来单独比较的模型奖牌。

DeepSeek-V4-Flash 正式版 Agent 基准成绩

图|官方公布的九项 Agent 基准成绩,其中两项为内部测试集

Agent 跑分最麻烦的地方,也正在这里。

传统问答基准像一张卷子,输入相对固定,答案也相对固定。终端 Agent 更像让不同选手进一间凌乱机房。有人拿到的工具说明更清楚,有人失败后允许重试,有人能保留更长的操作历史,还有人背后站着一个会提醒它先跑测试的教练。

哪怕任务集完全相同,环境镜像、工具调用格式、超时阈值、上下文裁剪和评分器版本都可能改掉结果。温度设为 1.0 后,同一任务重复跑几次也可能出现不同轨迹。官方这次没有在更新页披露每个任务的 token 消耗、重复次数和方差,我们自然不能拿一个总分反推出生产稳定性。

另外两个成绩 DSBench-FullStack 和 DSBench-Hard 来自内部测试集。内部集不是原罪,公开榜单被训练数据污染以后,厂商本来就需要保留没曝光的题。但外部读者也只能把它们当厂商自测信号,不能当可独立复核的公共尺子。

我一直觉得,成熟的榜单不该只给一列分数。它还该把 Harness 版本、推理预算、每题平均成本、运行次数和置信区间一起摆出来。缺了这些,模型相差两三分时,我们根本不知道是能力差距,还是抽样抖动。

更有意思的变化藏在接口里。

正式版 V4-Flash 原生支持 Responses API,并且专门适配了 Codex。换个 base_url 和模型配置,Codex CLI、桌面端和 VS Code 扩展就能把 DeepSeek 当成模型提供方。

这个动作看着像兼容接口,实际是在抢 Agent 运行时的入口。

过去模型厂商希望开发者用自家的聊天框。现在更现实了,开发者已经在 Codex、Claude Code、OpenCode 这些 Harness 里形成工作习惯,模型得主动钻进现成的工具循环。谁能接住 apply_patch,谁能稳定调用函数,谁能在百万上下文里不把状态弄丢,往往比谁的聊天回答更漂亮更值钱。

不过先别急着把现有工作流一键切过去。

DeepSeek 的兼容文档写得很实在。当前 Responses API 是无状态的,不支持 previous_response_idconversation。函数调用、服务端网页搜索可以用,自定义工具只认 apply_patch。MCP、computer use、图片和文件输入还不支持,部分不支持的参数会被静默忽略。

静默忽略这四个字,做过接口迁移的人应该已经开始皱眉了。

调用没有报错,不代表你以为启用的能力真的生效。原来依赖 MCP 的工具链,换了提供方以后可能退化成普通文本对话。原来靠服务端会话续接的状态,需要客户端自己重新拼上下文。图片输入如果被替换成占位文本,评测还可能跑得挺顺,只是任务早就换了。

棒棒的,最难排查的从来不是红色报错,而是绿色成功里的功能缩水。

所以我自己的判断是,DeepSeek 这次最强的产品信号,并不是「Flash 比 Pro 还强」,而是它开始把模型、协议、Harness 和 Agent 产品一起交付。只升级 API 里的 Flash,不动 App 和 Web 端,也说明这轮能力就是冲着开发者工作流来的。

价格又把这个信号放大了一次。

官方价格页,V4-Flash 每百万 token 的缓存未命中输入是 0.14 美元,输出是 0.28 美元,缓存命中输入低到 0.0028 美元。上下文长度 1M,最大输出 384K,账户默认并发上限 2500。

DeepSeek V4 API 每百万 token 价格对比

图|V4-Flash 的缓存未命中输入与输出价格都约为 V4-Pro 的三分之一

这组价格确实凶。对于要同时跑大量 Agent 任务的团队,便宜模型不只是省预算,还能让你敢于做多次采样、交叉检查和失败重试。

但便宜也会制造一种错觉,token 单价低,任务成本就一定低。

Agent 真正该看的单位不是每百万 token 多少钱,而是完成一个可验收任务要花多少钱。

单次有效任务成本
= 总模型费用
+ 重试费用
+ 超时与失败任务费用
+ 人工检查和返工费用

一个模型单价只有别人的五分之一,如果成功率低,需要跑三次再由人修一遍,它可能一点也不便宜。另一个模型单次贵,但一次交付就通过测试,反而更省。

DeepSeek 还预告了峰谷定价,北京时间每天 9 点到 12 点、14 点到 18 点会按常规价格两倍收费,具体生效时间另行通知。做批处理的团队可以把非紧急任务挪到低谷,在线 Agent 则需要把价格波动写进路由策略。

怎么说呢,模型路由以后可能真要像云计算调度一样,既看能力,也看时间、并发和失败概率。

如果要在自己的项目里判断 V4-Flash 值不值得换,我会把评测拆得朴素一点。

先拿真实仓库里二三十个已经有标准答案的任务,别只用模型见过的公开榜单。任务最好混着放,有单文件修复,也有跨目录重构,有依赖冲突,也有测试不完整的脏活。

然后固定 Harness 跑一轮,再只改模型。接着固定模型,分别调 low、high、max 推理强度。最后再改工具描述、上下文策略和重试次数。

每轮不只记通过率,还要记首轮成功率、总 token、墙钟时间、重试次数、测试覆盖变化,以及人最后改了多少行。

这样你会得到四份账。

模型账告诉你底座差异,Harness 账告诉你脚手架值多少钱,预算账告诉你 max 到底买来了什么,验收账则告诉你这些漂亮数字能不能进生产。

还可以再做一个很土但很有用的交叉实验。

同一批任务跑四组,旧模型配旧 Harness,新模型配旧 Harness,旧模型配新 Harness,新模型配新 Harness。四格结果一摆,你才能大致看出提升来自模型、来自脚手架,还是两者互相放大的组合。

要是只测新模型加新 Harness,然后把全部涨幅写到模型名下,团队很容易买错东西。真正该升级的可能不是 API,而是你那条没有超时、没有重试、测试失败还继续往下跑的执行循环。

这事跟换编译器有点像。程序快了,不一定是 CPU 突然开窍,也可能是编译器终于把那段笨循环优化掉了。用户当然只关心整机更快,工程师却必须知道快从哪里来,因为下一次回归还得靠这个判断排查。

这套方法不酷,甚至有点麻烦。但 Agent 工程很多时候就是这样,发布会上最亮的是模型,真正让系统不翻车的是一堆没人截图转发的超时、重试、沙箱、测试和回滚。

82.7 当然值得兴奋。一个便宜、并发高、原生接进 Codex 的模型,把 Agent 能力顶到这个位置,有点子牛逼。

可它也顺手提醒了我们一件事。

下一轮模型榜单,别再只写模型名了。至少把 Harness、推理强度、工具集、重试策略和成本放在同一行。

不然我们以为自己在选发动机,最后买回来的,其实是别人调好的一整辆赛车。