小岛AI
| ONLINE |

posts/deepseek-v4-pro-0813-ga.md

DeepSeek V4 Pro 正式上线,先锁版本再看跑分

小岛AI 2026 / 08 / 13

今天上午,DeepSeek 没发新博客,官方更新日志也没有多出一行。

但它的模型与价格页里,有个格子悄悄变了。

deepseek-v4-pro 对应的实际版本,已经写成 DeepSeek-V4-Pro-0813

OpenRouter 同步上线了这个快照,并直接把它标成 DeepSeek V4 Pro 的 GA 正式版。页面显示请求由 DeepSeek 单一供应商直接承接,不是拿别家的模型套了个名字。

好家伙,等了几个月的 V4 Pro 正式版,就这么静悄悄地来了。

没有发布会,没有铺天盖地的跑分海报。甚至截至我核对时,DeepSeek 的官方 changelog还停在 7 月 31 日,结尾仍然写着 V4 Pro 正式版稍后推出。

所以这篇不准备再抄一遍通稿。眼下根本没有一份新的官方 0813 跑分表可抄,硬写谁碾压谁,多少有点替官方做梦。

我更想聊一个容易被热闹盖住的问题。

API 一行没改,生产环境里的模型已经换了。

这件事,比榜单上的小数点更值得工程团队现在就处理。

正式版来了,调用方式却像什么都没发生

4 月 24 日,DeepSeek 发布的是 V4 预览版。当时已经给出 Pro 和 Flash 两个型号,Pro 是 1.6T 总参数、49B 激活参数的旗舰版本,Flash 更轻、更快,也更便宜。

DeepSeek V4 Pro 与 Flash 的官方规格对比

DeepSeek V4 Pro 与 Flash 的官方规格对比

7 月 31 日,V4 Flash 先完成了正式版更新。现在轮到 Pro,快照号是 0813。

真正有意思的地方在调用层。

你不需要把 model 从旧名字改成新名字。代码里继续写 deepseek-v4-probase_url 继续用原来的地址,请求就会落到 0813。

对个人开发者,这当然很舒服。配置不用迁,SDK 不用升,连环境变量都懒得动一下。

对生产系统,舒服里藏着一根小刺。

昨天和今天发送完全相同的 prompt,使用完全相同的模型名,背后的权重和后训练版本却可能不同。输出质量变好是变化,工具参数多了一个字段、JSON 偶尔换种写法、推理时延抖了一下,同样是变化。

很多 Agent 的故障并不会优雅地告诉你「模型升级导致」。它只会在日志里留下一串很没礼貌的东西。

tool schema mismatch

max retries exceeded

invalid json

然后值班的人开始查 SDK、查网络、查刚合进去的三行代码,查到午饭凉了,顺着日志排到头才发现上游模型已经换过一轮。

这事儿我太熟悉了。给 AI 搭脚手架,最怕的不是模型会变,模型当然会变。怕的是系统把变化伪装成没变化

别名很好用,但别名不是版本。

1M 上下文还在,正式版真正补齐的是 Agent 入口

先把目前能确认的东西压缩一下。

按 DeepSeek 当前官方页面,V4 Pro 0813 支持 1M 上下文,最大输出 384K,同时支持思考和非思考模式。JSON 输出、工具调用、Responses API、Anthropic API 都已经打勾。

DeepSeek V4 官方长上下文计算量与 KV 缓存对比

V4 系列在长序列下的单 token 计算量与 KV 缓存占用

价格眼下是每百万 token 缓存命中输入 0.003625 美元,缓存未命中输入 0.435 美元,输出 0.87 美元,并发上限 500。

数字确实有点子牛逼,尤其是缓存命中价。不过先别急着按当前单价把未来一年的预算表填满。官方已经在同一页写明,近期计划上调 API 整体价格,而且预期涨幅显著,具体方案另行通知。

便宜是真的,价格还没定型也是真的。

比价格更值得 Agent 开发者注意的,是 DeepSeek 已经把 V4 Pro 放进完整的工具链入口。

它的 Codex 接入文档现在同时包含 deepseek-v4-flashdeepseek-v4-pro。Codex CLI、桌面端和 VS Code 扩展共用一份配置,底层走 DeepSeek 原生支持的 Responses API。

这不是多挂一个聊天窗口那么简单。

Responses API 面向的是会调用工具、会改文件、会在仓库里连续工作很多轮的 Agent。模型一旦进入这里,评估对象就不能只剩一道算法题答对没有。

你得看它能不能稳定选对工具,补丁能不能套上,命令失败后会不会恢复,长任务跑到第 20 步还能不能记得最初的约束。模型能力只占一半,另一半是 harness,也就是让模型真正干活的那层脚手架。

7 月 31 日的 V4 Flash 公告其实已经给过提示。DeepSeek 当时列出的 Agent 跑分,是在自家的 minimal harness 和 max 推理强度下测的。模型、推理档位、工具协议、重试策略绑在一起,共同决定了那个数字。

所以眼下拿 V4 Pro 0813 跑一次通用聊天测试,然后宣布它已经替代 Claude Code,我觉得太早了。

不是说它不行,而是测试对象都没对齐。

同一辆发动机,装在自行车和四驱车上,百公里成绩没有可比性。AI 圈现在经常只拍发动机铭牌,剩下的车架、轮胎和司机,假装不存在。

生产环境现在该补的,是模型发布工程

如果你的应用只是自己聊天,今天直接用起来就行。不好用就切回 Flash,没什么心理负担。

如果 deepseek-v4-pro 已经接进客服、代码审查、数据分析或自动化 Agent,我建议把它当成一次正式依赖升级,而不是一次无感知的云服务维护。

最小动作,是把实际模型快照写进每次评测和发布记录。

{
  "provider": "deepseek",
  "model_alias": "deepseek-v4-pro",
  "resolved_version": "DeepSeek-V4-Pro-0813",
  "verified_at": "2026-08-13T03:15:00Z",
  "prompt_hash": "...",
  "harness_version": "..."
}

API 如果没有在响应里返回快照号,也至少要记录你最近一次从官方模型页核对到的版本和时间。以后质量曲线突然拐弯,团队还有一根线可以往回追。

接着把黄金集重跑一遍。

黄金集不需要很宏大,就是你线上最怕出错的几十到几百个真实任务,去掉敏感信息后固定下来。工具调用成功率、结构化输出解析率、任务完成率、平均 token、首 token 延迟和总耗时,一起看。

别只比答案分数。

一个代码 Agent 的正确率涨了 3%,但平均多跑 6 轮工具、输出 token 翻倍,最终账单和排队时间可能更难看。一个客服 Agent 文风更自然,却开始偶尔漏掉退款政策里的限制条件,也不能叫升级成功。

然后做小流量 canary,也就是先让极少量真实请求走新模型,观察稳定后再扩大。模型供应商替你把别名切了,你自己的路由层仍然可以保留开关。真出问题时,能不能在几分钟内切到 Flash 或其他供应商,比群里讨论哪个模型更聪明实用得多。

再加一道成本闸门。

官方已经提前说要涨价,那就别等账单跳起来才开会。把每个成功任务的平均输入、输出、缓存命中率和重试次数记下来,按当前价格和涨价情景各算一遍。模型便宜不便宜,不是看价目表的一行数字,要看完成一个真实任务花多少钱。

这一套听起来没跑分刺激,甚至有点像给浪漫的新模型办入职手续。

但生产环境就是这样。简历再漂亮,门禁卡、工位权限、试用期目标和回滚预案,一个都不能少。

我自己的判断是,DeepSeek V4 Pro 0813 真正有杀伤力的地方,不是某张榜单暂时高过谁,而是它把 1M 上下文、原生工具协议、Codex 接入和极低 token 单价装进了同一个可用入口。

这会让很多团队认真考虑把它放进 Agent 的主力路由。

也正因为它足够便宜、足够顺手,版本治理才更不能省。

今天那个悄悄变化的表格单元格,很可能会成为不少生产日志里的一条分界线。分界线之前和之后,代码里的模型名完全相同。

模型发布已经结束了。

你自己的发布,才刚开始。