8月12日深夜,DeepSeek 官网的 API 文档页面悄然完成了一次更新。Pro 模型的版本号更换成了 DeepSeek-V4-Pro-0813。

与此同时,根据第一财经报道的 DeepSeek 官方群消息,官方放出了一组评分数据。表格中显示 DeepSeek V4 Pro 的性能远远超过了预览版,甚至在 Terminal Bench 2.1 这个对 Agent 领域影响极大的测试集上,性能比肩当下最强的模型 Claude Fable 5。

另一方面,在 DeepSWE 测试集上,预览版仅得 12.8 分,基本属于"不会做"的水平;正式版直接飙到 62.7 分,涨幅接近 5 倍。这个测试集是衡量代码 Agent 能力的核心基准。同样翻倍的还有 DSBench-Hard,从 31.1 冲到 67.2;DSBench-FullStack 从 41.8 提升到 71.1。
如此这般的性能提升,将其称之为 DeepSeek V5 Pro 都不为过。
硬件规格上,V4 Pro 延续了 MoE 架构设计,总参数规模 1.6 万亿,每次推理激活约 490 亿参数。接口侧提供 100 万 token 上下文和最高 38.4 万 Token 输出,这两个数字对普通聊天可能意义不大,但对长任务 Agent 却是硬刚需。尤其是大型代码库、长时间运行的日志以及连续工具调用,都会快速吃掉上下文。窗口不够大,Agent 就只能不断压缩记忆,压着压着,前面做过什么也忘了。
调用方式保持不变,模型名仍然是 deepseek-v4-pro,老用户的代码一行不用改,后端就自动切换到了新版本。
价格方面,0813 版每百万 token 缓存未命中输入 3 元、输出 6 元,和预览版时期一致,并没有随模型转正而同步上调。而就在不久前,DeepSeek 官方曾表示价格将要上涨。
DeepSeek V4 引发全球降价
自 DeepSeek V4 发布以后,行业内出现了一个怪现象:几乎所有大厂都在降价。但大背景却是只要跟 AI 相关的,一定都在涨价。最开始是 GPU、内存,现在连硬盘、电,甚至陶瓷都涨了。就好像西红柿涨价、鸡蛋涨价、糖涨价,结果西红柿炒鸡蛋反而比以前更便宜了。
2025 年的时候,DeepSeek R1 虽然引发了"DeepSeek 时刻",可当时由于行业重点在于输出内容的质量,所以 OpenAI、Anthropic 还能用"我们更聪明"来维持溢价。
但现在,今年 7 月 31 日 V4 Flash 正式版上线以后,行业叙事改成了"每任务/单位智能的价格"。DeepSeek V4 Flash 正式版凭借"能力够用+价格便宜两个数量级"形成了一道独有的斩杀线。
根据 Artificial Analysis 的测试,在完成相同水平任务的前提下,DeepSeek V4 Flash 的价格低于市面上 70% 的模型,而那些处于这 70% 分水岭内的模型,称之为被 DeepSeek"斩杀"。落在斩杀线上的竞品,只剩两条出路:要么主动大幅下调定价,要么干脆放弃普惠开发者市场,收缩到预算充足的高端企业客户。
于是各家厂商的处境变得很微妙。短期内没办法提高智能水平,又舍不得开发者市场,降价就成了唯一能立刻执行的防御手段。
OpenAI 是最典型的例子。GPT-5.6 Luna 7 月 9 日才上线,7 月 30 日就宣布降价 80%,输入价从每百万 token 1 美元砍到 0.2 美元,输出价从 6 美元砍到 1.2 美元。一款刚发布的新旗舰,上市不到一个月就打两折,这也是无可奈何的事情。
OpenAI 在降价当天同步发了一篇技术博客,称 GPT-5.6 Sol 自己重写并优化了部分生产推理内核,把端到端模型服务成本压低了约 20%,token 生成效率提升了 15% 以上。这就使得它能把省下来的钱,直接变成给用户的降价补贴。换句话说,OpenAI 这波降价,是被自己模型写代码省下的成本托起来的。
不过成本降低 20% 和提升 15% 生成效率这两个数字,似乎跟降价 80% 匹配不上。根据 OpenAI 的投资人披露,该企业单季营收 57 亿美元,同比增长约 3 倍;经营性亏损 93 亿美元,当期现金消耗(实际烧掉的现金)37 亿美元,相当于每赚 1 美元收入就要烧掉约 0.65 美元现金。当季研发支出高达 86 亿美元,整体毛利率仅 39%。并且市场预测,OpenAI 在 2026 年的全年经营性亏损约为 140 亿美元。
因此,无论 OpenAI 发布的技术报告内容如何,如果没这条斩杀线,这笔效率红利大概率会先进利润表,而不是变成用户账单上的折扣。
Anthropic 也有相似的反应。Claude Opus 5 发布后,其定价改为了 5 美元/25 美元,正好是 Fable 5 的半价。Sonnet 5 首发优惠价 2 美元/10 美元,比标准定价低了三分之一,优惠期一路延到 8 月 31 日。随着 DeepSeek 斩杀线的发酵,Anthropic 在 8 月 10 日宣布,将 Sonnet 5 的优惠价格变为永久价格,再也不恢复成为原价格。
谷歌 7 月 21 日一口气发三款 Gemini Flash 轻量模型,主力款 3.6 Flash 当天宣布输出价永久下调 17%。
国内更是放血式促销。8 月 11 日,智谱把 GLM Coding Plan 全员额度重置回满,再叠 1.5 倍限时加成;火山引擎给 GLM-5.2 开出四倍折扣系数,49 元的套餐能换到五千多万 token;OpenRouter 上 GLM-5.2 的三家供应商互相压价,从 60% 打到 80%,再到 95%。
反直觉,斩杀线其实会越来越低
逃避斩杀线的路有两条:一条往下走,一条往上走。往下走是防御,是承认自己在这个区间和 DeepSeek 没有本质区别,只能拼价格。往上走是进攻,是只要能力足够强、DeepSeek 够不到,就根本不在斩杀线的杀伤范围内。
在 DeepSeek 的斩杀线之上可以继续收溢价,因此,诸如 GPT-5.6 Sol、Kimi K3、Claude Fable 5,这些真正站在金字塔尖的旗舰模型,一个都没降价。
以 Kimi K3 为例,其于 2026 年 7 月 16 日正式上线,本身就发布在 DeepSeek V4 Flash 之后,其 API 定价为:国际版输入 3 美元/百万 token、输出 15 美元/百万 token;国内版输入 20 元/百万 token、输出 100 元/百万 token。对比上一代旗舰 K2.6,K3 国内版的输入价格上涨了 208%,输出价格上涨 270%。
但有个事得提前说明白,如今已经 2026 年过半了。DeepSeek V4 Flash 的总参数量为 284B,这在当下其实是一个非常轻量的模型,它的定位是"高效率地完成大多数任务"。 Artificial Analysis 的智能指数里,V4 Flash 只得了 50 分,明显低于 Kimi K3、GPT-5.6 和 Claude Fable 5。这就使得在复杂推理、长链路任务、多步规划、需要深度领域知识的判断,这些超级硬核的任务上,DeepSeek V4 Flash 的完成率和可靠性,远不如头部模型。斩杀线扫过的是"够用就好"的那片海,在"必须万无一失"的那片土地上,DeepSeek 暂时还过不去。
不过这个斩杀线其实也维持不了多久,因为"推测解码"越来越成为了主流。这也是为什么所有大厂都要研发旗舰模型的同时,开发一款极其便宜的小模型。
所谓推测解码,是指 2022 年时,Google Research 团队的亚尼夫·利维坦(Yaniv Leviathan)、马坦·卡尔曼(Matan Kalman)和约西·马蒂亚斯(Yossi Matias)曾在论文《通过推测解码实现 Transformer 的快速推理》(Fast Inference from Transformers via Speculative Decoding)中提出,用一个小模型快速出草稿,大模型只负责并行验证和修正。草稿命中率一旦稳定在 80% 以上,旗舰模型的有效推理成本就能降到原来的 1/3 到 1/5。
但以前这项技术不太能降低成本,原因在于以前给旗舰模型配草稿,用的是 7B、13B 的通用超小模型,命中率上不去,所以价格就打不下来。可推测解码仍然是业内公认最可行的方向,这才使得大家都备有一款小模型。
现在来看,推测解码逐渐走向成熟。2026 年 6 月 DeepSeek 发布了 DSpark 推测解码模块,并部署到 V4 Flash 和 V4 Pro 的线上流量,在相同吞吐下单用户生成速度提升了 60% 到 85%,这也直接造成了 DeepSeek 的大幅降价。随着 DSpark 的成功,势必会有越来越多的厂商部署推测解码,以实现更快更便宜的效果。
除了推测解码外,还有一个技术也可能会降低模型成本,那就是静态知识剥离。这个技术其实起源更早,它是 Meta AI 的帕特里克·刘易斯(Patrick Lewis)等人在 2020 年论文《面向知识密集型 NLP 任务的检索增强生成》(Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks)中提出的。简单来讲,它就是让模型在思考的过程中,把事实性知识从参数中拆出去,只靠外部检索补充。这样整个思考过程就会更快,成本因此更低,并且由于外部引入知识,还能让输出结果幻觉更少。
不过真正把这个技术发扬光大的依然是 DeepSeek。2026 年 1 月,DeepSeek 联合北大发表论文《通过可扩展查找实现条件记忆》(Conditional Memory via Scalable Lookup)。论文的观点是,语言建模本质上包含两类完全不同的任务,一类是需要深度动态计算的组合推理,另一类是检索静态知识,但 Transformer 把这两件事混在一起做了。于是论文就依照静态知识剥离的逻辑提出了一个叫做 Engram 的技术。
打个比方,在考试的时候,让大模型背下所有公式、历史年份、名人身份、地理常识。然而这就导致大模型只能用一部分的脑容量来解题。背得越多,能用来思考的脑容量就越少。Engram 干的事就是把闭卷考试改成开卷考试。它在模型中间插了一本"速查手册",遇到"戴安娜王妃是谁"、"张仲景是什么朝代的"这种事实性问题,不用现场一层层推导,直接翻手册,一秒查到。
这样,模型的脑容量就可以全部用来做真正需要动脑筋的事,比如解数学题、写代码、做逻辑推理。Engram 一旦成熟,也将大幅减少模型成本。
DeepSeek V4 Pro 真的发布了吗?
随着 DeepSeek V4 Pro 的更新,网上最大的声音便是质疑。因为这次更新和 DeepSeek V4 Flash 正式版的更新方式截然不同,V4 Flash 正式版有完整的官方更新日志,明确标题"DeepSeek-V4-Flash 更新",列出了 9 项基准测试的具体分数。最关键的是,DeepSeek 会注明"模型结构、尺寸和 Preview 保持一致,仅重新进行了后训练"这些细节。

可截止发稿,DeepSeek V4 Pro 正式版相关的发布痕迹也只有三处:官网的"模型 & 价格"页面、官网首页出现一句简短的滚动公告、一张跑分表。甚至就连官方的更新日志,也停留在 DeepSeek V4 Flash 正式版上。
除了这些迹象外,权威评测机构 Artificial Analysis 上线了 V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数为 53 分。相比预览版的 45 分确有提升,和 GLM-5.2 齐平。

但问题在于,53 分这个档位和 Fable 5 差了很远,无法匹配跑分表中的"接近甚至超过 Fable 5"。作为参照,同一天发布的 Grok 4.6 还拿到了 61 分。

不只是 Artificial Analysis,在比较模型数学能力的 Proof Bench 上,作为靠数学能力而声名鹊起的 DeepSeek,其 V4 Pro 正式版甚至连前 10 都没有挤进去。
更有一些个人评测者对 V4 Pro 正式版进行了深度测试,均表示实测效果皆不尽人意。AI 博主牙医就发文表示"刚发的 DeepSeek-V4-Pro-0813 好像的确有问题。reasoning_effort=max 的时候模型在长程 Agentic Coding 任务下更倾向于早停。"
他进一步表示,"我这个测试总计 50 轮,让模型不断优化代码,结果他在 3 次测试中,2 次都在 42-43 轮左右的情况下停止了。并未用完全部机会。而且目前成绩来看,甚至没打过 GLM-5.1(仅我这一个 case,我不对其它 case 负责)。"

以最常见的"鹈鹕测试"为例,提示词为:
Generate an animated looping SVG of a pelican riding a bicycle. Wheels spin, pedals move, pelican's legs pedal correctly, smooth infinite loop, no javascript, use native SVG animateTransform only.
翻译为:生成一个循环动画 SVG:鹈鹕骑自行车。轮子旋转、踏板转动、鹈鹕的腿正确踩踏板,平滑无限循环,不要 JS,只用 SVG 原生 animateTransform 动画。
我将相同的提示词分别发给 DeepSeek V4 Pro 正式版和 Flash 正式版,结果发现,反而 Flash 做的效果远远超过了 V4 Pro,无论是鹈鹕的动作还是背景中的云彩,V4 Flash 正式版均比 Pro 正式版更好。
0813 这个版本号本身可能只是一个"占位符"。换句话说,DeepSeek 可能并没有直接上线新模型,或者是有意去压制新模型的能力,先把坑占上了,等后续做好准备再上线,这样就不用担心一瞬间超高并发挤爆服务器了。
此前,DeepSeek Harness 负责人崔添翼曾透露,DeepSeek V4 Pro 的正式版将和 DeepSeek Harness 同时上线。而 8 月 13 日这天,是 DeepSeek Harness 的最后一次测试。在 DeepSeek Harness 内测群中就有这样一条消息,0813 版本计划发布 DeepSeek Harness 的公测版。

目前看来该 Harness 产品还未发布,并且 DeepSeek V4 Flash 之前的测试中,就有很多成绩是 DeepSeek Harness 上跑出来的。那么结合官方群里的跑分表,尤其是在 Terminal Bench 这样的测试集上,使用的可能就是传说中的 DeepSeek Harness。
模型的斩杀线会下降,但 DeepSeek Harness 可能会带来新的斩杀线。
2026 年 5 月,DeepSeek Harness 内部立项,独立组建专项核心团队,由崔添翼负责。8 月 2 日,崔添翼面向全球公开征集 Harness 内测用户,优先筛选具备 Agent Harness 开源项目经验的开发者。8 月 11 日,"DeepSeek Harness 团队"微信公众号完成注册,认证主体是深度求索北京分公司。
在 V4 Flash 正式版的 API 文档中有这么一段内容,对于公开基准测试中的 Code Agent 任务,正式版用的是 DeepSeek Harness 极简模式作为框架进行测试。也就是说,V4 Flash 能拿下 Terminal Bench 2.1 的 82.7 分,严格来说是"DeepSeek 模型 + DeepSeek Harness 测试框架"的组合成绩,不是纯模型裸分。
V4 Flash 预览版在 Terminal Bench 2.1 上是 61.8 分,同期 V4 Pro 预览版是 72.1 分。显然,DeepSeek Harness 在 Agent 任务上,给 DeepSeek 模型带来了质的飞跃。
82.7 分其实是一个非常高的分数。Terminal Bench 2.1 目前的 SOTA 是 GPT-5.6 Sol 的 88.8 分,Kimi K3 是 88.3 分,Claude Opus 5 是 84.3 分,所有参评模型的平均分是 77.3 分。
正如前文提到的,V4 Flash 是一个轻量模型,和 Fable 5、GPT-5.6 Sol 对比的应该是旗舰模型 V4 Pro。那么可想而知,一旦 DeepSeek Harness 和 V4 Pro 正式版上线,势必会迎来一个新的斩杀档位。
更值得注意的是,国内玩家已经全部挤进了这条赛道。 除了 DeepSeek 外,智谱的 ZCode 也是一款 Coding Harness,只不过它针对的是智谱自家的 GLM,8 月 11 日一口气上线了 Goal、Subagents、Remote Control、闲时任务四大功能。在智谱自研的 Code Bench 中,在复杂跨文件任务上,GLM-5.2 配合 ZCode,要比 GLM-5.2 配合 Claude Code,整体通过率高出 2.39%,缓存命中率超过 98%,有效 token 量提升约 30%。
西红柿在涨价、鸡蛋在涨价、糖在涨价,结果西红柿炒鸡蛋反而便宜了。可是我们都清楚,这个逻辑是有问题的,至于它会持续多久,没人说得明白。