找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4687

积分

0

好友

610

主题
发表于 1 小时前 | 查看: 2| 回复: 0

8月12日深夜,DeepSeek 官网的 API 文档页面悄然完成了一次更新。Pro 模型的版本号更换成了 DeepSeek-V4-Pro-0813

DeepSeek-V4系列模型细节对比表格

与此同时,根据第一财经报道的 DeepSeek 官方群消息,官方放出了一组评分数据。表格中显示 DeepSeek V4 Pro 的性能远远超过了预览版,甚至在 Terminal Bench 2.1 这个对 Agent 领域影响极大的测试集上,性能比肩当下最强的模型 Claude Fable 5。

DeepSeek V4 Pro 在 Agent 相关评测集上的表现对比

另一方面,在 DeepSWE 测试集上,预览版仅得 12.8 分,基本属于"不会做"的水平;正式版直接飙到 62.7 分,涨幅接近 5 倍。这个测试集是衡量代码 Agent 能力的核心基准。同样翻倍的还有 DSBench-Hard,从 31.1 冲到 67.2;DSBench-FullStack 从 41.8 提升到 71.1。

如此这般的性能提升,将其称之为 DeepSeek V5 Pro 都不为过。

硬件规格上,V4 Pro 延续了 MoE 架构设计,总参数规模 1.6 万亿,每次推理激活约 490 亿参数。接口侧提供 100 万 token 上下文和最高 38.4 万 Token 输出,这两个数字对普通聊天可能意义不大,但对长任务 Agent 却是硬刚需。尤其是大型代码库、长时间运行的日志以及连续工具调用,都会快速吃掉上下文。窗口不够大,Agent 就只能不断压缩记忆,压着压着,前面做过什么也忘了。

调用方式保持不变,模型名仍然是 deepseek-v4-pro,老用户的代码一行不用改,后端就自动切换到了新版本。

价格方面,0813 版每百万 token 缓存未命中输入 3 元、输出 6 元,和预览版时期一致,并没有随模型转正而同步上调。而就在不久前,DeepSeek 官方曾表示价格将要上涨。

DeepSeek V4 引发全球降价

自 DeepSeek V4 发布以后,行业内出现了一个怪现象:几乎所有大厂都在降价。但大背景却是只要跟 AI 相关的,一定都在涨价。最开始是 GPU、内存,现在连硬盘、电,甚至陶瓷都涨了。就好像西红柿涨价、鸡蛋涨价、糖涨价,结果西红柿炒鸡蛋反而比以前更便宜了。

2025 年的时候,DeepSeek R1 虽然引发了"DeepSeek 时刻",可当时由于行业重点在于输出内容的质量,所以 OpenAI、Anthropic 还能用"我们更聪明"来维持溢价。

但现在,今年 7 月 31 日 V4 Flash 正式版上线以后,行业叙事改成了"每任务/单位智能的价格"。DeepSeek V4 Flash 正式版凭借"能力够用+价格便宜两个数量级"形成了一道独有的斩杀线。

根据 Artificial Analysis 的测试,在完成相同水平任务的前提下,DeepSeek V4 Flash 的价格低于市面上 70% 的模型,而那些处于这 70% 分水岭内的模型,称之为被 DeepSeek"斩杀"。落在斩杀线上的竞品,只剩两条出路:要么主动大幅下调定价,要么干脆放弃普惠开发者市场,收缩到预算充足的高端企业客户。

于是各家厂商的处境变得很微妙。短期内没办法提高智能水平,又舍不得开发者市场,降价就成了唯一能立刻执行的防御手段。

OpenAI 是最典型的例子。GPT-5.6 Luna 7 月 9 日才上线,7 月 30 日就宣布降价 80%,输入价从每百万 token 1 美元砍到 0.2 美元,输出价从 6 美元砍到 1.2 美元。一款刚发布的新旗舰,上市不到一个月就打两折,这也是无可奈何的事情。

OpenAI 在降价当天同步发了一篇技术博客,称 GPT-5.6 Sol 自己重写并优化了部分生产推理内核,把端到端模型服务成本压低了约 20%,token 生成效率提升了 15% 以上。这就使得它能把省下来的钱,直接变成给用户的降价补贴。换句话说,OpenAI 这波降价,是被自己模型写代码省下的成本托起来的。

不过成本降低 20% 和提升 15% 生成效率这两个数字,似乎跟降价 80% 匹配不上。根据 OpenAI 的投资人披露,该企业单季营收 57 亿美元,同比增长约 3 倍;经营性亏损 93 亿美元,当期现金消耗(实际烧掉的现金)37 亿美元,相当于每赚 1 美元收入就要烧掉约 0.65 美元现金。当季研发支出高达 86 亿美元,整体毛利率仅 39%。并且市场预测,OpenAI 在 2026 年的全年经营性亏损约为 140 亿美元。

因此,无论 OpenAI 发布的技术报告内容如何,如果没这条斩杀线,这笔效率红利大概率会先进利润表,而不是变成用户账单上的折扣。

Anthropic 也有相似的反应。Claude Opus 5 发布后,其定价改为了 5 美元/25 美元,正好是 Fable 5 的半价。Sonnet 5 首发优惠价 2 美元/10 美元,比标准定价低了三分之一,优惠期一路延到 8 月 31 日。随着 DeepSeek 斩杀线的发酵,Anthropic 在 8 月 10 日宣布,将 Sonnet 5 的优惠价格变为永久价格,再也不恢复成为原价格。

谷歌 7 月 21 日一口气发三款 Gemini Flash 轻量模型,主力款 3.6 Flash 当天宣布输出价永久下调 17%。

国内更是放血式促销。8 月 11 日,智谱把 GLM Coding Plan 全员额度重置回满,再叠 1.5 倍限时加成;火山引擎给 GLM-5.2 开出四倍折扣系数,49 元的套餐能换到五千多万 token;OpenRouter 上 GLM-5.2 的三家供应商互相压价,从 60% 打到 80%,再到 95%。

反直觉,斩杀线其实会越来越低

逃避斩杀线的路有两条:一条往下走,一条往上走。往下走是防御,是承认自己在这个区间和 DeepSeek 没有本质区别,只能拼价格。往上走是进攻,是只要能力足够强、DeepSeek 够不到,就根本不在斩杀线的杀伤范围内。

在 DeepSeek 的斩杀线之上可以继续收溢价,因此,诸如 GPT-5.6 Sol、Kimi K3、Claude Fable 5,这些真正站在金字塔尖的旗舰模型,一个都没降价。

以 Kimi K3 为例,其于 2026 年 7 月 16 日正式上线,本身就发布在 DeepSeek V4 Flash 之后,其 API 定价为:国际版输入 3 美元/百万 token、输出 15 美元/百万 token;国内版输入 20 元/百万 token、输出 100 元/百万 token。对比上一代旗舰 K2.6,K3 国内版的输入价格上涨了 208%,输出价格上涨 270%。

但有个事得提前说明白,如今已经 2026 年过半了。DeepSeek V4 Flash 的总参数量为 284B,这在当下其实是一个非常轻量的模型,它的定位是"高效率地完成大多数任务"。 Artificial Analysis 的智能指数里,V4 Flash 只得了 50 分,明显低于 Kimi K3、GPT-5.6 和 Claude Fable 5。这就使得在复杂推理、长链路任务、多步规划、需要深度领域知识的判断,这些超级硬核的任务上,DeepSeek V4 Flash 的完成率和可靠性,远不如头部模型。斩杀线扫过的是"够用就好"的那片海,在"必须万无一失"的那片土地上,DeepSeek 暂时还过不去。

不过这个斩杀线其实也维持不了多久,因为"推测解码"越来越成为了主流。这也是为什么所有大厂都要研发旗舰模型的同时,开发一款极其便宜的小模型。

所谓推测解码,是指 2022 年时,Google Research 团队的亚尼夫·利维坦(Yaniv Leviathan)、马坦·卡尔曼(Matan Kalman)和约西·马蒂亚斯(Yossi Matias)曾在论文《通过推测解码实现 Transformer 的快速推理》(Fast Inference from Transformers via Speculative Decoding)中提出,用一个小模型快速出草稿,大模型只负责并行验证和修正。草稿命中率一旦稳定在 80% 以上,旗舰模型的有效推理成本就能降到原来的 1/3 到 1/5。

但以前这项技术不太能降低成本,原因在于以前给旗舰模型配草稿,用的是 7B、13B 的通用超小模型,命中率上不去,所以价格就打不下来。可推测解码仍然是业内公认最可行的方向,这才使得大家都备有一款小模型。

现在来看,推测解码逐渐走向成熟。2026 年 6 月 DeepSeek 发布了 DSpark 推测解码模块,并部署到 V4 Flash 和 V4 Pro 的线上流量,在相同吞吐下单用户生成速度提升了 60% 到 85%,这也直接造成了 DeepSeek 的大幅降价。随着 DSpark 的成功,势必会有越来越多的厂商部署推测解码,以实现更快更便宜的效果。

除了推测解码外,还有一个技术也可能会降低模型成本,那就是静态知识剥离。这个技术其实起源更早,它是 Meta AI 的帕特里克·刘易斯(Patrick Lewis)等人在 2020 年论文《面向知识密集型 NLP 任务的检索增强生成》(Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks)中提出的。简单来讲,它就是让模型在思考的过程中,把事实性知识从参数中拆出去,只靠外部检索补充。这样整个思考过程就会更快,成本因此更低,并且由于外部引入知识,还能让输出结果幻觉更少。

不过真正把这个技术发扬光大的依然是 DeepSeek。2026 年 1 月,DeepSeek 联合北大发表论文《通过可扩展查找实现条件记忆》(Conditional Memory via Scalable Lookup)。论文的观点是,语言建模本质上包含两类完全不同的任务,一类是需要深度动态计算的组合推理,另一类是检索静态知识,但 Transformer 把这两件事混在一起做了。于是论文就依照静态知识剥离的逻辑提出了一个叫做 Engram 的技术。

打个比方,在考试的时候,让大模型背下所有公式、历史年份、名人身份、地理常识。然而这就导致大模型只能用一部分的脑容量来解题。背得越多,能用来思考的脑容量就越少。Engram 干的事就是把闭卷考试改成开卷考试。它在模型中间插了一本"速查手册",遇到"戴安娜王妃是谁"、"张仲景是什么朝代的"这种事实性问题,不用现场一层层推导,直接翻手册,一秒查到。

这样,模型的脑容量就可以全部用来做真正需要动脑筋的事,比如解数学题、写代码、做逻辑推理。Engram 一旦成熟,也将大幅减少模型成本。

DeepSeek V4 Pro 真的发布了吗?

随着 DeepSeek V4 Pro 的更新,网上最大的声音便是质疑。因为这次更新和 DeepSeek V4 Flash 正式版的更新方式截然不同,V4 Flash 正式版有完整的官方更新日志,明确标题"DeepSeek-V4-Flash 更新",列出了 9 项基准测试的具体分数。最关键的是,DeepSeek 会注明"模型结构、尺寸和 Preview 保持一致,仅重新进行了后训练"这些细节。

DeepSeek V4 Flash 正式版更新日志截图

可截止发稿,DeepSeek V4 Pro 正式版相关的发布痕迹也只有三处:官网的"模型 & 价格"页面、官网首页出现一句简短的滚动公告、一张跑分表。甚至就连官方的更新日志,也停留在 DeepSeek V4 Flash 正式版上。

除了这些迹象外,权威评测机构 Artificial Analysis 上线了 V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数为 53 分。相比预览版的 45 分确有提升,和 GLM-5.2 齐平。

Artificial Analysis 智能指数对比图

但问题在于,53 分这个档位和 Fable 5 差了很远,无法匹配跑分表中的"接近甚至超过 Fable 5"。作为参照,同一天发布的 Grok 4.6 还拿到了 61 分。

ProofBench 模型性能对比表格

不只是 Artificial Analysis,在比较模型数学能力的 Proof Bench 上,作为靠数学能力而声名鹊起的 DeepSeek,其 V4 Pro 正式版甚至连前 10 都没有挤进去。

更有一些个人评测者对 V4 Pro 正式版进行了深度测试,均表示实测效果皆不尽人意。AI 博主牙医就发文表示"刚发的 DeepSeek-V4-Pro-0813 好像的确有问题。reasoning_effort=max 的时候模型在长程 Agentic Coding 任务下更倾向于早停。"

他进一步表示,"我这个测试总计 50 轮,让模型不断优化代码,结果他在 3 次测试中,2 次都在 42-43 轮左右的情况下停止了。并未用完全部机会。而且目前成绩来看,甚至没打过 GLM-5.1(仅我这一个 case,我不对其它 case 负责)。"

终端日志截图:模型自行提前结束任务

以最常见的"鹈鹕测试"为例,提示词为:

Generate an animated looping SVG of a pelican riding a bicycle. Wheels spin, pedals move, pelican's legs pedal correctly, smooth infinite loop, no javascript, use native SVG animateTransform only.

翻译为:生成一个循环动画 SVG:鹈鹕骑自行车。轮子旋转、踏板转动、鹈鹕的腿正确踩踏板,平滑无限循环,不要 JS,只用 SVG 原生 animateTransform 动画。

我将相同的提示词分别发给 DeepSeek V4 Pro 正式版和 Flash 正式版,结果发现,反而 Flash 做的效果远远超过了 V4 Pro,无论是鹈鹕的动作还是背景中的云彩,V4 Flash 正式版均比 Pro 正式版更好。

0813 这个版本号本身可能只是一个"占位符"。换句话说,DeepSeek 可能并没有直接上线新模型,或者是有意去压制新模型的能力,先把坑占上了,等后续做好准备再上线,这样就不用担心一瞬间超高并发挤爆服务器了。

此前,DeepSeek Harness 负责人崔添翼曾透露,DeepSeek V4 Pro 的正式版将和 DeepSeek Harness 同时上线。而 8 月 13 日这天,是 DeepSeek Harness 的最后一次测试。在 DeepSeek Harness 内测群中就有这样一条消息,0813 版本计划发布 DeepSeek Harness 的公测版。

DeepSeek Harness 官方内测群聊天截图

目前看来该 Harness 产品还未发布,并且 DeepSeek V4 Flash 之前的测试中,就有很多成绩是 DeepSeek Harness 上跑出来的。那么结合官方群里的跑分表,尤其是在 Terminal Bench 这样的测试集上,使用的可能就是传说中的 DeepSeek Harness。

模型的斩杀线会下降,但 DeepSeek Harness 可能会带来新的斩杀线。

2026 年 5 月,DeepSeek Harness 内部立项,独立组建专项核心团队,由崔添翼负责。8 月 2 日,崔添翼面向全球公开征集 Harness 内测用户,优先筛选具备 Agent Harness 开源项目经验的开发者。8 月 11 日,"DeepSeek Harness 团队"微信公众号完成注册,认证主体是深度求索北京分公司。

在 V4 Flash 正式版的 API 文档中有这么一段内容,对于公开基准测试中的 Code Agent 任务,正式版用的是 DeepSeek Harness 极简模式作为框架进行测试。也就是说,V4 Flash 能拿下 Terminal Bench 2.1 的 82.7 分,严格来说是"DeepSeek 模型 + DeepSeek Harness 测试框架"的组合成绩,不是纯模型裸分。

V4 Flash 预览版在 Terminal Bench 2.1 上是 61.8 分,同期 V4 Pro 预览版是 72.1 分。显然,DeepSeek Harness 在 Agent 任务上,给 DeepSeek 模型带来了质的飞跃。

82.7 分其实是一个非常高的分数。Terminal Bench 2.1 目前的 SOTA 是 GPT-5.6 Sol 的 88.8 分,Kimi K3 是 88.3 分,Claude Opus 5 是 84.3 分,所有参评模型的平均分是 77.3 分。

正如前文提到的,V4 Flash 是一个轻量模型,和 Fable 5、GPT-5.6 Sol 对比的应该是旗舰模型 V4 Pro。那么可想而知,一旦 DeepSeek Harness 和 V4 Pro 正式版上线,势必会迎来一个新的斩杀档位。

更值得注意的是,国内玩家已经全部挤进了这条赛道。 除了 DeepSeek 外,智谱的 ZCode 也是一款 Coding Harness,只不过它针对的是智谱自家的 GLM,8 月 11 日一口气上线了 Goal、Subagents、Remote Control、闲时任务四大功能。在智谱自研的 Code Bench 中,在复杂跨文件任务上,GLM-5.2 配合 ZCode,要比 GLM-5.2 配合 Claude Code,整体通过率高出 2.39%,缓存命中率超过 98%,有效 token 量提升约 30%。

西红柿在涨价、鸡蛋在涨价、糖在涨价,结果西红柿炒鸡蛋反而便宜了。可是我们都清楚,这个逻辑是有问题的,至于它会持续多久,没人说得明白。




上一篇:RK3576开发板ISP调优实录:从BLC到3D LUT的摄像头画质优化全流程
下一篇:嵌入式开发多年,我最后悔的五件事:原理图、驱动源码与英语
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-14 06:25 , Processed in 2.503836 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表