DeepSeek V4 Flash 太便宜了!!一次提示直出第一人称 3D 射击游戏——能跑能跳能打枪,地图掩体物理碰撞全部到位,UI 右下角还实时显示弹匣余量。

大制作啊大制作,结果一看账单这一整套才 0.07 美元,那不就是 5……毛钱!?也就是说 2 美元能玩上一整天,难怪网友都有点绷不住了(笑)。
DeepSeek V4 Flash 正式版 API 上线公测之后,大家不忙着跑分,全网都在算:V4 Flash 和 Opus 5 比便宜几倍,和 GPT-5.6 比省了多少…… 晒单一对比,结论高度一致:DeepSeek V4 Flash,便宜得离谱。

1美分 vs. 1美元
光看 DeepSeek 自己还不够直观,咱们直接上对比!Claude Opus 5 和 DeepSeek V4 Flash 0731 的发布只隔了 7 天。既然赶这么近,就有网友给它俩摆一块儿跑了同款太空射击游戏。两者均完整实现战机移动、射击、击碎陨石、道具拾取等功能,可玩性几乎没有拉开明显差距。
单看交付的顺滑度,Opus 5 倒是一把过,V4 Flash 磨了三次才成。但 Opus 那版代码体量接近 3000 行,V4 Flash 那版大概 900 行,用了三分之一的代码量,价格也直接便宜了两个数量级——1 美分 vs 1 美元。可是!100 倍的差价摆在面前,成品功能却几乎看不出太大差别。
再来看看森林划船小游戏,是 V4 Flash 和 GPT 5.6 Sol 的同款对比。两者都做出了完整 3D 河道场景、左右方向操控、障碍物碰撞计分、动态树木远景这套核心玩法,不管是交互逻辑还是画面风格几乎趋同(除了 DeepSeek 的造景都小一码)。
再看一眼账单,惊了。这次是 0.05 美元 vs 2.47 美元,V4 Flash 整整便宜 50 倍。

这位大哥也忍不住感叹:定价简直让人难以置信,便宜得离谱了吧……
再来一组宝可梦 3D 模型对照,用一模一样的需求指令分别调用 GPT-5.6 Luna、DeepSeek V4 Flash 0731。成品效果一时分不出好坏,但 token 输出差距非常直观。最终 GPT-5.6 Luna 输出高达 230 万+ token;相同情况下 DeepSeek V4 Flash 仅输出 47.7 万 Token,折算下来整套任务成本相差近 14 倍。只能说,这么多对比下来,V4 Flash 每一次的效果可能不是最好的,但一定是最值的。
被 DeepSeek V4 Flash 捂住了钱包
那问题就来了,DeepSeek V4 Flash 到底为啥能做到这么便宜?

最核心的还是 MoE 架构,作为 V4 家族一员,Flash 总参数依然是 284B,每次推理只激活 13B。跟 MoE 配合的是 CSA+HCA 混合压缩注意力。上下文拉到 100 万 token 时,不用每个新词都把全部历史翻一遍,先压缩再筛选,只有必要时才回看全局,大幅降低百万级上下文下的 KV 缓存压力。这样,KV 缓存省了,显存省了,每步推理的算力也省了。再往下是权重,V4 用的是 FP4+FP8 混合,专家权重能压多低压多低,推理不失精度,但存储和搬运成本直线下降。
0731 这个正式版,底层模型骨架、参数数量、注意力结构、量化方案,跟预览版 100% 一致,只重做了后训练,把 SFT监督微调 和 GRPO 强化学习重新打磨,再加了个 DSpark 投机解码做推理加速,拉高服务器并发吞吐。再看涨幅,Terminal Bench 2.1 从 61.8 升到 82.7,Toolathlon 从 49.7 干到 70.3……但预训练成本一分没加。

如图,Agent能力 大幅增强,基准测试远超 V4-Pro-Preview:
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench (Public): 25.1
- DSBench-FullStack: 68.7
- DSBench-Hard: 59.6
Flash 主打的就是高并发、规模化服务。你的钱包被 DeepSeek V4 Flash 捂住了没?
如果你有更多使用体验,欢迎来 云栈社区 和大家一起交流。
参考链接: