找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4197

积分

0

好友

541

主题
发表于 5 小时前 | 查看: 3| 回复: 0

7月31日下午,DeepSeek 通过官方 API 文档发布更新日志:DeepSeek-V4-Flash 正式版 API 上线公测。API 调用方式不变,开发者将模型名设置为 deepseek-v4-flash 即可使用最新版本。

这次更新的核心看点不在参数规模。官方明确表示,V4-Flash-0731 的模型结构和尺寸与此前预览版完全一致,仅重新进行了后训练。真正的意外在于:一个轻量版 Flash 的 Agent 能力,竟把自家旗舰 V4-Pro 的预览版给超了。

模型结构没变、参数量没变,只重新做了一次后训练,Agent 能力就全面反超了自家 Pro 预览版。

官方公布的 Agent 及编程基准测试数据相当直接:

DeepSeek V4-Flash 基准测试跑分对比表

三项数据值得单拎出来看:

  1. Terminal Bench 2.1 拿下 82.7,直接超过 GLM-5.2 的 81.0,仅次于 Opus 4.8 的 85.0。这个基准测试的是 AI Agent 在真实命令行环境中独立完成端到端任务的能力,是衡量它能不能真正干活的试金石。
  2. DeepSWE 从 7.3 跃升至 54.4,Cybergym 从 38.7 涨到 76.7。两处都是接近翻倍的提升,说明后训练对 Agent 执行稳定性的提升是结构性的,不是挤牙膏。
  3. Toolathlon、Agent Last Exam、Automation Bench 三项均逼近 Opus 4.8,差距缩到了个位数以内。

为什么小模型能反超大旗舰?

这可能是本次更新最反直觉、也最值得琢磨的一点。

Flash 在 V4 系列里的定位是更快、更便宜、更轻量,284B 总参数 / 13B 激活参数,远小于 Pro 的 1.6T / 49B。按常理,旗舰模型能力应该稳压轻量版。但 AI Agent 场景恰恰不完全依赖参数规模:它更吃指令遵循、工具调用、任务拆解这类行为级能力,而这些主要靠后训练阶段塑造。

DeepSeek 这次的做法很直接:把有限的工程资源集中投在 Flash 的后训练上,把 Agent 能力先打磨到位再推正式版。至于 Pro 预览版,它发布更早,后训练还没来得及跟上。换句话说,这不是 Flash 比 Pro 强,而是 Flash 先完成了 Pro 还没完成的最后一步。

官方同时预告:DeepSeek-V4-Pro 正式版将尽快发布(有消息称预计 8 月初)。届时 Pro 重新做过后训练,定位如何拉开,才是真正值得观察的看点。

Responses API + Codex 适配

对开发者而言,本次更新最有实际价值的或许是接口层面:

  1. 原生支持 Responses API 格式,不再需要做格式转换;
  2. 针对 Codex 做了专项适配,V4-Flash 可直接作为 Codex 的后端模型使用,配置方法官方已给出文档。

加上此前 V4 系列已适配 Claude Code、OpenClaw、OpenCode 等主流 Agent 工具,Flash 正式版的即插即用属性明显提升。对中小开发者来说,这意味着一个更便宜、更快、且能和主流 Agent 工作流直接打通的选项。

需要说明的是:上述成绩来自 DeepSeek 在指定框架和参数下的官方测试(DeepSeek Harness 极简模式,max 档位,topp=0.95,temperature=1.0;该 Harness 本身即将发布),DSBench 两项更是内部测试集。

也就是说,跑分代表官方评测环境下的最佳表现,实际效果仍有待第三方评测和生产环境的验证。参考价值在于横向坐标,Terminal Bench 压过 GLM-5.2、逼近 Opus 4.8,这个量级本身已经说明正式版 Flash 的 Agent 能力上了新台阶。

两个容易忽略的限定

  1. 本次仅升级了 V4-Flash 的 API 接口。V4-Pro 的 API 以及 APP/Web 端模型均未变化,你在网页端或 App 里对话,用的还不是这一版。
  2. Responses API 目前仅支持 V4-Flash,V4-Pro 预计 8 月初接入。

另外提醒一句:此前官方已宣布旧模型名 deepseek-chatdeepseek-reasoner 于 7 月 24 日停用,现在调用务必使用 deepseek-v4-flash / deepseek-v4-pro 新模型名。

V4-Flash 正式版上线的信号意义,可能比跑分本身更重要:它验证了后训练决定 Agent 能力这条路径,模型骨架不变,能力可以靠训练重塑。 这也意味着,模型厂商之间发布即定型的节奏正在被打破,谁能更快地做 Fine-tuning 迭代、更快适配 Agent 生态,谁就能在开发者的工作流里抢占身位。

V4-Pro 正式版即将到来。实际能力还需要大家一起在实际工作中验证!

官方地址https://api-docs.deepseek.com/zh-cn/updates/




上一篇:树莓派线材避坑指南:电源、HDMI、网线、USB与相机排线选购全解析
下一篇:Stillrun:不翻history了,我给Mac终端整了个“行车记录仪”
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-2 06:45 , Processed in 0.762027 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表