8 月 13 日,DeepSeek 发布了 V4 Pro 正式版。App 和 Web 端需要打开 Expert Mode 才能使用。API 侧的调用名仍然是 deepseek-v4-pro,原有代码不必因为这次发布改模型名。
同一天,DeepSeek 也公开了自己的 Agent 运行时 DSH(DeepSeek Harness)。Responses API 已经原生接入 Codex,官方 npm 包 @deepseek-ai/dsh 也已发布。DSH 目前仍处于开发者预览阶段。
V4 Pro 负责理解任务、推理和选择下一步。Responses API 在客户端与模型之间传递输入、输出和工具结果。DSH 负责调度后续执行,并把会话过程记录下来。Agent 往往要连续调用多轮模型和工具,账单最后取决于整次任务跑了多少轮。
先给一张地图
先看三层分工:V4 Pro 提高模型层的上限,Responses API 传递 Agent 的交互内容,DSH 公开运行时如何加载插件、记录会话和继续执行。
| 层次 |
这次公开的内容 |
这一层要看什么 |
| 模型层 |
V4 Pro / V4 Flash |
模型能不能稳定理解任务、调用工具并完成验证 |
| 协议层 |
Responses API |
多轮输入、工具调用和结果怎样在客户端与模型之间往返 |
| 运行时层 |
DSH / Harness |
Loop、插件、会话、沙箱和权限怎么协同 |
一次任务通常会经过这些环节:
任务 → V4 Pro → Responses API → DSH 运行时 → 工具 / 文件 / 测试 → 可回查结果
下面先说 DSH,再说模型和接口,价格、测试结果以及网上的猜测放在后面一起看。
| 时间 |
发生了什么 |
对应哪一层 |
| 2026-08-13 |
V4 Pro GA 发布,App、Web、API 均可用 |
模型层 |
| 2026-08-13 |
DSH 开发者预览版公开 |
运行时层 |
| 2026-08-17 00:00(北京时间) |
API 新价格生效 |
成本与调度 |
图里只保留三层关系,后面再展开实现细节。

DeepSeek Agent 三层架构:模型、协议与运行时
一、DSH:先看运行时边界
DSH 是 DeepSeek Harness 的缩写。官方仓库以 MIT 协议开源,当前版本标为 developer preview。它适合用来认识架构、试验插件和反馈问题,暂时不适合直接放进生产环境。
截至 8 月 13 日晚间,官方 npm 页面显示的版本是 0.1.0-rc.6。这个版本号只代表当时发布到 npm 的快照。仓库也提醒,早期版本仍可能出现不兼容变更。
https://www.npmjs.com/package/@deepseek-ai/dsh

图:官方 npm 页面展示的 DSH 版本、安装方式和入口模式。
本地试跑的入口很简单:
npx @deepseek-ai/dsh web
默认会在 http://127.0.0.1:3080 启动 Web 界面。这个命令适合在隔离环境里认识它的结构,不适合直接把预览版当作生产依赖。
“一切皆插件”到底意味着什么
Web 界面只是入口。在 DSH 里,模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 都可以拆成插件,由运行时加载。Agent 的主流程不用把每一项都写死在一起。
官方架构文档把模型适配器、工具注册、会话日志和 Agent Loop 都列为插件。Cordis 负责插件的加载、卸载和依赖关系,插件之间通过服务和事件协作。改模型、加工具或调整日志时,可以先动对应插件。
插件化让替换有了明确位置,权限、调试和版本兼容仍要单独处理。换模型时,可以保留 Agent Loop;撤掉工具时,权限判断和会话记录也有各自的位置。
四种模式,先从小环境试起来
DSH 目前提供四种运行模式,默认加载的插件组合不同:
| 模式 |
默认取舍 |
更适合观察什么 |
| 标准模式 |
提供较完整的工具组合 |
完整 Agent 任务怎样运行 |
| PTC 模式 |
由模型生成代码,组合多轮工具调用 |
程序化工具调用怎样减少往返 |
| 极简模式 |
只保留 shell 和文件编辑工具 |
最小环境下模型与工具的基线表现 |
| 创造模式 |
查看当前运行时,在内存中试验 Cordis 插件 |
观察插件如何组合 |
如果要看完整流程,先用标准模式;需要缩小变量时,换成极简模式;插件组合可以留到后面再试。一开始把所有工具和扩展都打开,出了问题很难判断是哪一层造成的。
会话日志:还要记录什么
DSH 的架构文档把 Session Event Log(会话事件日志)放在运行时的中心位置。事件只追加、不改写;模型下一轮所需的上下文,可以从这份事件流重新拼出来。恢复、分叉、检索和回放也共用这份记录。
一次工具调用,内存里留下“成功”两个字还不够。调用参数、返回结果和中间的状态变化都要记下来。系统重启、任务重放,或者有人追问结果时,才能知道 Agent 当时依据什么进入下一步。
聊天记录供人阅读;会话日志还要支持恢复、审计和下一轮决策。两者看起来相近,职责不同。
接缝:给替换留出位置
DSH 把模型、工具、文件系统和子进程等模块放到可替换的 seam(接缝)上。一个接缝通常包含服务定义、提供方和使用方,运行时通过这条接缝调用具体实现。
长期维护时,可以单独更换模型适配器,Agent Loop 继续复用;撤销某个工具后,权限策略和会话记录也不会跟着消失。以后改动或排查问题,可以先定位到对应模块。
二、V4 Pro:模型层提高了什么
8 月 13 日的官方更新说明给出了几项 Agent 评测:Terminal Bench 2.1 为 87.9,DeepSWE 为 62.7,Toolathlon-Verified 为 74.1;HLE 的无工具 / 有工具成绩分别是 42.7 和 60.0。
| 评测 |
官方披露分数 |
这项分数说明什么 |
| Terminal Bench 2.1 |
87.9 |
终端环境中的综合任务表现 |
| DeepSWE |
62.7 |
软件工程任务 |
| Toolathlon-Verified |
74.1 |
工具使用与任务完成 |
| HLE(无工具 / 有工具) |
42.7 / 60.0 |
工具是否接入会明显影响结果 |
这些分数能看出官方用什么任务检验模型,不能直接换算成某个团队的生产效率。代码仓库、工具定义、权限边界、重试策略和验收方式一变,Agent 的结果也可能变化。工程上要测的是“读代码、调用工具、修改文件、跑验证”能不能稳定完成。
评测环境也会影响结果。DeepSeek 在 7 月发布 V4 Flash 时说明,代码 Agent 的公开 benchmark 使用 DSH minimal mode,并给出了具体运行参数。模型、Harness、提示词、工具和运行参数都会影响最后的分数,模型名称本身说明不了全部。
API 侧有几项容易用错的地方:
- V4 Pro 的模型版本是
DeepSeek-V4-Pro-0813,调用时使用 deepseek-v4-pro。
- V4 Flash 当前对应
DeepSeek-V4-Flash-0731,调用名仍是 deepseek-v4-flash。
- 两个模型都支持 1M 上下文 和最高 384K 输出。
- 两个模型都支持 Responses API、Chat Completions 和 Anthropic API。
- 思考强度提供
low、high、max 三档,简单任务不必每次都使用最高档。

图:DeepSeek-V4-Pro-0813 模型页。模型版本标识与实际 API 调用名需要分开看。
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
这里容易混淆。模型页显示的是版本标识,代码里传入的仍然是 deepseek-v4-pro。正式版上线后,客户端不用改模型名,官方保留了原来的 API 调用方式。
三、Responses API:协议层补上了什么
这次发布还加入了 OpenAI Responses API,并针对 Codex 做了适配。用在 Agent 上时,客户端可以传入多轮历史,接收模型输出,再提交工具调用结果。
Responses API 仍然是无状态接口。多轮历史由客户端保存并重新传入;上下文窗口再大,也不会替客户端保存会话。会话保存、历史压缩和失败恢复,都要由上层运行时处理。
已有的 Chat Completions 和 Anthropic API 入口仍然可用。如果要接入 Codex,官方提供了一键配置脚本。Codex CLI、ChatGPT 桌面应用和 VS Code 扩展共用一份配置文件,脚本会先备份原有配置,再写入 DeepSeek 的模型目录和 provider 配置,也提供恢复入口。
这样可以少写一层协议适配代码。脚本仍会修改本地配置,运行前要确认备份位置、变更内容和回滚方式;接入后还要用自己的工具调用和长任务跑一遍。配置写入成功,只说明脚本执行完成。
四、价格:单价之外,还要算任务成本
2026 年 8 月 13 日,官方页面列出的现行价格如下。单位是每 100 万 token,输入又分为缓存命中和缓存未命中,输出单独计费。本文只列官方美元价格,不把第三方按汇率换算的数字混进来。
| 模型 |
缓存命中输入 |
缓存未命中输入 |
输出 |
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
这组价格会在 北京时间 2026 年 8 月 17 日 00:00 切换,对应官方时间是 8 月 16 日 16:00 UTC。新规则按 UTC 的 01:00–04:00 和 06:00–10:00 计高峰,换算成北京时间后,高峰时段是每天 09:00–12:00 和 14:00–18:00;其余时间为非高峰。
非高峰价格
| 模型 |
缓存命中输入 |
缓存未命中输入 |
输出 |
deepseek-v4-flash |
$0.007 |
$0.22 |
$0.66 |
deepseek-v4-pro |
$0.022 |
$0.66 |
$1.98 |
高峰价格
| 模型 |
缓存命中输入 |
缓存未命中输入 |
输出 |
deepseek-v4-flash |
$0.014 |
$0.44 |
$1.32 |
deepseek-v4-pro |
$0.044 |
$1.32 |
$3.96 |
价格提醒: 非高峰价是高峰价的一半,但仍高于 8 月 13 日的现行价。新规则把价格和调用时段绑在了一起。
实际账单还要看三个变量:
- 缓存命中要靠请求结构。 稳定的系统提示、工具定义和项目规则尽量放在前缀,变化频繁的用户输入和工具结果放后面。能否命中,还要用实际请求验证。
- 批处理任务可以安排到非高峰。 代码索引、离线评测、批量摘要有调度空间;交互式任务要照顾用户等待时间。
- 别只看输入单价。 Agent 多轮调用工具时,输出 token 和重试都会计费,思考强度也可能改变 token 消耗。单次调用便宜,任务跑长后,账单可能完全是另一种样子。
单价之外,还要算一个任务会跑多少轮。正式接入前,先拿自己的任务集测一遍:缓存命中率、工具调用成功率、修改后的测试通过率、平均延迟和单任务总成本。这些数字比宣传价更接近实际使用。
五、一次 Agent 任务,三层怎么配合
一次 Agent 任务通常会在模型决策、工具执行和验证之间来回几轮。会话日志把每一轮留下来,验证不通过时,系统才知道该继续、重试还是停住。

图:一次任务从模型决策到工具执行、验证和回查结果的简化流程。
具体到一次任务:V4 Pro 负责推理和选择下一步,Responses API 传递交互内容,DSH 负责调度、记录和恢复。
| 位置 |
主要职责 |
少了它会怎样 |
| V4 Pro / V4 Flash |
理解任务、推理、选择下一步工具 |
模型可能无法形成可靠的行动计划 |
| Responses API |
传递多轮输入、输出、工具调用和结果 |
客户端需要自行拼接协议,调用链容易断 |
| DSH / Harness |
管理 Loop、插件、会话事件、扩展和边界 |
长任务难以恢复,工具和状态难以审计 |
写 Agent benchmark 成绩时,模型名称还不够。还要交代使用了什么 Harness、哪些工具、怎样的提示词、什么思考强度,以及失败任务如何处理。少了这些信息,数字就很难复现。
六、把事实和猜测分开
发布后,社区很快出现了一些延伸解读。有人根据返回 fingerprint 从可读字符串变成哈希,猜测线上推理栈发生了切换;有人把 DSH 直接描述成要去挑战 Claude Code 或 Codex;还有人用单个项目的缓存命中率或成功率,推导某套 Harness 普遍更优。
这些内容可以拿来设计测试,暂时还不能写成 DeepSeek 的官方结论。表里分成三类:
| 类型 |
当前可以说到哪里 |
| 已确认事实 |
V4 Pro GA、API 模型名不变、Responses API 原生支持、价格切换时间、DSH 的开发者预览状态和插件式架构 |
| 个人判断 |
DSH 可能会成为 DeepSeek Agent 生态的重要运行时入口,但还要看版本稳定性、插件生态和真实任务结果 |
| 待验证线索 |
fingerprint 变化的原因、线上波动与发布的关系、DSH 与 Claude Code / Codex 的产品竞争关系 |
某个 Harness 在一组任务上表现很好,说明这套模型、工具、提示词和运行参数值得继续测。换到别的项目,结果未必一样。这类判断只能先当作假设,等版本和任务数据出来再验证。
七、现在适合怎么试
只是体验模型,直接调用 deepseek-v4-pro 或 deepseek-v4-flash 就够了。要判断它能不能放进真实工作流,可以先挑一条有明确验收标准的任务。
| 任务 |
重点观察 |
| 只读代码检索 |
能不能找到正确文件、调用关系和证据位置 |
| 跨文件小改动 |
Diff 是否集中,测试是否真的通过 |
| 带工具循环的故障定位 |
遇到证据不足或权限不足时,能不能停下来 |
每次试跑至少记录模型版本、思考强度、缓存命中情况、工具调用次数、输入 / 输出 token、总耗时,以及最终的测试和验收结果。有了这些记录,模型变化和工具链、提示词、任务切分带来的影响才分得开。
模型调用跑通后,再试 DSH。先在本地预览版里看插件如何加载、会话事件如何记录、模型上下文如何从日志重建,再决定它是否适合放进自己的 Agent 平台。文件系统、子进程、网络访问和凭据边界要单独检查;要保留实验结果,就记录具体包版本,别把 npx 每次拉到的最新包当成固定依赖。
我的取舍: V4 Pro 先测,Responses API 可以接,DSH 先研究,不急着上生产。判断结果仍要落到自己的任务集和证据记录上。
写在最后
这次更新有三处变化:V4 Pro 提高了工具任务的模型上限,Responses API 提供了更适合 Agent 的交互方式,DSH 让开发者可以看到并调整插件、状态和扩展。
价格也给了一个很实际的提醒:Agent 的成本取决于模型单价,也取决于缓存前缀、任务调度、思考强度和工具循环。非高峰价格可以帮助调度,但不能替代测算。
进入生产前,先跑通一条小任务:调用依据能回查,权限或证据不足时会停住,结果还能由外部系统验证。模型还会更新,运行时和证据记录要先准备好。更多 DSH 与 V4 Pro 的讨论,也可以到云栈社区的技术论坛里参与。
官方资料
- DeepSeek API 更新日志:DeepSeek-V4-Pro Update
- DeepSeek API 模型与价格
- DeepSeek Responses API 文档
- DeepSeek Codex 接入文档
- DeepSeek Harness 官方仓库
- DeepSeek Harness 架构说明
- DeepSeek Harness npm 包
- DeepSeek 官方 X:V4 Pro 发布说明
- DeepSeek 官方 X:API 价格调整
- DeepSeek 官方 X:DSH 开发者预览版
价格和模型版本会继续变化,发布前请以 DeepSeek 官方页面为准。本文价格按 2026 年 8 月 13 日官方页面整理。