找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4421

积分

0

好友

581

主题
发表于 2 小时前 | 查看: 3| 回复: 0

8 月 13 日,DeepSeek 发布了 V4 Pro 正式版。App 和 Web 端需要打开 Expert Mode 才能使用。API 侧的调用名仍然是 deepseek-v4-pro,原有代码不必因为这次发布改模型名。

同一天,DeepSeek 也公开了自己的 Agent 运行时 DSH(DeepSeek Harness)。Responses API 已经原生接入 Codex,官方 npm 包 @deepseek-ai/dsh 也已发布。DSH 目前仍处于开发者预览阶段。

V4 Pro 负责理解任务、推理和选择下一步。Responses API 在客户端与模型之间传递输入、输出和工具结果。DSH 负责调度后续执行,并把会话过程记录下来。Agent 往往要连续调用多轮模型和工具,账单最后取决于整次任务跑了多少轮。

先给一张地图

先看三层分工:V4 Pro 提高模型层的上限,Responses API 传递 Agent 的交互内容,DSH 公开运行时如何加载插件、记录会话和继续执行。

层次 这次公开的内容 这一层要看什么
模型层 V4 Pro / V4 Flash 模型能不能稳定理解任务、调用工具并完成验证
协议层 Responses API 多轮输入、工具调用和结果怎样在客户端与模型之间往返
运行时层 DSH / Harness Loop、插件、会话、沙箱和权限怎么协同

一次任务通常会经过这些环节:

任务 → V4 Pro → Responses API → DSH 运行时 → 工具 / 文件 / 测试 → 可回查结果

下面先说 DSH,再说模型和接口,价格、测试结果以及网上的猜测放在后面一起看。

时间 发生了什么 对应哪一层
2026-08-13 V4 Pro GA 发布,App、Web、API 均可用 模型层
2026-08-13 DSH 开发者预览版公开 运行时层
2026-08-17 00:00(北京时间) API 新价格生效 成本与调度

图里只保留三层关系,后面再展开实现细节。

DeepSeek Agent 三层架构图

DeepSeek Agent 三层架构:模型、协议与运行时

一、DSH:先看运行时边界

DSH 是 DeepSeek Harness 的缩写。官方仓库以 MIT 协议开源,当前版本标为 developer preview。它适合用来认识架构、试验插件和反馈问题,暂时不适合直接放进生产环境。

截至 8 月 13 日晚间,官方 npm 页面显示的版本是 0.1.0-rc.6。这个版本号只代表当时发布到 npm 的快照。仓库也提醒,早期版本仍可能出现不兼容变更。

https://www.npmjs.com/package/@deepseek-ai/dsh

DSH npm 页面截图

图:官方 npm 页面展示的 DSH 版本、安装方式和入口模式。

本地试跑的入口很简单:

npx @deepseek-ai/dsh web

默认会在 http://127.0.0.1:3080 启动 Web 界面。这个命令适合在隔离环境里认识它的结构,不适合直接把预览版当作生产依赖。

“一切皆插件”到底意味着什么

Web 界面只是入口。在 DSH 里,模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 都可以拆成插件,由运行时加载。Agent 的主流程不用把每一项都写死在一起。

官方架构文档把模型适配器、工具注册、会话日志和 Agent Loop 都列为插件。Cordis 负责插件的加载、卸载和依赖关系,插件之间通过服务和事件协作。改模型、加工具或调整日志时,可以先动对应插件。

插件化让替换有了明确位置,权限、调试和版本兼容仍要单独处理。换模型时,可以保留 Agent Loop;撤掉工具时,权限判断和会话记录也有各自的位置。

四种模式,先从小环境试起来

DSH 目前提供四种运行模式,默认加载的插件组合不同:

模式 默认取舍 更适合观察什么
标准模式 提供较完整的工具组合 完整 Agent 任务怎样运行
PTC 模式 由模型生成代码,组合多轮工具调用 程序化工具调用怎样减少往返
极简模式 只保留 shell 和文件编辑工具 最小环境下模型与工具的基线表现
创造模式 查看当前运行时,在内存中试验 Cordis 插件 观察插件如何组合

如果要看完整流程,先用标准模式;需要缩小变量时,换成极简模式;插件组合可以留到后面再试。一开始把所有工具和扩展都打开,出了问题很难判断是哪一层造成的。

会话日志:还要记录什么

DSH 的架构文档把 Session Event Log(会话事件日志)放在运行时的中心位置。事件只追加、不改写;模型下一轮所需的上下文,可以从这份事件流重新拼出来。恢复、分叉、检索和回放也共用这份记录。

一次工具调用,内存里留下“成功”两个字还不够。调用参数、返回结果和中间的状态变化都要记下来。系统重启、任务重放,或者有人追问结果时,才能知道 Agent 当时依据什么进入下一步。

聊天记录供人阅读;会话日志还要支持恢复、审计和下一轮决策。两者看起来相近,职责不同。

接缝:给替换留出位置

DSH 把模型、工具、文件系统和子进程等模块放到可替换的 seam(接缝)上。一个接缝通常包含服务定义、提供方和使用方,运行时通过这条接缝调用具体实现。

长期维护时,可以单独更换模型适配器,Agent Loop 继续复用;撤销某个工具后,权限策略和会话记录也不会跟着消失。以后改动或排查问题,可以先定位到对应模块。

二、V4 Pro:模型层提高了什么

8 月 13 日的官方更新说明给出了几项 Agent 评测:Terminal Bench 2.1 为 87.9,DeepSWE 为 62.7,Toolathlon-Verified 为 74.1;HLE 的无工具 / 有工具成绩分别是 42.7 和 60.0。

评测 官方披露分数 这项分数说明什么
Terminal Bench 2.1 87.9 终端环境中的综合任务表现
DeepSWE 62.7 软件工程任务
Toolathlon-Verified 74.1 工具使用与任务完成
HLE(无工具 / 有工具) 42.7 / 60.0 工具是否接入会明显影响结果

这些分数能看出官方用什么任务检验模型,不能直接换算成某个团队的生产效率。代码仓库、工具定义、权限边界、重试策略和验收方式一变,Agent 的结果也可能变化。工程上要测的是“读代码、调用工具、修改文件、跑验证”能不能稳定完成。

评测环境也会影响结果。DeepSeek 在 7 月发布 V4 Flash 时说明,代码 Agent 的公开 benchmark 使用 DSH minimal mode,并给出了具体运行参数。模型、Harness、提示词、工具和运行参数都会影响最后的分数,模型名称本身说明不了全部。

API 侧有几项容易用错的地方:

  • V4 Pro 的模型版本是 DeepSeek-V4-Pro-0813,调用时使用 deepseek-v4-pro
  • V4 Flash 当前对应 DeepSeek-V4-Flash-0731,调用名仍是 deepseek-v4-flash
  • 两个模型都支持 1M 上下文 和最高 384K 输出
  • 两个模型都支持 Responses API、Chat Completions 和 Anthropic API。
  • 思考强度提供 lowhighmax 三档,简单任务不必每次都使用最高档。

DeepSeek-V4-Pro-0813 模型页

图:DeepSeek-V4-Pro-0813 模型页。模型版本标识与实际 API 调用名需要分开看。

https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813

这里容易混淆。模型页显示的是版本标识,代码里传入的仍然是 deepseek-v4-pro。正式版上线后,客户端不用改模型名,官方保留了原来的 API 调用方式。

三、Responses API:协议层补上了什么

这次发布还加入了 OpenAI Responses API,并针对 Codex 做了适配。用在 Agent 上时,客户端可以传入多轮历史,接收模型输出,再提交工具调用结果。

Responses API 仍然是无状态接口。多轮历史由客户端保存并重新传入;上下文窗口再大,也不会替客户端保存会话。会话保存、历史压缩和失败恢复,都要由上层运行时处理。

已有的 Chat Completions 和 Anthropic API 入口仍然可用。如果要接入 Codex,官方提供了一键配置脚本。Codex CLI、ChatGPT 桌面应用和 VS Code 扩展共用一份配置文件,脚本会先备份原有配置,再写入 DeepSeek 的模型目录和 provider 配置,也提供恢复入口。

这样可以少写一层协议适配代码。脚本仍会修改本地配置,运行前要确认备份位置、变更内容和回滚方式;接入后还要用自己的工具调用和长任务跑一遍。配置写入成功,只说明脚本执行完成。

四、价格:单价之外,还要算任务成本

2026 年 8 月 13 日,官方页面列出的现行价格如下。单位是每 100 万 token,输入又分为缓存命中和缓存未命中,输出单独计费。本文只列官方美元价格,不把第三方按汇率换算的数字混进来。

模型 缓存命中输入 缓存未命中输入 输出
deepseek-v4-flash $0.0028 $0.14 $0.28
deepseek-v4-pro $0.003625 $0.435 $0.87

这组价格会在 北京时间 2026 年 8 月 17 日 00:00 切换,对应官方时间是 8 月 16 日 16:00 UTC。新规则按 UTC 的 01:00–04:00 和 06:00–10:00 计高峰,换算成北京时间后,高峰时段是每天 09:00–12:00 和 14:00–18:00;其余时间为非高峰。

非高峰价格

模型 缓存命中输入 缓存未命中输入 输出
deepseek-v4-flash $0.007 $0.22 $0.66
deepseek-v4-pro $0.022 $0.66 $1.98

高峰价格

模型 缓存命中输入 缓存未命中输入 输出
deepseek-v4-flash $0.014 $0.44 $1.32
deepseek-v4-pro $0.044 $1.32 $3.96

价格提醒: 非高峰价是高峰价的一半,但仍高于 8 月 13 日的现行价。新规则把价格和调用时段绑在了一起。

实际账单还要看三个变量:

  1. 缓存命中要靠请求结构。 稳定的系统提示、工具定义和项目规则尽量放在前缀,变化频繁的用户输入和工具结果放后面。能否命中,还要用实际请求验证。
  2. 批处理任务可以安排到非高峰。 代码索引、离线评测、批量摘要有调度空间;交互式任务要照顾用户等待时间。
  3. 别只看输入单价。 Agent 多轮调用工具时,输出 token 和重试都会计费,思考强度也可能改变 token 消耗。单次调用便宜,任务跑长后,账单可能完全是另一种样子。

单价之外,还要算一个任务会跑多少轮。正式接入前,先拿自己的任务集测一遍:缓存命中率、工具调用成功率、修改后的测试通过率、平均延迟和单任务总成本。这些数字比宣传价更接近实际使用。

五、一次 Agent 任务,三层怎么配合

一次 Agent 任务通常会在模型决策、工具执行和验证之间来回几轮。会话日志把每一轮留下来,验证不通过时,系统才知道该继续、重试还是停住。

一次 Agent 任务执行流程

图:一次任务从模型决策到工具执行、验证和回查结果的简化流程。

具体到一次任务:V4 Pro 负责推理和选择下一步,Responses API 传递交互内容,DSH 负责调度、记录和恢复。

位置 主要职责 少了它会怎样
V4 Pro / V4 Flash 理解任务、推理、选择下一步工具 模型可能无法形成可靠的行动计划
Responses API 传递多轮输入、输出、工具调用和结果 客户端需要自行拼接协议,调用链容易断
DSH / Harness 管理 Loop、插件、会话事件、扩展和边界 长任务难以恢复,工具和状态难以审计

写 Agent benchmark 成绩时,模型名称还不够。还要交代使用了什么 Harness、哪些工具、怎样的提示词、什么思考强度,以及失败任务如何处理。少了这些信息,数字就很难复现。

六、把事实和猜测分开

发布后,社区很快出现了一些延伸解读。有人根据返回 fingerprint 从可读字符串变成哈希,猜测线上推理栈发生了切换;有人把 DSH 直接描述成要去挑战 Claude Code 或 Codex;还有人用单个项目的缓存命中率或成功率,推导某套 Harness 普遍更优。

这些内容可以拿来设计测试,暂时还不能写成 DeepSeek 的官方结论。表里分成三类:

类型 当前可以说到哪里
已确认事实 V4 Pro GA、API 模型名不变、Responses API 原生支持、价格切换时间、DSH 的开发者预览状态和插件式架构
个人判断 DSH 可能会成为 DeepSeek Agent 生态的重要运行时入口,但还要看版本稳定性、插件生态和真实任务结果
待验证线索 fingerprint 变化的原因、线上波动与发布的关系、DSH 与 Claude Code / Codex 的产品竞争关系

某个 Harness 在一组任务上表现很好,说明这套模型、工具、提示词和运行参数值得继续测。换到别的项目,结果未必一样。这类判断只能先当作假设,等版本和任务数据出来再验证。

七、现在适合怎么试

只是体验模型,直接调用 deepseek-v4-prodeepseek-v4-flash 就够了。要判断它能不能放进真实工作流,可以先挑一条有明确验收标准的任务。

任务 重点观察
只读代码检索 能不能找到正确文件、调用关系和证据位置
跨文件小改动 Diff 是否集中,测试是否真的通过
带工具循环的故障定位 遇到证据不足或权限不足时,能不能停下来

每次试跑至少记录模型版本、思考强度、缓存命中情况、工具调用次数、输入 / 输出 token、总耗时,以及最终的测试和验收结果。有了这些记录,模型变化和工具链、提示词、任务切分带来的影响才分得开。

模型调用跑通后,再试 DSH。先在本地预览版里看插件如何加载、会话事件如何记录、模型上下文如何从日志重建,再决定它是否适合放进自己的 Agent 平台。文件系统、子进程、网络访问和凭据边界要单独检查;要保留实验结果,就记录具体包版本,别把 npx 每次拉到的最新包当成固定依赖。

我的取舍: V4 Pro 先测,Responses API 可以接,DSH 先研究,不急着上生产。判断结果仍要落到自己的任务集和证据记录上。

写在最后

这次更新有三处变化:V4 Pro 提高了工具任务的模型上限,Responses API 提供了更适合 Agent 的交互方式,DSH 让开发者可以看到并调整插件、状态和扩展。

价格也给了一个很实际的提醒:Agent 的成本取决于模型单价,也取决于缓存前缀、任务调度、思考强度和工具循环。非高峰价格可以帮助调度,但不能替代测算。

进入生产前,先跑通一条小任务:调用依据能回查,权限或证据不足时会停住,结果还能由外部系统验证。模型还会更新,运行时和证据记录要先准备好。更多 DSH 与 V4 Pro 的讨论,也可以到云栈社区的技术论坛里参与。

官方资料

  • DeepSeek API 更新日志:DeepSeek-V4-Pro Update
  • DeepSeek API 模型与价格
  • DeepSeek Responses API 文档
  • DeepSeek Codex 接入文档
  • DeepSeek Harness 官方仓库
  • DeepSeek Harness 架构说明
  • DeepSeek Harness npm 包
  • DeepSeek 官方 X:V4 Pro 发布说明
  • DeepSeek 官方 X:API 价格调整
  • DeepSeek 官方 X:DSH 开发者预览版

价格和模型版本会继续变化,发布前请以 DeepSeek 官方页面为准。本文价格按 2026 年 8 月 13 日官方页面整理。




上一篇:Windows 跑 Linux 的 WSL2 到底怎么用?原理、安装和 Nginx 配置详解
下一篇:DeepSeek Harness 刚发布:一切皆插件,Node 服务 + Web 界面的 Agent 框架初体验
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-14 04:34 , Processed in 1.231026 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表