Agent Harness(智能体运行框架)最近有点热,连 DeepSeek 都亲自下场做了 DeepSeek Harness。

目前已有大量实用社区插件对外开放,覆盖界面增强、多智能体协作、浏览器自动化、多模型兼容、文件处理等场景。
依托开放插件生态,Harness 为开发者与技术爱好者提供可自由拼装的 Agent 底座。
当通用 Agent 与编程智能体陆续跑通落地场景,海量 Token 持续消耗已成常态。
现在头部大厂的 AI 实验室纷纷下场自研 Harness,Hermes、Pi、OMP、Prime Agent 等方案接连涌现,各家都想打造专属 Harness。这个赛道的竞争已经全面开启,Harness 也许是模型智商变成真金白银的最后一公里。
Composio(一家专做 AI Agent 工具的公司)做了一次实测,把同一个 DeepSeek V4 Flash,分别装进 8 个不同的 Harness,跑 30 个真实的多步骤任务,看谁又快又便宜。
在 Artificial Analysis 的评测里,DeepSeek V4 Flash 拿到 52 分,作为对照,目前顶级水平的 Opus 5 Max 是 63 分,分差不算大,但 V4 Flash 的成本只有它的几十分之一。
可惜这次评测里没有 DeepSeek Harness 的数据,主要是他们测试的时候,DeepSeek Harness 还没发布。


Agent 动辄几十轮调用、频繁切换工具,模型单价贵一点点,账单就会被成倍放大,所以便宜的模型非常重要。
本次测试内容是 30 个高难度的工作流任务,全部用同一套 Composio MCP 工具,每个任务最多 900 秒完成。
任务要求 Agent 在真实 SaaS 应用之间跳转、操作数据,最终给出一个可以被独立验证的答案:
- 同步 Google 表格花名册和 Google 日历:从表格里读取 40 场会话记录,用精确的会话 ID 找到对应的日历事件,把记录不对的改正确、把缺失的补上,同时不能碰到无关的事件和源表格。
- 核对 GitHub issue 和 Linear 任务:找出所有带评估标签、且关联了 Linear 任务 ID 的 GitHub issue,验证每个 ID 在 Linear 里真实存在、且已完成,给出精确对应关系——两边系统都不许动。
- 跨 Gmail、表格、Slack 同步工单:从 Gmail 找出符合条件的工单,原样记进 Google 表格台账,给每条记录回填账号信息,把最终统计发到指定 Slack 频道——期间诱饵工单和被排除的工单必须保持不动。
测试完成后的完整榜单如下:

通过率排名
Pi Agent 通过率最高,30 个任务完成 20 个,通过率 66.7%。

其次是 Prime Agent,然后 OMP 排第三,之后是 Claude Code、Codex、DeepAgents、Hermes,OpenCode 垫底。
Token 消耗
Prime Agent 平均每个任务烧掉 140 万 token,一骑绝尘,妥妥的油老虎。

OMP 和 Claude Code 约 74.2 万 token,OpenCode 69.2 万,DeepAgents、Codex 66.5 万,Pi 只用了约 55.9 万,Hermes 最省,约 19.2 万。
耗时
Claude Code 中位耗时最短,122.7 秒。

第二的是 OpenCode 129.7 秒,接下来是 Pi 132.2 秒、Hermes 175.5 秒、DeepAgents 187.1 秒、Prime Agent 和 Codex 都在 4 分钟左右,OMP 最慢,272.4 秒。
token 消耗量和耗时并不是简单的正相关:Claude Code 和 OMP 消耗的 token 差不多,都在 74 万左右,但 Claude Code 的完成时间只有 OMP 的不到一半。
耗时不只看 token 量,还包括工具调用、网络请求、重试、Harness 自身的处理逻辑。同样的活,几次大调用就能跑完,也可以拆成几百次连续的小调用、每次都等结果返回,耗时自然差出几倍。
速度快也不代表通过率高,Claude Code 最快,但 OMP 反而多做成了一个任务;OpenCode 速度和 Claude Code 差不多,通过率却是最低的。
成本
Claude Code 每个成功任务成本最高,需要 $0.195。它的 token 总消耗量和 Codex、OMP 差不多,但只有 1.5% 的 token 命中了缓存,而 Codex 约 70%、OMP 约 57% 都命中了缓存。

Claude Code 在 30 个任务上总共花了 3.12 美元,成功 16 个,平均每个任务 0.104 美元,摊到每个成功任务就是 0.195 美元。
Pi 的成本最低,每个成功任务只要 $0.028;DeepAgents $0.045、Hermes $0.056、OpenCode $0.073、Codex $0.081、OMP $0.103、Prime Agent $0.131。
缓存命中率

- 求又稳又省,看 Pi Agent(通过率最高 + 成本最低)和 DeepAgents。
- 在意速度、预算不敏感,选 Claude Code,但提前接受它的高账单。
- 任务极度吃上下文,慎选 Prime Agent(140 万 token / 350 万会话警告)。
- 预算敏感、不介意多等,Hermes 最省 token,值得一试。
可以预见,未来企业评估 Harness,会像今天评估模型一样认真,看 token 消耗、完成时间、总成本、单次成功成本这几本经济账。
同一个任务,选对模型 + Harness 的组合,这四本账都可能差出一个数量级。
如果你也在做 Agent 选型,欢迎来 云栈社区 分享你的实测数据。
参考: https://composio.dev/content/best-agent-harness-deepseek-v4-flash