找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4670

积分

0

好友

608

主题
发表于 1 小时前 | 查看: 3| 回复: 0

Agent Harness(智能体运行框架)最近有点热,连 DeepSeek 都亲自下场做了 DeepSeek Harness。

DeepSeek Harness 开发者预览版界面

目前已有大量实用社区插件对外开放,覆盖界面增强、多智能体协作、浏览器自动化、多模型兼容、文件处理等场景。

依托开放插件生态,Harness 为开发者与技术爱好者提供可自由拼装的 Agent 底座。

当通用 Agent 与编程智能体陆续跑通落地场景,海量 Token 持续消耗已成常态。

现在头部大厂的 AI 实验室纷纷下场自研 Harness,Hermes、Pi、OMP、Prime Agent 等方案接连涌现,各家都想打造专属 Harness。这个赛道的竞争已经全面开启,Harness 也许是模型智商变成真金白银的最后一公里。

Composio(一家专做 AI Agent 工具的公司)做了一次实测,把同一个 DeepSeek V4 Flash,分别装进 8 个不同的 Harness,跑 30 个真实的多步骤任务,看谁又快又便宜。

在 Artificial Analysis 的评测里,DeepSeek V4 Flash 拿到 52 分,作为对照,目前顶级水平的 Opus 5 Max 是 63 分,分差不算大,但 V4 Flash 的成本只有它的几十分之一。

可惜这次评测里没有 DeepSeek Harness 的数据,主要是他们测试的时候,DeepSeek Harness 还没发布。

DeepSeek V4 Flash 在 4 个 Agent Harness 上的任务通过数、耗时与成本对比

DeepSeek V4 Flash 在另外 4 个 Harness 上的通过率、中位成本与耗时对比

Agent 动辄几十轮调用、频繁切换工具,模型单价贵一点点,账单就会被成倍放大,所以便宜的模型非常重要。

本次测试内容是 30 个高难度的工作流任务,全部用同一套 Composio MCP 工具,每个任务最多 900 秒完成。

任务要求 Agent 在真实 SaaS 应用之间跳转、操作数据,最终给出一个可以被独立验证的答案:

  • 同步 Google 表格花名册和 Google 日历:从表格里读取 40 场会话记录,用精确的会话 ID 找到对应的日历事件,把记录不对的改正确、把缺失的补上,同时不能碰到无关的事件和源表格。
  • 核对 GitHub issue 和 Linear 任务:找出所有带评估标签、且关联了 Linear 任务 ID 的 GitHub issue,验证每个 ID 在 Linear 里真实存在、且已完成,给出精确对应关系——两边系统都不许动。
  • 跨 Gmail、表格、Slack 同步工单:从 Gmail 找出符合条件的工单,原样记进 Google 表格台账,给每条记录回填账号信息,把最终统计发到指定 Slack 频道——期间诱饵工单和被排除的工单必须保持不动。

测试完成后的完整榜单如下:

8 个 Agent Harness 排名表:通过率与单次成功成本

通过率排名

Pi Agent 通过率最高,30 个任务完成 20 个,通过率 66.7%。

8 个 Harness 通过率条形图

其次是 Prime Agent,然后 OMP 排第三,之后是 Claude Code、Codex、DeepAgents、Hermes,OpenCode 垫底。

Token 消耗

Prime Agent 平均每个任务烧掉 140 万 token,一骑绝尘,妥妥的油老虎。

各 Harness 平均每任务 Token 消耗条形图

OMP 和 Claude Code 约 74.2 万 token,OpenCode 69.2 万,DeepAgents、Codex 66.5 万,Pi 只用了约 55.9 万,Hermes 最省,约 19.2 万。

耗时

Claude Code 中位耗时最短,122.7 秒。

各 Harness 中位完成耗时条形图

第二的是 OpenCode 129.7 秒,接下来是 Pi 132.2 秒、Hermes 175.5 秒、DeepAgents 187.1 秒、Prime Agent 和 Codex 都在 4 分钟左右,OMP 最慢,272.4 秒。

token 消耗量和耗时并不是简单的正相关:Claude Code 和 OMP 消耗的 token 差不多,都在 74 万左右,但 Claude Code 的完成时间只有 OMP 的不到一半。

耗时不只看 token 量,还包括工具调用、网络请求、重试、Harness 自身的处理逻辑。同样的活,几次大调用就能跑完,也可以拆成几百次连续的小调用、每次都等结果返回,耗时自然差出几倍。

速度快也不代表通过率高,Claude Code 最快,但 OMP 反而多做成了一个任务;OpenCode 速度和 Claude Code 差不多,通过率却是最低的。

成本

Claude Code 每个成功任务成本最高,需要 $0.195。它的 token 总消耗量和 Codex、OMP 差不多,但只有 1.5% 的 token 命中了缓存,而 Codex 约 70%、OMP 约 57% 都命中了缓存。

每个成功任务的平均 API 成本条形图

Claude Code 在 30 个任务上总共花了 3.12 美元,成功 16 个,平均每个任务 0.104 美元,摊到每个成功任务就是 0.195 美元。

Pi 的成本最低,每个成功任务只要 $0.028;DeepAgents $0.045、Hermes $0.056、OpenCode $0.073、Codex $0.081、OMP $0.103、Prime Agent $0.131。

缓存命中率

Claude Code、OMP、Codex 缓存命中率对比

  • 求又稳又省,看 Pi Agent(通过率最高 + 成本最低)和 DeepAgents。
  • 在意速度、预算不敏感,选 Claude Code,但提前接受它的高账单。
  • 任务极度吃上下文,慎选 Prime Agent(140 万 token / 350 万会话警告)。
  • 预算敏感、不介意多等,Hermes 最省 token,值得一试。

可以预见,未来企业评估 Harness,会像今天评估模型一样认真,看 token 消耗、完成时间、总成本、单次成功成本这几本经济账。

同一个任务,选对模型 + Harness 的组合,这四本账都可能差出一个数量级。

如果你也在做 Agent 选型,欢迎来 云栈社区 分享你的实测数据。

参考: https://composio.dev/content/best-agent-harness-deepseek-v4-flash




上一篇:I2C 与 RS485 同为两根线,为何调试思路完全不同?
下一篇:诺基亚杭州研发中心将关闭,5G业务萎缩裁员1600人
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-18 05:51 , Processed in 1.106314 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表