找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4281

积分

0

好友

555

主题
发表于 3 小时前 | 查看: 5| 回复: 0

个人 AI Agent 正在从一次性工具转变为持续服务的助手。它们能跨会话读取消息、操作工作空间、调用工具,并逐步积累记忆、技能文件和任务历史。然而,问题在于,保存过往经验并不等同于"未来做得更好":Agent 可能记错内容、取回无关信息、沿用脆弱流程,或把已经过时的状态带入新任务。

这使得"Agent 是否具备自我改进能力"很难判定。后续任务得分的提升,原因可能在于基础模型本身能力更强,也可能来自运行时配置、Prompt、任务难度,甚至是评分噪声;仅看最终分数,无法确认增益是否真的由跨会话积累的经验所致。

为应对这些挑战,普林斯顿大学王梦迪教授团队提出了一个面向个人 Agent 的性能归因基准——PAST-Bench,旨在检验保留下来的经验是否真正改进了后续行为。

PAST-Bench 论文标题与作者信息

论文链接:https://arxiv.org/abs/2608.04003

不同于以往基准的单次任务打分,PAST-Bench 的评估单元是 Agent 在一个任务族中的完整轨迹:早期会话给 Agent 创造保存可复用经验的机会,后期会话检验这些经验是否真的被使用,而匹配设计的对照会话则关闭持久化能力,实现在"有记忆"和"无记忆"两种情况下的直接对比。

PAST-Bench 实验设计框架流程图

图|PAST-Bench 概述

在 7 个基础模型和 4 个 agent 框架上的测试显示,改进是真实存在的,但在不同能力维度上并不均衡;即便两个 agent 有相同的整体改进幅度,它们在改进是否有预期路径支撑这一点上也可能差异明显。

基于这些发现,他们开发了 Hermes+,在 Hermes 的基础上针对 agent 循环的各阶段增加了 5 项有针对性的改进。Hermes+ 提高了由保留经验带来的平均改进幅度,提供了更清晰的路径证据,在需要替换过时状态的任务上改进最为明显,但效果仍与具体能力和模型相关。

研究团队表示,PAST-Bench 与 Hermes+ 为研究"持久化 agent 如何从保留经验发展到系统性地通过经验实现改进"提供了评估与诊断基础。

将 Agent 自进化拆解为 4 类能力

PAST-Bench 覆盖 26 个场景、204 个任务回合,将个人 Agent 的在线自我进化拆分为"记忆"、"流程复用"、"信息搜集"和"更新"四类能力。

PAST-Bench 四类能力场景分布环形图

其中,每一类能力都对应跨会话学习链条中的一个关键环节。如下:

1. Memory(记忆):记住并应用用户事实

Memory 场景测试 Agent 能否保存并查找日常交互中的声明性信息,如用户偏好、约束条件、例外规则和过去的决策。

在学习 Episode 中,Agent 会接触一条只需要读取、通常不会被修改的规则。后续评估 Episode 会删除原始提示中的触发词,要求 Agent 根据持久化状态完成任务。

因此,这类测试不是简单地判断 Agent 是否见过某句话,而是判断它能否完成"保存、查找、应用"这一完整流程。

2. Procedural Reuse(流程复用):重新执行多步骤流程

Procedural Reuse 面向更复杂的专业任务。测试对象不是一个需要查找的事实,而是一套需要按照顺序执行的技术流程。

场景可以对应标准操作流程、构建和部署流水线、故障排查流程或工程任务中的多步骤操作。评估时,Agent 不仅要找到过去的流程,还必须正确执行步骤,并使用合适的工具。

步骤顺序错误、跳过关键步骤或调用了错误工具,都会被判定为失败。由此,PAST-Bench 将"一次性解决问题"和"形成可复用程序"区分开来。

3. Information Gathering(信息搜集):知道什么时候应该检索

Information Gathering 测试的重点不是 Agent 是否保存了资料,而是它能否在噪声环境中主动查询已有信息。

在这类任务开始前,相关参考资料已经被预置到长期 Memory、注册技能、索引后的会话记录或其他持久化位置。用户后续提出的问题不会直接包含答案,但会提供一个需要调用既有资料的任务环境。

同时,任务中会植入一个看似合理但实际上错误的通用默认答案。Agent 如果直接依赖当前上下文或默认知识,就可能得到 "plausible-but-wrong" 的结果。只有在正确时机访问持久化渠道,才能完成任务。

4. Update(更新):让新信息覆盖旧信息

Update 测试的是 Agent 能否用第二次写入的权威信息覆盖第一次写入的旧状态。

任务通常先提供一个旧事实、过时规则、临时例外或旧版 SOP。随后,用户给出新的权威修正。之后的 Episode 会检查 Agent 是否使用新状态,并且不再泄漏旧内容。

这一能力尤其重要。现实中的个人 Agent 不只是不断添加信息,还必须处理事实纠正、规则迁移、临时例外失效和流程修补。如果旧状态与新状态同时存在,Agent 可能检索到过时信息,最终给出已经被用户纠正的答案。

发现问题:改进是真的,但并不均匀

据论文描述,该研究系统测试的核心指标是自我进化差值 Δ,即"允许使用持久化状态"和"不允许使用"两种条件下的任务得分差。几个发现值得关注:

第一,几乎所有模型都能从持久化经验中获益,但获益方式因模型而异。 在固定 agent 框架为 Hermes、切换基础模型的条件下,整体 Δ 值介于 +0.13 至 +0.24 之间,表明保留经验具有普遍效用。然而,各模型"改进最显著的维度"存在明显差异:GPT-5.4 的改进较为均匀地分布于记忆与更新两类任务;GLM-5.1 近半数改进集中于"更新"能力;Kimi K2.6 则近半数改进集中于"记忆"能力。换言之,模型本身的优势领域,往往也是保留经验令其获益最多之处。

基础模型在 PAST-Bench 上的性能对比表

第二,相同的"改进幅度"背后,可能对应完全不同的机制路径。 他们提出了"机制证据分数"(Mechanism-Evidence Score),用来检验 agent 的进步是否确实遵循"存储-检索-应用"这一预期路径,而不是以偏离预期的方式获得正确答案。结果显示,Hermes 与 nanobot 两个 agent 框架取得了完全相同的任务分数改进(Δ = +0.13),但机制证据分数却存在明显差异(0.64 对 0.57),nanobot 的改进更多源于单一能力维度,缺少"写入后被检索调用"这一连贯证据链条的支撑。如果仅考察最终得分,是无法察觉这一差异的。

不同 Agent 框架的自我进化差值对比表

第三,不同 agent 框架各自呈现出明显的能力偏向。 他们进一步固定模型、切换框架进行对比,发现 ZeroClaw 在记忆能力上改进显著,但在流程复用能力上出现退步;nanobot 的改进几乎全部集中于"更新"能力,记忆能力则几无改进;Agent-Zero 甚至在 4 项能力中有 3 项出现退步。相比之下,Hermes 是基线框架中唯一在 4 项能力上均实现正向改进的框架,这也是他们选择将其作为后续改进对象的原因。

解决问题:构建 Hermes+

PAST-Bench 把"Agent 没有学会"进一步拆成具体的运行时故障。研究团队在检查低增益和不均匀增益的执行轨迹后,将问题归纳为以下 5 类:

  • Agent 制定计划前没有查询已保存状态;
  • 保存的事实缺少清晰结构,难以在新会话中复用;
  • 已解决的流程停留在对话文本中,没有成为可执行 Skill;
  • Agent 在行动前跳过了已有证据;
  • 修正后的状态没有可靠地覆盖旧状态。

针对这些问题,Hermes+ 在 Agent 循环的 5 个阶段加入了对应机制,分别对应 Plan、Render、Route、Gate 和 Close 五个阶段。

Hermes+ 系统架构与运行时插入点

图|Hermes+ 中的运行时插入点

选择 Hermes 作为改造对象,原因在于它在该实验集合中能够暴露 Agent 循环,又没有预先固化一套持久化栈,因此适合逐机制进行消融分析。其他框架则作为现成基线参与比较。

Hermes+ 的设计目标不是简单扩大记忆容量,而是让持久化经验在 Agent 循环的不同阶段更可控地参与决策。研究团队尤其关心两类问题:已有经验是否被送到了恰当的处理环节,以及任务结束后产生的新经验是否被以可复用、可修订的方式收束下来。

结果显示,5 项机制在 Update 能力上呈现出超加性组合效果:整体 Δ 达到 +0.24,高于任一单独机制的收益,其中仅 closeout 为 +0.16,仅 retrieval gate 为 +0.06。这一结果提示,处理陈旧状态并非单一读写动作,而可能依赖多个环节协同。

不足与未来方向

当然,这项研究也存在一些局限性。

研究团队表示,PAST-Bench 仍是一个初始研究。现有任务族由合成场景构建,评估环境也相对封闭。后续版本应纳入人工撰写及真实交互产生的场景,延长任务序列,并考察某一任务族中积累的经验对其他任务族行为的影响。只有这样,才能进一步检验 agent 能否在更长时间跨度内维持有用状态,并避免不同记忆、流程与修正机制之间产生相互干扰。

同时,能力范围也有待拓宽。现有 4 类能力覆盖了在线自我进化的基础,但并没有触及更强的递归改进形式。研究团队表示,未来可进一步考察 agent 能否习得此前不具备的工具使用策略、构建并修订长程计划、在多个 agent 之间协调经验,以及改进自己决定"存什么、取什么、验证什么、更新什么"的机制。

另外,在归因层面,现有 Mech 分数衡量的是轨迹与预期路径的一致性,而不能证明某个持久化产物在因果上不可缺少。更严格的评估可以引入反事实干预:删除、替换或破坏候选产物,再观察行为变化。研究团队希望支持多条语义等价的持久化路径,因为相同经验可能被编码为记忆、技能、结构化产物或修订后的策略。

此外,能力和模型之间的差异意味着,持久化机制不能被视作可以均匀叠加的组件。未来的 agent 或许需要在记忆、技能和会话历史之间动态路由经验,并识别这些载体间的冲突、冗余与陈旧状态。只有在准确率、延迟和 token 成本的约束下发展这类机制,才可能让个人 Agent 从"能够保存经验"逐步走向"能够系统性地因经验而改进"。

更多技术细节,详见原论文。如果你对 AI Agent 的评估与进化机制感兴趣,欢迎在 云栈社区 与更多开发者交流讨论。




上一篇:达马西奥:ChatGPT算力再强,也生不出意识
下一篇:Science:斯坦福生成式AI首次设计完整噬菌体基因组,可存活能抑菌
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-15 06:55 , Processed in 1.470302 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表