过去,LlamaFactory 让每个人都能微调大模型;现在,PenguinHarness 希望让每个人都能构建自进化 Agent。这个工具在 云栈社区 引发了不小的讨论——大家突然发现,“让 Agent 自己写 Agent”不再是个噱头。

PenguinHarness 是全球首个支持多 Agent 自进化的 Harness:
让 Agent 自动构建 Agent
LlamaFactory 的作者郑耀威最近开源了一个新项目,名字叫 PenguinHarness。这个「企鹅驾驭师」能帮你自动完成 Agent 的构建、评测和持续改进,真正将我们从“手动调优 Agent”带入“Agent 自我迭代”的时代。
PenguinHarness 是一个原生支持自我进化的 Agent Harness,主打轻量、开源、易用。基于自研的 Agent 内核,无论是 GPT-5.6 还是 DeepSeek V4,这套框架都能稳稳驾驭。项目的初衷与 2026 年讨论得热火朝天的 AI4AI、递归自我进化(RSI)等方向不谋而合。
Meta 前研究总监田渊栋创立的 Recursive 公司,正着力探索 AI 递归自我改进的潜力,其首篇博客已证明 Agent 可以训练模型、优化 GPU 算子。MSRA 前副院长边江创立的 XYZ AI Lab,也成功探索出通过运作数百个 Agent 完成 Deep Research 模型后训练的路径。而 PenguinHarness 的志向,是做成最好用的开源 Harness,让 Agent 自进化开箱即用,告别手动调参的繁琐。
它的第一项能力 —— 让 Agent 自动构建另一个 Agent。用一个最经典的案例来对比 PenguinHarness 和 OpenAI Codex 的实际表现:「让 AI 生成一个 RAG 应用,实现分块检索,流式返回通俗易懂的答案,并带上引用」。通过演示视频可以清晰看出,PenguinHarness 不仅花费比 Codex 更少的时间和仅为其数十分之一的成本,还产出了几乎能直接落地的 RAG Agent 应用。左边回答语言通顺,有流式输出,还有来源引用,而 Codex 的结果则中英混杂,缺失了流式输出。
过去,开发这样一套 Agent 应用需要框架选型、模型部署、接入工具、编写提示词、反复测试修改,每个应用都几乎从零开始,花费一个团队几个星期的精力。即便有了 Claude Code 这类开发工具,它们对现有的 Agent 框架也比较陌生,很难做到像开发前端网页那么容易。而 PenguinHarness 从诞生之日起,就为自己设计好了一切选项。你只需要说清楚需求,它立即就能开干:生成脚手架、Prompt,安装和优化 Skill,并搭建前端,直到把一个完整能跑的 Agent 应用交付给你。而这套流程,只需要花费 0.2 元的 Token 和一杯咖啡的时间。
郑耀威也为我们揭开了 PenguinHarness 的背后原理:它将文件系统作为唯一真相来源,Agent 是文件,提示词是文件,对话历史也是文件。文件是人与 Agent 最自然的协作方式。框架只负责把文件拼装成可运行的 Agent 对象,而构造一个新的 Agent 无外乎文件的复制粘贴。在运行时,PenguinMessage 作为唯一的消息协议,像网络数据报文一样在模型、环境和用户之间交换。这种统一且轻量的接口让 PenguinHarness 可以轻松接入到任意代码中。PenguinHarness 既是一个 Agent 框架,又是一个 Agent 实体,没有人比它更懂自己。

本地可复现的 Agent 自进化闭环
让 Agent 构建 Agent 只是 PenguinHarness 的第一步,它更长远的目标,是让每个人都能在本地拥有自进化 Agent。构建 Agent 是从 0 到 1,优化 Agent 是从 1 到 100,其中需要跨越许多挑战。
「Changing agents is easy; improving them is hard.」
在一次关于自进化的讨论中,郑耀威曾提出这样的观点:Agent 本质上就是一堆代码和文件,修改它很容易,让它变好却极难。大模型本就是自带随机性的概率函数,Agent 则更是一个充满不确定性的自主系统。要做好 Agent 自进化,必须要有一把可靠的「尺子」,也就是评估系统。ReAct 论文作者姚顺雨曾言,评估是大模型的下半场。对于 Agent 自进化,这句话同样成立,一套好的评估基准是自进化的根本。
为了探索准确的评估方式,郑耀威带领团队花了半年多时间。最大的障碍是,现有的评估大多只有测试集,没有训练集。如果在测试集上跑自进化,很难区分 Agent 到底是背会了答案,还是真正产生了进化。为此,团队亲手打造了一套新的评估基准 ——GDPevo,专门用于测试 Agent 自进化能力,覆盖医疗、金融、法律等六大真实场景。通过划分训练 / 测试集,确保 Agent 进化时不会「偷看答案」。

PenguinHarness 吸纳了 GDPevo 的核心思想,把 Agent 的评估和优化凝练成了开箱即用的 Skills。调用 Skill 后,PenguinHarness 会启动多个智能体,协同完成 Agent 的调优流程,也就是「自进化」。
试想这样一个场景:你想做一个 Agent 来更准确地预测球赛、提出投资策略或处理电商售后,但它一开始的准确率并不高。过去,你需要手动调整提示词、搭建工作流来提高精度。而现在,PenguinHarness 可以自动搞定这一切。通过演示视频可以看到,PenguinHarness 经过多次迭代,Agent 的分数从优化前的 53 分,提升到了优化后的 95 分。使用 DeepSeek V4 Flash 正式版,整个过程只花了 0.5 元的 Token。
这背后是一套多智能体的协作流程。PenguinHarness 首先生成一个负责出题的 Benchmark Builder,围绕目标能力生成一系列题目和答案对,通过反复测试来校准题目难度。进入优化阶段后,三个承担不同角色的 Agents 会组成一个自进化闭环,反复进行下面四步过程:
- 组织评测:Optimizer Agent 按照题目数量和运行次数,组织多个 Evaluator Agents 并行评测。
- 独立打分:每个 Evaluator Agent 启动一个独立的被测 Agent 解答题目,并根据只有 Evaluator 才能看到的 Rubrics 打分,将分数返回给 Optimizer Agent。
- 分析优化:Optimizer Agent 汇总评测结果,查看和分析轨迹,定位失分原因,修改被测 Agent 的提示词、Skill 或配置,生成候选的下一版被测 Agent。
- 验证迭代:Evaluator Agent 对候选版本重新评测,Optimizer Agent 根据结果决定是否接受,再进入下一轮迭代。
整个过程如下图所示。只有在候选版本取得严格更高的分数时才会被接受,如果得分持平或下降,Optimizer Agent 会回退到上一个版本。

从一次性交付走向持续进化,这就是 PenguinHarness 对下一代 Agent Harness 给出的回答。
和自进化 Agent 之间的契约
为了让 Agent 自进化跑得更“稳”,PenguinHarness 设计了一套框架必须遵守的“契约”。这份契约规定了 Agent 自进化的边界在哪里,我们挑几个重点来说。
- 限定 Agent 的修改范围为提示词和 Skills,不能触及 Harness 内核。这是为了防止 Agent 在进化中产生安全风险,比如破坏原有的权限审计规则。好的 Agent 建立在安全之上。
- Agent 自进化必须具备快照和回滚能力。如果产生了负面作用,框架要有能力将 Agent 版本一键回退。
- 目标 Agent 在进化过程中只能看到题目,不能看到 Rubrics。这能防止 Agent 走捷径,通过背答案或迎合打分器来获取高分,也就是防止 Reward Hacking 现象。
- 所有优化流程都要形成文件记录,用户有权限去审计优化过程,保障自进化的可解释性。
这套契约也被 PenguinHarness 形式化为了一份 CONTRACT.md 文件,方便复制和分发。

PenguinHarness 的其他有趣特性
团队在探索 Agent 自动构建范式的同时,也给 PenguinHarness 安装了一系列很有意思的能力。
首先,PenguinHarness 内置了 LlamaFactory、vLLM、Ollama 等与模型训练、部署相关的 Skills。你可以像进行 Vibe Coding 一样,用自然语言尝试启动模型训练和部署。

其次,PenguinHarness 集成了统一的模型网关,支持接入 1000 多种在线与本地模型,与 Kimi K3、Gemini 3.6、Ling 3.0 Flash 等最新模型都完成了适配。

此外,PenguinHarness 还为 DeepSeek 装上了“眼睛”。你可以配置一个带视觉模态的代理模型,实现 DeepSeek 为主驾驶、视觉代理模型为副驾驶的开发模式,让 DeepSeek 也能“看到”自己生成的网页和 PPT,再基于视觉反馈进行调整。

不仅如此,PenguinHarness 还支持细粒度的行为轨迹分析,通过观察时间线,一眼就能看出 Agent 的性能卡点在哪里。

你也可以将 PenguinHarness 作为类似 Pi Agent 一样的空白 Agent 样板来使用。其内置 Agent 保持了极简设计,将 Shell 作为通用接口,用极少的工具完成任务。它还对 Subagent 等核心功能进行了深度优化,系统提示词仅有 Claude Code 的十分之一(1,300 vs 15,000)。在严谨的评估基准上,PenguinHarness 配合 DeepSeek 模型做到了最好的表现,而成本只有其他产品的数十分之一。

PenguinHarness 的表现不止于纸面。在开发过程中,团队已将其实际部署到两个生产场景中。某体检机构用 PenguinHarness 生成了能力媲美医学专家的报告核查 Agent,过去一份需要 30 分钟才能核查完的报告,现在只需几十秒。某制造企业将 PenguinHarness 构建的多个 Agents 应用到流水线作业巡检上,全天候盯着设备状态并自动恢复,产线停机时间减少 65%,产出提升近 2 倍。
PenguinHarness 以 Apache 2.0 协议开源,支持 Linux、Mac、Windows 系统一键安装。既可以部署到本地,也可以放到服务器上远程通过浏览器访问。它支持多用户隔离和团队协同,既能作为 Agent 自动构建平台,也能当做 Codex 的本地平替,以更低成本完成任务。期待这个 开源实战 项目得到更多关注,孵化出各种有趣的 Agent 应用。
PenguinHarness 背后的团队
PenguinHarness 由 PrismShadow 团队开源,团队成立于 2025 年,专注于打造能在真实业务中持续学习的 Agent 基础平台,让企业知识、工作流程和业务反馈转化为可部署、可评测、可持续优化的 Agent。
创始团队成员包括:
- 郑耀威:LlamaFactory 开源框架作者,GitHub 7 万星标,专注于打造更易用的模型与 Agent 基础设施。
- 钱步月:加州大学戴维斯分校博士,曾任 IBM TJ Watson 高级研究员、复旦大学教授与博导。
- 吴雪军:前百度 NLP 部门创始成员,曾任阿里巴巴高级总监和京东数科副总裁。
- 胡俊豪:北京大学博士生,提出位置无关缓存,曾参与 MiMo V2、Hy3 系列模型的研发。
- 陈溪:美国纽约大学商学院教授,卡耐基梅隆大学博士,曾任亚马逊首席科学家。
从 LlamaFactory 到 PenguinHarness,团队始终坚持的使命是:将复杂的 AI 能力,变成真正易用、可靠且高效的 大众化工具。