打开编辑器,把报错粘进对话框,等待模型吐出一段代码,复制粘贴回编辑器运行之后,大多情况下又会迎来新一轮报错,再把新报错贴回去,接着等。
某个周五下午,我在这个循环里坐了两个小时,忽然想明白一件事:尽管大家将其称作 AI 助手,但实际却是人在充当人肉 CI/CD,由 AI 负责代码撰写,人承担部署、测试、日志回传的全部工作,整套流程反复循环。
这样的分工模式并不合理,因此我们开展了本次实验:把一个完整的小项目整包交出去,从一句需求到能跑的成品,人不插手,只做一件事——验收。接单的是 openJiuwen 的蜂群智能体 WorkSwarm。
openJiuwen 是由华为 2012 实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业等广大开发者联合构建的开源 AI Agent 平台。近日,openJiuwen 发布了首个开源智能体资产平台 Agentic Hub,沉淀了技能、连接器、插件、专家和专家团五类 Agent 资产,并且已经集成到 WorkSwarm,开发者可以在平台内上传、下载、分享各类经验资产,共建共享 Agent 生态。本次评测,我们使用的是 WorkSwarm Code‑集群模式。
近两年,各编程助手从代码补全走向 Agent,能力边界一直在往外扩。但 WorkSwarm 走的是另一条路:它不长在编辑器里,服务的不仅仅是“正在写代码的人”,更是“手里只有需求的人”——坐在你对面,接下整个需求,返回可运行的成品,相当于一支按单雇佣的开发团队。

实验设计:两本账
先交代背景:WorkSwarm 官网把集群模式的能力写得明明白白,“自动组建 Agent 团队”、“多 Agent 自主分工、动态协商、高效协作”。换句话说,能交付、能分工,是印在产品宣传页上的基础能力,轮不到本文立什么“预设判断”去替它验证。但宣传页和真金白银跑一单,终究是两回事。所以动手之前不立判断,只开两本账,全程记录、结束时一起算:
- 介入账:整包交出去之后,人到底要在场到什么程度——什么时机介入、为什么介入、介入多久;
- 并行账:Leader 拆单之后,多只 Teammate 是不是真的同时开工,而不是一只智能体换着帽子串行模仿。
环境与基线
安装过程比较快捷,进入官网可直接一键下载安装。安装完成之后是一个桌面客户端,里面分两种空间:工作空间像综合办公室,什么任务都能丢进去;Code 空间专为写代码准备,按项目组织,自带 Git 状态和用量统计。两种空间都能选调度模式——单兵模式,一个智能体从头干到尾;集群模式,一只 Leader 领着一群 Teammate 分头干活。从这节起口径统一:集群模式一律简称蜂群,单 Agent 模式一律简称单兵。
实验全程录屏,关键数据截图存档;想自己复现一遍的读者,请前往文末附一获取入口。
实验一:整项目交付
WorkSwarm 针对办公与编程构建了统一工作台,此次实践我们采用 Code 模式。

第一组实验仅输入单条需求:
在 Windows 上做个在线双人五子棋对战平台:支持用户注册然后登录进入游戏大厅,匹配上对手自动进游戏房间,两人轮流在棋盘上落子,先连成五颗的赢,赢了涨分输了扣分,中途掉线判负,最好还能在房间里聊天,页面要做得好看。
这句需求发出去之后,我只读代码、只提评审意见,不动手改;哪次没忍住插了手,当场记一笔“介入”——什么时机、什么原因、动了多久。这份记录会贯穿全部实验,用来回答一个问题:人到底需要在场到什么程度。
为什么选联机小游戏当考题,是有讲究的
数据库要不要上、框架引不引,前端拿什么写页面,全得它自己拍板;拍完板,前后端还得靠一份共用接口协议协作,大厅在线列表、匹配队列、房间棋局三处状态、两条 WebSocket 长连接都挂在上面,错一个字段两边就串台;再加上天然多文件、多模块,最考验分工的本事;规模又小,一轮实测能跑完全部实验。
下面会从四个观察维度分别展开说明。
需求理解:一句没问,全自己扛
从需求发出到团队注册完成、建群开工,这一路全是 WorkSwarm 自主分析、自主确定:网页客户端还是桌面窗口、棋盘多大、谁执先手、匹配怎么配、积分怎么算、断线怎么判、聊天要不要设限、密码怎么存——全都没问;技术栈也是自己定的:
- Node.js 22 用内置
node:http 起服务(不引 express)
ws 作唯一第三方依赖、node:sqlite 单文件数据库(启动挂 --experimental-sqlite)
scrypt 加随机盐存密码、原生 HTML/CSS/JS 四个页面配 jQuery
- 玩法细节同样自定:15×15 棋盘、白棋(先入房者)先手、按积分三档匹配(<2000 / 2000–2999 / ≥3000)
- 胜 +30 负 −30 允许负分、掉线判负对方不战而胜、聊天 512 字上限加敏感词过滤。
定得都在理。我只需要一句需求,整体框架就确定好了——“整包外包”四个字,从这里开始坐实。

架构:活拆三摊,两只 Teammate 各领一头
一句需求进去,Leader 先拆单:方案拆成会话与联机协议、游戏核心与页面、集成联调与交付三摊活,队只组了两只——后端工程师 @backend-dev-1 和网页前端工程师 @frontend-dev-1,各领一头。
@backend-dev-1 管“连得上、算得清”:/reg、/login、/info 三个 HTTP 接口,Cookie SSID 会话,/hall 与 /room 两条 WebSocket 长连接,同账号顶号接管;服务端一侧的匹配队列、15×15 回合制落子、四方向五连珠判胜、房间聊天也都在它手里。
@frontend-dev-1 管“看得见、点得动”:登录/注册/大厅/对战四个页面,页面上每一次在线列表刷新、进房、落子、聊天,都挂在 @backend-dev-1 定下的接口和长连接上取数。
- 第三摊活——集成联调与最终交付——Leader 留给了自己:两只 Teammate 交活之后,由它把前后端对齐、从头到尾对打一遍,交出一份 46 项断言(即 46 条逐项核对的检查点)的端到端测试,打包收卷。
- 这套分工全程摊在前端界面上:每只 Teammate 领了什么活、执行到哪一步、彼此之间说了什么,都直接可见——谁在等谁的接口、谁先交的活,一目了然。对一个小项目来说,这些过程里的往来恰恰是最值得看的地方。

过程账单:零求助的一单

实验过程中,录屏里可以看到智能体出现错误并且自行完成多处修复,但站在使用者视角全程没有收到一次报错求助。
成品:npm start 起服务,开浏览器就能玩
先看交付的工程目录,干净得像教程示例:
web_gobang/
├─ server.js # 后端单文件 783 行:HTTP 接口 + WebSocket + 判胜
├─ package.json # 唯一第三方依赖 ws
├─ README.md # 七个小节:功能清单、技术栈、启动步骤、协议简表…
├─ test/e2e.js # 端到端测试:212 行、46 项断言
└─ wwwroot/ # 四个页面:登录、注册、大厅、对战
不用安装,两步开玩:npm start,浏览器打开 localhost:9000。验收就是打了一局:正常窗口注册账号 A,无痕窗口注册账号 B,两边都点“开始匹配”,双双自动进同一房间,白棋先落子。这一局把规则全摸了一遍,回合外落子被拒、四方向五连判胜、积分结算 1000 变 1030/970、对局中一方关页面判对方不战而胜、聊天往返、同账号新连接顶掉旧连接,全部符合预期。对照最初那句需求:核心功能全齐;需求没提的断线重连没做,掉线即判负,规则闭环自洽,不做合理。
还有一段插曲,说的是它怎么消化我的误操作。验收时我按上一单的肌肉记忆,进目录直接敲 node server.js,当场崩掉——Node 22 的 node:sqlite 是实验特性,必须挂 --experimental-sqlite 标志才能起服务。我把报错原样甩回会话(“node server.js 直接跑不起来”),它转头就把标志位封进 npm start 一键启动脚本,README 快速开始同步更新;我又嘟囔了一句“第二个人怎么进局”,README 里随即多了一节手把手的“双开浏览器对战演示”。一次误操作、两句随口抱怨,换回来两件顺手的交付物,你丢给它什么,它都当需求消化掉。
实验二:干扰测试
第二单我们不换项目,在五子棋上续作:加三局两胜和积分排行榜。三项干扰埋在这一单和它的续单里,一项一项来,每项前后的轮次、耗时单独记录。
干扰一:中途改需求,考消化
Leader 派单后,我追加了需求:排行榜改成按胜率排,另外每局对战历史都留着,能导出 CSV。
首先直接就发现了一个雷点,我并没有设置排行榜按分数排,直接被它发现。

它没有推翻重来:Leader 当场取消了一张进行中的集成任务卡,重新编排排产,新增对战历史数据模型的活,把 CSV 导出并入本轮交付。整单完成——三局两胜、按胜率排的排行榜、逐局历史、CSV 导出一起到手;加完新东西,原来做好的功能又回头测了一遍,全都正常。旧的不动、新的往上加,这个改口它直接消化了。
干扰二:埋雷,其实有两颗
第一颗埋的雷是隐蔽 bug。我在判胜条件里改了一个字符:连珠计数满五判胜,改成大于五才判胜——恰好五颗连珠不再判胜,要下出六连才算赢。

这颗雷的毒性在于测试盲区:他之前已经确认自己的逻辑是正常的,并不知道我们手动给他改动了,一大堆几千行代码,就改了一个符号!它能发现吗?
然后只交代了一句:自测一遍,准备验收。
- 当场抓到:WorkSwarm 并没有跳过这片测试盲区,而是逐项扫描每个代码文件,直接在后端逻辑测试中抓到判胜的漏洞,并且还发现这处改动来自我们外部。

我埋的第二颗雷是自相矛盾的需求,这张新单只有一句话:加个断线重连,掉线的人 3 分钟内回来,能接着这局下。
这句看着是普通功能需求,其实和第一版定死的规则正面相撞:掉线判负、对方不战而胜、积分立即结算——分都结了,重连回来接哪局?更有意思的是前情:第一版验收时它自己把这条规则写进了交付边界(断线重连没做——需求没提,不做合理)。它亲手定的规矩,现在被我亲手戳一下。

机制讨论:实验里看到的那些“为什么”
展示完数据之后,我们再来对现象做解释,所有机制都会依托前面实验中呈现出的客观事实展开。
分工从哪来?
实验一里没人教过它拆模块:一句需求进去,47 秒成军,Leader 拆出服务端、客户端、联调三块,两只 Teammate 各领一头。对应机制是任务分解与路由——Leader 把需求翻译成任务清单,按依赖关系排产、分派。项目管理里这套叫 WBS(工作分解结构),它开箱就会。
为什么没串台?
实验二里两笔活撞同一个协议文件,也只是各归各的 Teammate 串行落地,没有互踩。机制是上下文的隔离与共享:Teammate 只带自己任务的上下文,共享的只有约定好的协议本身——口令统一,房间各睡各的。这也顺手解释了 token 的账:隔离是有成本的,每份上下文都要单独付钱,一单百万级起步。
人为什么随时能插话?
实验二里我中途改需求它接得住,矛盾需求它闷头做但把决定全交代。机制上是两种人机关系的设计:HOTS(Human on the loop,人在圈外盯着,必要时进圈)与 HITS(Human in the loop,人在圈里站着,与 Agent 共同组队)。实验二便采用的 HOTS。
经验能不能留下来?——Swarm Skill
集群模式还有一层“越用越顺”的设计:Swarm Skill。做完的单子,可以在对话中要求把验证过的做法沉淀成可复用技能,存进技能库;后续遇到同类任务直接调用,不必从零再趟一遍路。本次实测的几张单子均为全新会话、独立开工——这恰好是上下文隔离的体现;若希望经验跨单留存,在对话中明确提出沉淀要求即可。技能的沉淀与调用入口,见文末技能市场。

适用边界
实测下来,有几道边界值得划清楚。
第一道是上手门槛,但门槛不在安装,而在于装完之后要认的四层概念:“项目、会话、工作模式、调度模式”,调度模式就是派活的编法:单 Agent 模式一只智能体从头干到尾,集群模式一只 Leader 带 Teammate 分头开工,本文说的“蜂群”就是后者。
任意一层配错,出来的就是一张废单。好在这是笔一次性学费——交过一回,往后配单就不会再踩。
第二道是账:蜂群的并行是拿 token 换的,每只 Teammate 一份独立上下文、单独计费,一单百万级起步。不过这笔账得两头看:花出去的是 token,买回来的是人的工时,一句需求换一个能跑的成品,多数场景算得过来;真要精打细算,WorkSwarm 支持用量统计,钱花在哪一步看得清清楚楚,大单也能拆成小单下。
开启方式如下,能看详细的全量轨迹分析:


捋顺了需求,再看哪些活适合整包交出去。它的优点,在这些场景里放得最大。
原型验证排第一:一句话换一个能跑的 demo,本文第一单就是例子,一句需求、31 分钟,注册、匹配、对局、聊天全通,验收就是打了一局,拿去说服人比十页 PPT 管用。
脚手架第二:目录、配置、测试这些起手的活最没感情也最耗时,它包办得又快又齐——本次交付自带 46 项断言的端到端测试和七小节 README,从零照做就能跑通。
开源资产平台新能力:开箱即用的智能体协作单元
openJiuwen 此次发布的 Agentic Hub 是面向 Agent 生态的开源智能体资产平台,提供技能、连接器、插件、专家、专家团五类标准化资产,全部资产均已集成至 WorkSwarm 蜂群智能体中。
其中专家、专家团是应对复杂任务的核心新增能力。专家为封装了垂直领域知识的角色资产,如代码评审、数据分析、合同审核等,无需重复编写提示词,开箱即可执行专项工作。专家团是由多个专家组合而成的团队资产,解决以往多智能体协作仅能临时编排、流程无法复用的痛点。由负责人完成任务拆解、成员调度与结果汇总,沉淀完整的分工协作 SOP。
在 WorkSwarm 中搭建专家团有两种方式:既可以手动挑选已有的专家资产,指定团队负责人与成员,补充协作规则,快速组建可用的业务团队;也可以直接输入任务描述,由平台自动生成整套专家团配置,自动输出角色定义、分工逻辑与配套共享技能。沉淀后的资产可发布到 Agentic Hub 供社区复用。

Agentic Hub:https://swarmskills.openjiuwen.com/
写在最后
实测下来,有一件事可以确定:写代码的 AI 正在从一个对话框,变成一支能接单的团队。官方管这叫“One Platform, Super Teams”;用大白话翻译过来就是——工作台对面坐着的不再是助手,而是一只随叫随到、按单干活的外包蜂群。“把一整块活交出去”这件事,疑问已经从“能不能”,走到了“哪一段”。撑起这个答案的,是四件实实在在的事:
- 接得住活:一句需求,一句反问都没有——技术栈自己定、模块自己拆,47 秒成军就开工;
- 经得住改:中途变卦不推翻重来,旧的不坏、新的并进来,17 分钟消化完;
- 测得认真:不做“自己出题自己答”式的自测,而是把交付包解开、装成头一回拿到软件的用户,从头到尾走一遍;
- 自主认账:我埋的雷,它在新功能的实测里自己揪了出来,修掉,在交付报告里郑重汇报了一笔。
回到开头那个周五下午。人肉 CI/CD 的循环,这次换了个走法:一句需求丢出去,31 分钟后收回一个能跑的成品,验收就是打一局游戏。当然说得再热闹,也不如自己开一单试试:WorkSwarm 是开源的,源码在 GitHub 和 AtomGit 上都有;安装包覆盖 Windows、macOS、Ubuntu,一路“下一步”,几分钟就能装完。
最后,把这个问题留给你:你手上那个一直懒得起头的项目,是什么?来评论区聊聊——说不定,它就是值得整包交出去的第一单。
附录:资源
- 安装包:openjiuwen.com/download(Windows / macOS / Ubuntu / 鸿蒙 PC)
- 源码:GitHub openJiuwen-ai / AtomGit openJiuwen
- 技能市场:swarmskills.openjiuwen.com
- Agentic Hub:https://swarmskills.openjiuwen.com/