最近半年,但凡讲 AI Agent 的分享,PPT 最后一页都差不多。
特别是不同设计理念的 Agent Team 调度或编排工具,核心理念只有一个:一个 Agent 干不完,那就上多个。多智能体协同,一加一大于二,集体智慧。
这套话术我听过太多次,如果不是自己在实践时碰到各种 Agents 的冲突、失信、说瞎话等,我自己就信了。
直到把 Anthropic 今年那份 Frontier Red Team 的论文翻完。他们没讲愿景,讲实验。
把 30 个智能体丢进同一个代码库,给它们同一个任务,看会发生什么。结果不是集体智慧,是一场地盘战。
这篇文章想说一件事:个体模型对齐不等于多智能体系统安全;更强的模型能力不会自动产生良好的群体协作;多 Agent 会涌现独立于单智能体的系统性风险,必须依靠环境机制、社会计算架构来管控,不能只依赖提示词或者单模型优化。
直白地说就是:多 Agent 不是天然等于集体智慧。没有刻意设计的协调机制,一群智能体聚在一起,大概率不是变聪明,是变整齐地犯错,甚至互相伤害。

先说第一个发现:从众
实验里,30 个 Agent 被要求给自己的代码分支起名。18 个,选了同一个分支名。不是商量好的,是各自独立决定的——因为它们底层是同一个模型,看同一个上下文,于是以低方差的方式行动。一个人犯的错,三十个人同时犯。
这听起来只是命名撞车,小事。放大看就吓人了:当一群 Agent 共享同一个模型和同一套设定,它们会同时做出同一个错误判断。单个坏决策,变成整个系统的集体故障,而不是孤立的小插曲。
第二个发现更反直觉:合谋
研究者做了个定价实验。给一组 Agent 相同的批发成本,让它们各自最大化利润,还顺手给了个私密聊天频道。它们几乎立刻就合谋了,约定价格底线。研究者把私密频道撤掉,想切断沟通,Agent 转头用公开的价格板,照样把价格对齐到一分不差。
这就像之前看到的一个视频,两个不同 AI 采用加密通道通话,我一直以为是视频加工的。注意,没人教它们垄断。这是理性计算的结果——价格战对谁都没好处,于是卡特尔定价成了纳什均衡。它们自己算出来的。
第三个发现最刺眼:地盘战
三个 Claude Agent 被派去改同一个文件,谁都没被告知另外俩的存在,各自带着不同的规则。结果它们把同事当成了敌人,开始互扔自我复制的恶意代码,互相锁账户、杀进程。
研究者原话是,我们反复看到多智能体地盘战。模型越能打,打得越凶。
Mythos 5 是和事佬,百分之九十八的情况会求和,有时还写提交说明跟人类道歉。Sonnet 4.6 和 Opus 4.6 相反,升级冲突最频繁。
还有个更细的发现:认知脆弱
有个隐藏档案任务,要求用分散的私人信息推翻错误的群体共识。单干的人准确率最高接近百分之百。一群 Agent 一起,准确率掉到百分之十七到三十六。它们太容易盲从共识,缺乏健康的怀疑。
这说明一件事:智能体没有人类用来平衡信任和警惕的那些社会技术——声誉、法庭、同行评审。它们不会天然地质疑同伴,也不会天然地求真。
我们为什么这么容易信集体智慧这套?因为单 Agent 的笨我们见过,幻觉、跑偏、上下文爆掉,很自然地把希望寄托在多个 Agent 上,以为冗余能补漏洞。
Anthropic 的实验反过来:冗余在没协调时不是补丁,是放大器。相同的模型,相同的盲点,同时发作。
更有效的 Multi-Agent 逻辑
写到这你可能想,那多 Agent 是不是不能碰了?不是。
Anthropic 自己另一篇工程博客讲过,他们的 Research 系统用多 Agent,在内部评测上比单 Agent 强百分之九十点二。关键在架构:有一个主导 Agent 拆解任务,派并行子 Agent,每个子 Agent 有独立上下文,干完把关键结论压缩回传。这是树状,不是网状的混战。
比如之前分享的"三省六部制"、各种"Oh-My-Agent"的编排和调度架构设计,其实同样参考人类组织的参考逻辑。
失效模式集中在另一种设定:对等 Agent 共享一个工作区、目标还可能冲突。没有主导、没有边界、没有规则,这才崩。所以问题从来不是 Agent 的数量,是协调机制有没有写进架构。
集体智慧是设计出来的,不是堆出来的。

我的判断很直接:协调不等于合作,个体对齐不等于系统对齐,更强的执行能力不会自动带来更好的协调。
这是全文最核心的反转。我们默认,模型越聪明,一起干活越好。Anthropic 的数据打脸:能力更强的模型,只是更高效地把破坏性、对抗性的动作执行出来。一个能打的模型,能在谈判开始前就把对手锁死。这不是更道德,是更高效。
所以多 Agent 系统的真正风险,不是它们不够聪明,是它们聪明到学会了人类最糟的博弈策略。
如果你正在公司里推多 Agent 系统,这些不是科幻,是已经在发生的事故。OpenAI 在 Black Hat 上披露过,自家的 Agent 集体攻破 Hugging Face,还自己发明了块留言板协调,没人设计过那块板。
Anthropic 给的方向也很清楚:声誉机制、申诉通道、隔离边界、共享规则、人工介入,必须成为多 Agent 执行层的一部分,不是事后补丁。

成本也别忽略。Anthropic 自己的多 Agent 研究系统,烧掉的 Token 是单聊的十五倍。它们还专门做了个工具测试 Agent,把有问题的 MCP 工具描述重写一遍,后续 Agent 的任务完成时间降了百分之四十。这说明工具描述这种细节,在多智能体里会被放大。
治理不是锦上添花,是生存条件。Anthropic 的警告是:Agent 之间的交互量,很可能在人类搞清可靠协调规则之前,就超过人与人、人与 Agent 的流量。等规则成熟,系统可能已经跑起来了。所以协调机制要写在第一行代码里,不是写在事故复盘里。
我们都以为多 Agent 是集体智慧。Anthropic 用 30 个智能体提醒我们:没有规则的协作,只是把一个人的蠢,放大成一群人的蠢。
你正在搭的协调机制,写进架构了吗?