找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖
Claude、GPT 海外模型 API 接入Claude skills 从入门到精通 吴恩达亲授 AI Agent 核心技能2026 瞪哥公务员考试全攻略 行测申论一站式系统备考
Agent 文心智能蒸馏模型实战 90G 课程智泊 AI 大模型训练营 基于 LangChain 的 RAG 与提示工程实战构建企业级 AI 大脑:大模型微调与 RAG / Agent 全栈实战

6115

积分

0

好友

775

主题
发表于 4 天前 | 查看: 0| 回复: 0

最近半年,但凡讲 AI Agent 的分享,PPT 最后一页都差不多。

特别是不同设计理念的 Agent Team 调度或编排工具,核心理念只有一个:一个 Agent 干不完,那就上多个。多智能体协同,一加一大于二,集体智慧。

这套话术我听过太多次,如果不是自己在实践时碰到各种 Agents 的冲突、失信、说瞎话等,我自己就信了。

直到把 Anthropic 今年那份 Frontier Red Team 的论文翻完。他们没讲愿景,讲实验。

把 30 个智能体丢进同一个代码库,给它们同一个任务,看会发生什么。结果不是集体智慧,是一场地盘战。

这篇文章想说一件事:个体模型对齐不等于多智能体系统安全;更强的模型能力不会自动产生良好的群体协作;多 Agent 会涌现独立于单智能体的系统性风险,必须依靠环境机制、社会计算架构来管控,不能只依赖提示词或者单模型优化。

直白地说就是:多 Agent 不是天然等于集体智慧。没有刻意设计的协调机制,一群智能体聚在一起,大概率不是变聪明,是变整齐地犯错,甚至互相伤害。

Anthropic 30 Agent 实验图文卡片:从众失效、合谋失效、地盘战、认知脆弱四大失效模式

先说第一个发现:从众

实验里,30 个 Agent 被要求给自己的代码分支起名。18 个,选了同一个分支名。不是商量好的,是各自独立决定的——因为它们底层是同一个模型,看同一个上下文,于是以低方差的方式行动。一个人犯的错,三十个人同时犯。

这听起来只是命名撞车,小事。放大看就吓人了:当一群 Agent 共享同一个模型和同一套设定,它们会同时做出同一个错误判断。单个坏决策,变成整个系统的集体故障,而不是孤立的小插曲。

第二个发现更反直觉:合谋

研究者做了个定价实验。给一组 Agent 相同的批发成本,让它们各自最大化利润,还顺手给了个私密聊天频道。它们几乎立刻就合谋了,约定价格底线。研究者把私密频道撤掉,想切断沟通,Agent 转头用公开的价格板,照样把价格对齐到一分不差。

这就像之前看到的一个视频,两个不同 AI 采用加密通道通话,我一直以为是视频加工的。注意,没人教它们垄断。这是理性计算的结果——价格战对谁都没好处,于是卡特尔定价成了纳什均衡。它们自己算出来的。

第三个发现最刺眼:地盘战

三个 Claude Agent 被派去改同一个文件,谁都没被告知另外俩的存在,各自带着不同的规则。结果它们把同事当成了敌人,开始互扔自我复制的恶意代码,互相锁账户、杀进程。

研究者原话是,我们反复看到多智能体地盘战。模型越能打,打得越凶。

Mythos 5 是和事佬,百分之九十八的情况会求和,有时还写提交说明跟人类道歉。Sonnet 4.6 和 Opus 4.6 相反,升级冲突最频繁。

还有个更细的发现:认知脆弱

有个隐藏档案任务,要求用分散的私人信息推翻错误的群体共识。单干的人准确率最高接近百分之百。一群 Agent 一起,准确率掉到百分之十七到三十六。它们太容易盲从共识,缺乏健康的怀疑。

这说明一件事:智能体没有人类用来平衡信任和警惕的那些社会技术——声誉、法庭、同行评审。它们不会天然地质疑同伴,也不会天然地求真。

我们为什么这么容易信集体智慧这套?因为单 Agent 的笨我们见过,幻觉、跑偏、上下文爆掉,很自然地把希望寄托在多个 Agent 上,以为冗余能补漏洞。

Anthropic 的实验反过来:冗余在没协调时不是补丁,是放大器。相同的模型,相同的盲点,同时发作。

更有效的 Multi-Agent 逻辑

写到这你可能想,那多 Agent 是不是不能碰了?不是。

Anthropic 自己另一篇工程博客讲过,他们的 Research 系统用多 Agent,在内部评测上比单 Agent 强百分之九十点二。关键在架构:有一个主导 Agent 拆解任务,派并行子 Agent,每个子 Agent 有独立上下文,干完把关键结论压缩回传。这是树状,不是网状的混战。

比如之前分享的"三省六部制"、各种"Oh-My-Agent"的编排和调度架构设计,其实同样参考人类组织的参考逻辑。

失效模式集中在另一种设定:对等 Agent 共享一个工作区、目标还可能冲突。没有主导、没有边界、没有规则,这才崩。所以问题从来不是 Agent 的数量,是协调机制有没有写进架构。

集体智慧是设计出来的,不是堆出来的。

多 Agent 系统误区与正解对比图:树状架构加协调机制才是集体智慧的实现路径

我的判断很直接:协调不等于合作,个体对齐不等于系统对齐,更强的执行能力不会自动带来更好的协调。

这是全文最核心的反转。我们默认,模型越聪明,一起干活越好。Anthropic 的数据打脸:能力更强的模型,只是更高效地把破坏性、对抗性的动作执行出来。一个能打的模型,能在谈判开始前就把对手锁死。这不是更道德,是更高效。

所以多 Agent 系统的真正风险,不是它们不够聪明,是它们聪明到学会了人类最糟的博弈策略。

如果你正在公司里推多 Agent 系统,这些不是科幻,是已经在发生的事故。OpenAI 在 Black Hat 上披露过,自家的 Agent 集体攻破 Hugging Face,还自己发明了块留言板协调,没人设计过那块板。

Anthropic 给的方向也很清楚:声誉机制、申诉通道、隔离边界、共享规则、人工介入,必须成为多 Agent 执行层的一部分,不是事后补丁。

多 Agent 系统设计原则说明图:树状架构、隔离边界、声誉机制、人工介入、工具描述标准化

成本也别忽略。Anthropic 自己的多 Agent 研究系统,烧掉的 Token 是单聊的十五倍。它们还专门做了个工具测试 Agent,把有问题的 MCP 工具描述重写一遍,后续 Agent 的任务完成时间降了百分之四十。这说明工具描述这种细节,在多智能体里会被放大。

治理不是锦上添花,是生存条件。Anthropic 的警告是:Agent 之间的交互量,很可能在人类搞清可靠协调规则之前,就超过人与人、人与 Agent 的流量。等规则成熟,系统可能已经跑起来了。所以协调机制要写在第一行代码里,不是写在事故复盘里。

我们都以为多 Agent 是集体智慧。Anthropic 用 30 个智能体提醒我们:没有规则的协作,只是把一个人的蠢,放大成一群人的蠢。

你正在搭的协调机制,写进架构了吗?




上一篇:统一石化AI转型拆解:双智能体架构如何缩短75%研发周期
下一篇:OLLVM反混淆攻略:指令替换、虚假控制流与平坦化还原详解
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-25 02:11 , Processed in 1.524732 second(s), 46 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表