Anthropic 在 24 小时内连续放出两记紧密咬合的更新。
先是在昨日凌晨发布的 Claude Code v2.1.292 中,官方悄然上线了两项底层能力:支持在创建 Subagent 时直接指定 effort 思考强度,同时允许 Mod 在 Workflow Agent 启动前直接拦截拒绝。紧接着,昨晚正式推出 Claude Haiku 5.5;今天凌晨发布的 v2.1.293 也闪电跟进,加入了模型与 agentType 的原生支持。
很多人如果只把它们当成零碎小更新看,可能觉得只是多了一个参数、降了一波价。但站在架构演进的角度看,Anthropic 这次打出的是一套组合拳:他们正在给 Multi-Agent 系统 搭建一套分布式的“算力调度器 + 治理控制面”。
痛点爆发:当 Agent 从 3 个变成上百个
常玩 AI 编程或搭智能体工作流的同学,一定深有感触:多 Agent 协同最让人心惊肉跳的就是账单。
过去搭多 Agent 系统,分工往往非常粗放:
主 Agent
├── Research Agent
├── Coding Agent
├── Review Agent
└── Test Agent
每个角色各司其职,看起来很美好,但实际跑起来往往面临两难:
要么全员拉满顶级模型与最高算力,随手跑几个深层 Bug 排查和跨目录依赖检索,几十万 Token 瞬间灰飞烟灭,钱包根本顶不住;要么退而求其次全用小模型,结果复杂规划频频翻车,甚至陷入死循环。
尤其是 Anthropic 此前力推的 Dynamic Workflows,设计愿景是在一个会话里并发跑起 数十个甚至上百个 Subagent。如果所有子智能体都以最高推理强度运作,系统的成本和延迟会迅速彻底失控。
这就逼出了一个核心命题:不同工种,所需要的推理计算量天差地别。
去跨目录 grep 搜个关键词、提取几行报错日志,凭什么要和系统架构决策、疑难算法重构消耗同样的 Token 预算?
调度革命:给每个打工人分配专属“思考档位”
Claude Code v2.1.292 最具突破性的动作,正是把算力分配做成了正式能力。
在官方的 Agent Tool 中,新增了 effort 参数:主 Agent 在调度创建 Subagent 时,可以直接指定该子任务的具体推理强度(low / medium / high / max)。
这意味着 Orchestrator 可以根据任务难度,动态调整算力分配:
简单搜索 / grep 检索
↓
low effort
日志清洗 / 单测运行
↓
medium effort
核心逻辑编写 / 重构
↓
high effort
架构决策 / 复杂 Debug / 终审 Review
↓
max effort
无需再搞一刀切的粗暴消耗:简单任务走 low effort,毫秒级响应且极省 Token;关键决断走 max effort,算力拉满保证质量上限。
这一改变让开发者可以真正像管理现代分布式系统那样,精细化管理多智能体的计算预算。
治理防线:Mods 进化为 Multi-Agent 控制面
光能分配算力还不够,如果主 Agent 一口气派生了几十个甚至上百个子任务,谁来兜底?
v2.1.292 带来的另一个重磅改动,是把 workflow agents 纳入 Mods 的 agent.spawn Hook,并暴露了 run ID 和 index。
这意味着 Mod 具备了在这些 Workflow Agent 真正启动前 直接一票否决(拒绝运行) 的权力。

这非常接近现代 Kubernetes 集群中的准入控制器(Admission Controller):
- 以前的 Orchestration 仅仅解决“谁负责什么任务”
- 现在的 Claude Code 进一步解决了“谁消耗多少推理算力”以及“谁有资格被启动”
当上层调度器规划了大量并行任务时,控制面可以根据当前并发配额、预估成本预算或安全权限规则,直接拦截超额或高危的子任务,守住成本与安全底线。
廉价算力就位:Haiku 5.5 直逼主流旗舰
调度机制与治理防线就绪后,最关键的一块拼图——能够大规模并发、干脏活累活的低成本劳动力,也正式登场了。
这就是昨天刚刚发布的 Claude Haiku 5.5。
先看官方定价:
| 模型级别 |
输入价格(每 M Token) |
输出价格(每 M Token) |
缓存读取(每 M Token) |
上下文窗口 |
| Haiku 5.5(≤100K 提示) |
$0.10 |
$0.50 |
$0.01 |
1M |
| Haiku 5.5(>100K 提示) |
$0.50 |
$2.50 |
$0.05 |
1M |
| Haiku 4.5 |
$1.00 |
$5.00 |
$0.10 |
200K |
| Sonnet 5.5 |
$2.00 |
$10.00 |
$0.10(原$0.20) |
1M |
在常规短上下文(100K Token 以内)中,Haiku 5.5 的输入价格直接压到了 $0.10 / 百万 Token,输出只要 $0.50,综合运行成本较 Haiku 4.5 暴跌约 75%。
这里有一个非常关键的设计:阶梯式定价策略。
超过 100K 之后,输入和输出价格分别变为 $0.50 和$2.50。官方统计显示,过去 Haiku 约 90% 的请求都在 100K 以内。
这一计费规则清晰锁定了它的最佳定位:天生适合作为 高并发、短平快、上下文轻量的 Subagent,去执行特定数据清洗与检索任务,而不是作为单次滚长上下文的主会话容器。
与此同时,Sonnet 5.5 的 Prompt Cache 读取价格直接减半,从 $0.20 降到$0.10。官方测算,这能让绝大多数 Agent 任务的总成本再降约 20%。
而且千万别以为它只是廉价替代品。在 Artificial Analysis(AA)最新基准榜单上,Haiku 5.5(max with fallback)直接打出了 43 分:

官方基准表还给出了 Haiku 5.5、Haiku 4.5、GPT-6 Luna 与 Sonnet 5.5 的逐项对比:

对比主要模型,这组数据相当震撼:
- 反超 GLM-5.3 Flash:43 vs 42
- 直逼 Kimi K3(max):43 vs 44,只差 1 分
- 明显高于 DeepSeek V4.1 Flash(max):43 vs 39
- 高于 Qwen3.8 27B(xhigh):43 vs 34
- 高于 MiniMax-M3:43 vs 29
- 仅略低于顶配大模型 GLM-5.3(max 45)与 MiMo-V2.6-Pro(46)
更惊艳的是代际飞跃:上一代 Claude 4.5 Haiku 只有 17 分,Haiku 5.5 直接提升 +26 分。
从图表的 Token 消耗轴也能看出,它并没有靠漫无边际的超长思维硬堆分数,而是用相当克制的 Token 消耗摸到了主力模型的梯队。在高并发、低成本场景下,它的战斗力非常惊人。
实测证据:落蛋模拟、火箭升空与 Devin Fusion
这套“大模型动脑 + 小模型干活”以及“小模型拉满推理”的实战表现到底有多强?看三组硬核实测。
第一组是极具代表性的 落蛋物理模拟试验,目标是设计出让鸡蛋在 32 米高度安全落地的方案:
- Opus 5.5 单独跑:耗时 3 分 37 秒,尝试了 25 个方案,总账单 $0.47
- Opus 5.5 + 10 个 Haiku 5.5 子代理:仅用 58 秒,并发探索了 86 个方案,总账单 $0.14
同样达成目标,时间缩短到约 1/3.7,方案探索量提升约 3.4 倍,账单反而砍掉 70%。
这正是多 Agent 协同的精髓:Opus 负责想,Haiku 负责干。编排层由大模型把控方向,执行层由 Haiku 规模化推进,效率与成本直接双赢。
第二组来自社区开发者 @Bhavani_00007 的面对面对决:让 Haiku 5.5 与 GPT-6 Luna 在各自最高档位(max level)下,独立编写并渲染一个动态火箭升空发射模拟场景。
- Haiku 5.5:花费 $1.30,耗时约 2 分钟,火箭升空的三维结构、发射塔脱离、尾焰与浓烟扩散都相当逼真,视觉和物理动态上直接压制了 GPT-6 Luna
- GPT-6 Luna:花费 $1.50,同样耗时约 2 分钟,渲染细节与动态质感明显逊色
测试者原话感慨:完全没预料到小模型拉满 reasoning 后能把场景写得如此真实,整体表现相比上一代 4.5 堪称跨越式巨变。
第三组是 Cognition 团队在 Devin Fusion 中的实测:用 Opus 5.5 作为 Lead 主脑、Haiku 5.5 作为 Sidekick 副手,整套系统在 FrontierCode 拿下了 66.2 分,同时显著压低了延迟与开销。
今天凌晨发布的 v2.1.293 更新还在 subagentStatusLine 中新增了 agentType 字段:

这让开发者在自动化管理与可视化看板中,能够精准追踪不同工种智能体的运行节奏。
避坑指南:推理档位怎么选,别盲目拉满
虽然 Haiku 5.5 性能很强,但这里必须提醒:千万别把 Haiku 5.5 的推理档位一股脑全拉到 max!
在这个级别的小模型上,盲目升档增加的主要是核对步骤与自查循环,基座模型本身的智商并不会发生质变。
结合多位开发者的实战摸索,下面是一套更接地气的档位使用法则:
- low 档:分类、实体抽取、任务路由、简报摘要,只拼极致速度
- medium 档(默认基准):客服对话、浏览器页面操作、范围明确的窄 Subagent 从这里起步
- high 档:当 medium 偶尔漏判或翻车时再升档,适合多步协同或易漏字段的任务
- xhigh / max 档:仅在自己的业务基准评测上验证有明显增益才开启,否则容易超时且徒增花费
- 长链工程编码坚决别硬扛:看清官方 Terminal-Bench 4.0 的客观差距,Haiku 5.5 是 39.2%,Sonnet 5.5 高达 70.6%,复杂工程大任务依然老老实实交给主力模型
- 省钱窗口严控在 100K 内:牢记阶梯价格,窄任务起步用 medium,失败再升档
总结
大模型狂飙到今天,智能体工程正在告别单体单打独斗的草莽时代。
这套以 Claude Code 为调度底座、Haiku 5.5 为执行主力、Mod 为治理防线的组合拳,为 多智能体走向工业级落地 指明了清晰路径:
- 任务精细分工:大模型做架构决策与终审,小模型做高并发检索与信息提取
- 算力按需分配:按任务复杂度匹配 effort 档位,消除算力浪费
- 策略准入把关:通过治理控制面防范任务失控蔓延
建议尽快在本地工作流中尝试这种大小搭配的协作架构,亲身体验算力调度带来的效率跃升。