找回密码
立即注册
搜索
发回帖 发新帖

6450

积分

0

好友

814

主题
发表于 1 小时前 | 查看: 0| 回复: 0

Anthropic 在 24 小时内连续放出两记紧密咬合的更新。

先是在昨日凌晨发布的 Claude Code v2.1.292 中,官方悄然上线了两项底层能力:支持在创建 Subagent 时直接指定 effort 思考强度,同时允许 Mod 在 Workflow Agent 启动前直接拦截拒绝。紧接着,昨晚正式推出 Claude Haiku 5.5;今天凌晨发布的 v2.1.293 也闪电跟进,加入了模型与 agentType 的原生支持。

很多人如果只把它们当成零碎小更新看,可能觉得只是多了一个参数、降了一波价。但站在架构演进的角度看,Anthropic 这次打出的是一套组合拳:他们正在给 Multi-Agent 系统 搭建一套分布式的“算力调度器 + 治理控制面”。

痛点爆发:当 Agent 从 3 个变成上百个

常玩 AI 编程或搭智能体工作流的同学,一定深有感触:多 Agent 协同最让人心惊肉跳的就是账单。

过去搭多 Agent 系统,分工往往非常粗放:

主 Agent
├── Research Agent
├── Coding Agent
├── Review Agent
└── Test Agent

每个角色各司其职,看起来很美好,但实际跑起来往往面临两难:

要么全员拉满顶级模型与最高算力,随手跑几个深层 Bug 排查和跨目录依赖检索,几十万 Token 瞬间灰飞烟灭,钱包根本顶不住;要么退而求其次全用小模型,结果复杂规划频频翻车,甚至陷入死循环。

尤其是 Anthropic 此前力推的 Dynamic Workflows,设计愿景是在一个会话里并发跑起 数十个甚至上百个 Subagent。如果所有子智能体都以最高推理强度运作,系统的成本和延迟会迅速彻底失控。

这就逼出了一个核心命题:不同工种,所需要的推理计算量天差地别。

去跨目录 grep 搜个关键词、提取几行报错日志,凭什么要和系统架构决策、疑难算法重构消耗同样的 Token 预算?

调度革命:给每个打工人分配专属“思考档位”

Claude Code v2.1.292 最具突破性的动作,正是把算力分配做成了正式能力。

在官方的 Agent Tool 中,新增了 effort 参数:主 Agent 在调度创建 Subagent 时,可以直接指定该子任务的具体推理强度(low / medium / high / max)。

这意味着 Orchestrator 可以根据任务难度,动态调整算力分配:

简单搜索 / grep 检索
        ↓
    low effort

日志清洗 / 单测运行
        ↓
  medium effort

核心逻辑编写 / 重构
        ↓
    high effort

架构决策 / 复杂 Debug / 终审 Review
        ↓
    max effort

无需再搞一刀切的粗暴消耗:简单任务走 low effort,毫秒级响应且极省 Token;关键决断走 max effort,算力拉满保证质量上限。

这一改变让开发者可以真正像管理现代分布式系统那样,精细化管理多智能体的计算预算。

治理防线:Mods 进化为 Multi-Agent 控制面

光能分配算力还不够,如果主 Agent 一口气派生了几十个甚至上百个子任务,谁来兜底?

v2.1.292 带来的另一个重磅改动,是把 workflow agents 纳入 Mods 的 agent.spawn Hook,并暴露了 run ID 和 index。

这意味着 Mod 具备了在这些 Workflow Agent 真正启动前 直接一票否决(拒绝运行) 的权力。

Multi-Agent 算力调度与治理控制架构

这非常接近现代 Kubernetes 集群中的准入控制器(Admission Controller):

  • 以前的 Orchestration 仅仅解决“谁负责什么任务”
  • 现在的 Claude Code 进一步解决了“谁消耗多少推理算力”以及“谁有资格被启动”

当上层调度器规划了大量并行任务时,控制面可以根据当前并发配额、预估成本预算或安全权限规则,直接拦截超额或高危的子任务,守住成本与安全底线。

廉价算力就位:Haiku 5.5 直逼主流旗舰

调度机制与治理防线就绪后,最关键的一块拼图——能够大规模并发、干脏活累活的低成本劳动力,也正式登场了。

这就是昨天刚刚发布的 Claude Haiku 5.5。

先看官方定价:

模型级别 输入价格(每 M Token) 输出价格(每 M Token) 缓存读取(每 M Token) 上下文窗口
Haiku 5.5(≤100K 提示) $0.10 $0.50 $0.01 1M
Haiku 5.5(>100K 提示) $0.50 $2.50 $0.05 1M
Haiku 4.5 $1.00 $5.00 $0.10 200K
Sonnet 5.5 $2.00 $10.00 $0.10(原$0.20) 1M

在常规短上下文(100K Token 以内)中,Haiku 5.5 的输入价格直接压到了 $0.10 / 百万 Token,输出只要 $0.50,综合运行成本较 Haiku 4.5 暴跌约 75%。

这里有一个非常关键的设计:阶梯式定价策略。

超过 100K 之后,输入和输出价格分别变为 $0.50 和$2.50。官方统计显示,过去 Haiku 约 90% 的请求都在 100K 以内。

这一计费规则清晰锁定了它的最佳定位:天生适合作为 高并发、短平快、上下文轻量的 Subagent,去执行特定数据清洗与检索任务,而不是作为单次滚长上下文的主会话容器。

与此同时,Sonnet 5.5 的 Prompt Cache 读取价格直接减半,从 $0.20 降到$0.10。官方测算,这能让绝大多数 Agent 任务的总成本再降约 20%。

而且千万别以为它只是廉价替代品。在 Artificial Analysis(AA)最新基准榜单上,Haiku 5.5(max with fallback)直接打出了 43 分:

Artificial Analysis 评测:Claude Haiku 5.5 逼近主流旗舰

官方基准表还给出了 Haiku 5.5、Haiku 4.5、GPT-6 Luna 与 Sonnet 5.5 的逐项对比:

Claude Haiku 5.5 官方基准测试对比表

对比主要模型,这组数据相当震撼:

  • 反超 GLM-5.3 Flash:43 vs 42
  • 直逼 Kimi K3(max):43 vs 44,只差 1 分
  • 明显高于 DeepSeek V4.1 Flash(max):43 vs 39
  • 高于 Qwen3.8 27B(xhigh):43 vs 34
  • 高于 MiniMax-M3:43 vs 29
  • 仅略低于顶配大模型 GLM-5.3(max 45)与 MiMo-V2.6-Pro(46)

更惊艳的是代际飞跃:上一代 Claude 4.5 Haiku 只有 17 分,Haiku 5.5 直接提升 +26 分。

从图表的 Token 消耗轴也能看出,它并没有靠漫无边际的超长思维硬堆分数,而是用相当克制的 Token 消耗摸到了主力模型的梯队。在高并发、低成本场景下,它的战斗力非常惊人。

实测证据:落蛋模拟、火箭升空与 Devin Fusion

这套“大模型动脑 + 小模型干活”以及“小模型拉满推理”的实战表现到底有多强?看三组硬核实测。

第一组是极具代表性的 落蛋物理模拟试验,目标是设计出让鸡蛋在 32 米高度安全落地的方案:

  • Opus 5.5 单独跑:耗时 3 分 37 秒,尝试了 25 个方案,总账单 $0.47
  • Opus 5.5 + 10 个 Haiku 5.5 子代理:仅用 58 秒,并发探索了 86 个方案,总账单 $0.14

同样达成目标,时间缩短到约 1/3.7,方案探索量提升约 3.4 倍,账单反而砍掉 70%。

这正是多 Agent 协同的精髓:Opus 负责想,Haiku 负责干。编排层由大模型把控方向,执行层由 Haiku 规模化推进,效率与成本直接双赢。

第二组来自社区开发者 @Bhavani_00007 的面对面对决:让 Haiku 5.5 与 GPT-6 Luna 在各自最高档位(max level)下,独立编写并渲染一个动态火箭升空发射模拟场景。

  • Haiku 5.5:花费 $1.30,耗时约 2 分钟,火箭升空的三维结构、发射塔脱离、尾焰与浓烟扩散都相当逼真,视觉和物理动态上直接压制了 GPT-6 Luna
  • GPT-6 Luna:花费 $1.50,同样耗时约 2 分钟,渲染细节与动态质感明显逊色

测试者原话感慨:完全没预料到小模型拉满 reasoning 后能把场景写得如此真实,整体表现相比上一代 4.5 堪称跨越式巨变。

第三组是 Cognition 团队在 Devin Fusion 中的实测:用 Opus 5.5 作为 Lead 主脑、Haiku 5.5 作为 Sidekick 副手,整套系统在 FrontierCode 拿下了 66.2 分,同时显著压低了延迟与开销。

今天凌晨发布的 v2.1.293 更新还在 subagentStatusLine 中新增了 agentType 字段:

Claude Code v2.1.293 GitHub 更新提交

这让开发者在自动化管理与可视化看板中,能够精准追踪不同工种智能体的运行节奏。

避坑指南:推理档位怎么选,别盲目拉满

虽然 Haiku 5.5 性能很强,但这里必须提醒:千万别把 Haiku 5.5 的推理档位一股脑全拉到 max!

在这个级别的小模型上,盲目升档增加的主要是核对步骤与自查循环,基座模型本身的智商并不会发生质变。

结合多位开发者的实战摸索,下面是一套更接地气的档位使用法则:

  1. low 档:分类、实体抽取、任务路由、简报摘要,只拼极致速度
  2. medium 档(默认基准):客服对话、浏览器页面操作、范围明确的窄 Subagent 从这里起步
  3. high 档:当 medium 偶尔漏判或翻车时再升档,适合多步协同或易漏字段的任务
  4. xhigh / max 档:仅在自己的业务基准评测上验证有明显增益才开启,否则容易超时且徒增花费
  5. 长链工程编码坚决别硬扛:看清官方 Terminal-Bench 4.0 的客观差距,Haiku 5.5 是 39.2%,Sonnet 5.5 高达 70.6%,复杂工程大任务依然老老实实交给主力模型
  6. 省钱窗口严控在 100K 内:牢记阶梯价格,窄任务起步用 medium,失败再升档

总结

大模型狂飙到今天,智能体工程正在告别单体单打独斗的草莽时代。

这套以 Claude Code 为调度底座、Haiku 5.5 为执行主力、Mod 为治理防线的组合拳,为 多智能体走向工业级落地 指明了清晰路径:

  • 任务精细分工:大模型做架构决策与终审,小模型做高并发检索与信息提取
  • 算力按需分配:按任务复杂度匹配 effort 档位,消除算力浪费
  • 策略准入把关:通过治理控制面防范任务失控蔓延

建议尽快在本地工作流中尝试这种大小搭配的协作架构,亲身体验算力调度带来的效率跃升。




上一篇:GPT-6 边思考边回答与 Intelligent UI 实测:ChatGPT 正在吞噬一切 App
下一篇:机器人世界模型七篇论文拆解:数据先验、空间表示与部署量化
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-9 04:58 , Processed in 1.234497 second(s), 46 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表