找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

5915

积分

0

好友

738

主题
发表于 4 天前 | 查看: 5| 回复: 0

Fable 5.1 和 Mythos 5.1 在凌晨突然上线。上一代 Fable 5 几乎成了 SOTA 模型的代名词,光环还没退去,Anthropic 已经开始自己卷自己了。

Claude 官方发布 Fable 5.1 与 Mythos 5.1 公告截图

两款模型同时发布,Fable 5.1 面向普通用户和企业,Mythos 5.1 则把同一套前沿能力开放给“经过验证的网络安全和生命科学机构”。

定价上,基础价格不变,Fable 5.1 依然是 10 美元/百万输入 Token、50 美元/百万输出 Token。但缓存读取价格砍掉了 75%,从 1 美元/百万 Token 降到 0.25 美元/百万 Token。

性能提升明显集中在长时间、多步骤的 Agent 任务 上。Terminal-Bench-Science 从 24.7% 涨到 52.6%,AutomationBench 从 17.1% 涨到 31.4%。

Claude Fable 5.1 基准测试对比表

比起模型本身,或许更值得注意的是发布的时间节点——这很可能是 Anthropic 公开递表前,最后一次重量级模型发布。

几天之后就是 9 月 7 日美国劳动节。按照 The Information 此前披露的计划,已经秘密提交 IPO 文件的 Anthropic,可能在劳动节之后正式公开招股书,并在 9 月中旬举行投资者日,最快于 9 月底至 10 月初上市。

而 Anthropic 此前“明升实降”改额度的余波,也出现在新模型发布的评论区里。8 月 29 日,Anthropic 宣布 9 月 14 日起将“标准周额度”提高 25%,但这个数字是相对于 5 月以前的旧标准计算;与用户目前正在使用的临时额度相比,实际反而下降了 17%。

Fable 5.1 刚刚上线,就有用户追问 Anthropic,能不能同时给出“更透明、更慷慨”的会话和每周额度。

用户评论截图:希望获得更透明、更慷慨的会话与每周额度

Fable 5.1:把 Agent 推向更长任务

如果只看规格,Fable 5.1 并不是一次幅度很大的升级。

它延续了 Fable 5 的 100 万 Token 上下文窗口和 128K 最大输出,基础价格也没有变化:每百万输入 Token 10 美元,每百万输出 Token 50 美元。

放到当前的旗舰模型阵容里,Fable 5.1 依然属于明显更贵的一档:同样按 100 万输入 + 100 万输出来算,Fable 5.1 是 GPT-5.6 Sol 当前价格的 2.5 倍,GLM-5.3 的 10 倍以上。

Anthropic 官方甚至仍然建议,大多数任务优先从价格只有一半的 Opus 5 开始,只有面对高难度推理、长时间 Agent 任务,或者 Opus 5 在高 effort 下依然不够用时,再上 Fable 5.1。

值得关注的变化发生在 Agent 持续运行的成本上。

Fable 5.1 的 5 分钟和 1 小时缓存写入价格仍然分别是 12.5 美元和 20 美元/百万 Token,但缓存读取从 Fable 5 的 1 美元/百万 Token 降到了 0.25 美元,相当于直接砍掉 75%。

Fable 5 与 Fable 5.1 在不同工作负载下的成本对比

缓存读取可以理解为:一段上下文已经被模型处理过之后,后面的请求不需要每次重新按完整输入价格读取。对于一次普通问答,这部分未必重要;但一个连续运行几个小时的 Agent,会反复读取系统提示词、代码库、工具定义以及此前已经处理过的上下文。任务越长、工具调用越多,缓存读取占到的成本就越高。

Anthropic 用今年 8 月四周的实际使用数据做过测算。在按 Token 计费的场景下,相同任务从 Fable 5 换到 Fable 5.1,典型工作负载的整体成本预计下降约 25%;对于上下文更重、工具调用更多的复杂 Coding 和高度 Agent 化任务,降幅最高可以达到约 45%。

也就是说,虽然 Anthropic 没有把 Fable 5.1 本身卖得更便宜,但专门把“让它长时间工作”这件事做得更便宜了。

不过,便宜也只是相对于过去,基础价格摆在那里。有开发者就在发布评论区提醒,即使缓存命中率很高,成本依然可能迅速累积。一次真实的复杂 Coding 任务,就可能花掉 20 到 50 美元。

开发者推文截图:API 成本仍可能快速累积

另外,这种降价主要发生在 API 和其他按 Token 结算的场景。对于直接订阅 Claude Code 的用户,另一套“额度账”刚刚引发争议。

8 月 29 日,Claude Developers 官方账号宣布,从 9 月 14 日起,Pro、Max、Team 和按席位收费的 Enterprise 套餐,Claude Code 的“标准周额度”将永久提高 25%。但问题在于,此前 Anthropic 已经临时把这套额度提高了 50%,而且这套临时额度会一直维持到 9 月 14 日。

也就是说,如果把原始额度记作 100,现在用户实际拿到的是 150;9 月 14 日以后则会变成 125。名义上相对旧标准“永久提高 25%”,相较用户现在实际能够使用的额度,却减少了约 17%。Anthropic 随后也专门补充说明,确认了这一计算。

在 Fable 5.1 发布后的评论区里,也有用户继续追问 Anthropic,能不能给出“更透明、更慷慨”的会话和每周额度,别再玩类似的文字游戏了。

不过,从性能变化来看,Fable 5.1 也确实越来越像一个专为长时间任务准备的模型。

在 Anthropic 公布的 Benchmark 里,提升最夸张的是 Terminal-Bench-Science 0.1:Fable 5 从 24.7% 提高到了 52.6%,直接翻倍。测试终端环境 Agent 能力的 Terminal-Bench 4.0 从 42.0% 提高到 55.8%,面向复杂商业工作流的 AutomationBench 则从 17.1% 提高到 31.4%。

Terminal-Bench-Science 0.1 科学 Agent 得分与成本对比

Terminal-Bench 4.0 编码 Agent 得分与成本对比

但如果换到更传统的推理和 Coding Benchmark,提升幅度就没有那么夸张。

Humanity's Last Exam 不使用工具时,从 57.8% 提高到 60.9%;使用工具后,从 63.8% 提高到 65.0%。CursorBench 3.2.0 从 70.5% 提高到 73.4%,知识工作 Benchmark GDPval-AA v2 则从 1723 提高到 1853。

Humanity's Last Exam 分数与成本对比

CursorBench 3.2.0 编码任务得分与成本对比

总体来看,Fable 5.1 的提升明显集中在需要模型连续调用工具、处理多个步骤、检查中间结果,再决定下一步行动的任务,而不是在所有能力上“均匀分布”。

早期企业测试也在重复这个趋势。

Browserbase 在其最难的浏览器 Agent Benchmark 中,让 Fable 5.1 完成了 82% 的任务,Opus 5 为 74%,Fable 5 只有 57%。

Browserbase 对 Fable 5.1 的测试评价引用图

Ramp 的一次测试里,Fable 5.1 在无人干预的情况下连续运行了 38 个小时。它先发现此前一个机器学习实验的结果其实受到了标签伪影的影响,随后自行修正问题,同时启动 6 组并行实验跑了一整夜,最后带着新的实验结果和下一步建议回来。在另一次开放式任务中,Ramp 只让它寻找“没人负责、但最值得解决的问题”,它自己找到了一个与生产事故有关、尚未有人处理的告警,调取日志并给出了修复方案。

Ramp 对 Fable 5.1 的测试评价引用图

Canva 给出的反馈则更偏向生成质量。其测试认为,Fable 5.1 的文字表达更容易理解,也更能遵循写作规范;在与 Fable 5 的盲测中,Canva 更偏好 5.1 的输出。并且,在 Canva Code 里,Fable 5.1 直接做出了一个节奏游戏:不仅生成了关卡和真实音乐,还让玩法节奏与音乐拍点对应。Canva 称,这是他们测试过的其他模型都没有做到的。

Canva 对 Fable 5.1 的评价引用图

从 Benchmark 到企业测试,Fable 5.1 这次最明显的提升在于,它开始更稳定地把复杂任务完整做完:既能在几十个小时的任务里持续判断、纠错和推进,也能在一次生成里把文字、代码、音乐和交互组织得更完整。

Claude 进入实验室

Fable 5.1 和 Mythos 5.1 看起来像是两款模型,但 Anthropic 在官方文档里说得很明确:Mythos 5.1 与 Fable 5.1 “identical”,区别只是为经过审核的用户提供了“more permissive safeguards”。

Claude Fable 5.1 与 Mythos 5.1 安全防护说明截图

也就是说,两者仅在安全限制上有差别:Fable 5.1 面向普通用户和企业开放,涉及网络安全和生命科学里的部分高风险能力时,会受到额外限制;Mythos 5.1 则通过受信任访问计划,把限制更少的同一套前沿能力开放给经过验证的网络安全和生命科学机构。

同一个 Benchmark 里两者有时会跑出不同的成绩,主要原因也在于此。比如在测试 Agent 终端操作和复杂任务执行能力的 Terminal-Bench 4.0 上,Fable 5.1 是 55.8%,Mythos 5.1 则达到 60.9%。Anthropic 的解释是,这并不是因为 Mythos 底层能力更强,而是部分网络安全任务触发了 Fable 的安全限制;当这些限制减少以后,两者的差距也应该随之缩小。

这次发布里,Anthropic 把相当大的篇幅留给了科研能力,而这部分也主要由 Mythos 5.1 展示。

其中最抢眼的一个实验,是让 Mythos 5.1 直接设计蛋白质 binder。

很多现代药物需要通过与人体内特定靶点结合,完成阻断、激活或者递送。Anthropic 给 Mythos 5.1 接入了开源的蛋白质设计和折叠工具,让它自行设计 binder,再把结果送到两家外部机构进行真实实验验证。

结果是,在 12 个靶点上,Mythos 5.1 设计的 binder 命中率接近 50%。Anthropic 称,目前蛋白质设计中常见的命中率大约只有 10% 到 15%;其中三个靶点上,模型设计出的 binder 结合亲和力,比 Adaptyv Bio 蛋白质设计比赛里的最佳方案高出约 10 倍。

Mythos 5.1 设计的 15-PGDH 蛋白质结合剂结构图

这里值得注意的并不是 Claude 又会了一道生物题,它真正做的是一段更完整的科研流程:调用专业工具进行分子设计,再把设计送进真实实验环境验证。

类似的事情也发生在计算科学里。

Fable 5.1 利用 NASA 三十多年前 Magellan 任务留下的雷达数据,自己训练了一个神经网络,为大约三分之一的金星表面重新生成高分辨率高程地图。

过去的地图能够分辨的地形细节大约在 10 到 20 公里尺度,新地图则缩小到 2 到 3 公里;Anthropic 称,高度数据的准确度最高提高了约 25%。这份地图随后被以 Creative Commons 许可公开,希望能为 NASA 的 VERITAS 和欧洲航天局的 EnVision 金星探测任务提供参考。

Fable 5.1 从 Magellan 雷达数据重建的金星表面高程图

此外,Mythos 5.1 还做了一件更加工程化的事情。

生物学研究经常需要反复运行蛋白质和基因组深度学习模型,GPU 速度直接决定很多实验要花多少时间和钱。Mythos 5.1 针对 7 个开源模型自行编写定制 GPU Kernel,并缓存中间计算结果,最终在保持输出完全一致的情况下,把推理速度最高提高了 2.5 倍。

Anthropic 估算,在一些全基因组分析任务里,这些优化可以把 GPU 成本降低 30% 到 60%。类似工作通常需要性能工程师团队花几周完成,而 Mythos 5.1 只用了几天,Anthropic 还计划把这些优化开源。

Mythos 5.1 对 7 个开源蛋白质与基因组模型的推理加速对比

把这些案例放在一起,Anthropic 对 Claude 科研能力的定义已经发生了变化。

过去谈 AI for Science,很多时候还是让模型读论文、检索资料、写代码或者解释结果。到了 Fable 5.1 和 Mythos 5.1,Claude 开始进入更长的科研流程。

这条路甚至已经开始从软件走向真实实验设备——就在 Fable 5.1 发布前一周,Anthropic 开放了 Model Hardware Standard(MHS)的研究预览,希望让 AI Agent 能够直接操作显微镜、液体处理设备和机械臂等实验室硬件。

Anthropic Model Hardware Standard 研究预览截图

随着能力往科研和高价值任务里走,Anthropic 不仅需要面对“该向谁开放”的安全问题,也越来越在意另一件事:怎么防止最核心的模型能力被别人“搬走”。

Fable 5.1 这次加入了更强的反蒸馏机制。Anthropic 在官方公告里直接点名了一种做法:过去,API 用户可以修改多轮对话里的历史上下文,同时保留 Claude 此前生成的 thinking 记录。这样一来,外部模型就有机会批量收集 Claude 的推理轨迹,用来训练和蒸馏自己的模型。

从 Fable 5.1 发布当天开始,新创建的 API 账号已经不能再这样操作。只要修改此前的对话上下文,之前保存的 thinking transcript 就不能继续保留。Anthropic 明确表示,这项改动就是为了封堵一种“已经公开记录的蒸馏技术”;现有账号暂时不受影响,但未来模型发布时,这一变化会逐步覆盖所有用户。

企业端的安全体系也在同时补齐。Anthropic 同时推出的 Enterprise Frontier Safeguards(EFS),就在试图解决 Fable 级模型过去一个很现实的矛盾:公司既希望保留足够的数据来检测模型滥用,金融、医疗、法律等企业又不愿意把敏感数据交给模型公司长期保存。

Anthropic Enterprise Frontier Safeguards 公告截图

EFS 的办法,是把监控所需要的数据直接存在客户自己控制的云基础设施里,而并非 Anthropic 的服务器。默认情况下,人工审查也由客户自己完成。Anthropic 称,这套机制与超过 100 家来自金融、医疗、制造、电信、法律等行业的客户共同开发,将从今年秋季开始分阶段上线。

从蛋白质设计、金星地图到漏洞发现,再到反蒸馏和企业安全,Fable 5.1 展示的不仅仅是一个模型。

Anthropic 正在模型之外,补上一整套让前沿能力进入科研和企业世界的权限、安全与基础设施。

Fable 5.1 之后,Anthropic 就要去华尔街了

如果目前的计划没有变化,再过几天,Anthropic 可能就要正式把自己的账本摆到华尔街面前。

The Information 最新报道称,Anthropic 计划在 9 月 7 日美国劳动节之后公开 IPO 招股书,并在 9 月中旬举行投资者日,最快可能在 9 月底至 10 月初上市。公司已经在 6 月秘密提交了 IPO 文件。

Anthropic IPO 相关新闻报道配图

放在这个时间窗口里,Fable 5.1 很自然地成为了 Anthropic 公开递表前的一次能力展示。

毕竟,等招股书真正公开之后,华尔街需要判断的可不是 Claude 能不能再在几个 Benchmark 里拿到高分,而是 Anthropic 究竟值多少钱。

今年 5 月,Anthropic 最近一轮私募估值达到 9650 亿美元。到了 8 月,《金融时报》采访的多名投资者已经预计,Anthropic 上市时的估值可能达到 2 万亿美元以上。投资者预计其年化收入年底可能达到 1000 亿至 1200 亿美元,其中一名投资者甚至按照公司的增长速度和 30 倍收入倍数,算出了 3 万亿美元。当然,这些目前都只是投资者自己的估值模型,最终发行价格还没有确定,而且计划随时可能调整。

如此高的估值,已经很难只靠 Anthropic 今天赚多少钱来解释。我们在之前的文章里对此有过更为详细的讨论。

路透社 8 月获得的内部财务预测显示,Anthropic 预计 2028 年收入达到 1900 亿到 2000 亿美元。而公司的年化收入 run rate,也已经从 2025 年底的约 90 亿美元,增长到今年 5 月的 470 亿美元,并在 7 月底进一步超过 650 亿美元。彭博社获得的文件还显示,公司二季度初步收入超过 115 亿美元,是去年同期的 14 倍以上,并首次录得正的调整后营业利润。

而华尔街已经开始按照未来几年的价值给它算钱了。路透社称,投行和投资者正在使用 2028 年的收入预测给 Anthropic 计算企业价值/收入倍数,并把 Palantir、Cloudflare 和 SpaceX 作为不同维度的参考对象。

就在即将上市的时间点上,Anthropic 仍在花大量的钱买 GPU、训练模型、做推理和扩张团队。

Fable 5.1 发布前一周,Anthropic 被曝与 Nscale 签下一份为期六年、价值 450 亿美元的算力合同,租用西弗吉尼亚州约 460MW 的数据中心容量。几天后,路透社又披露,Anthropic 与英伟达支持的 Lambda 签下约 350 亿美元云计算合同,对应得州 Nueces 县约 350MW 的数据中心。

Anthropic 与 Lambda 签署云计算合同新闻报道配图

仅这两笔新近曝光的算力承诺,就已经达到 800 亿美元(折合人民币约 5377 亿元)。

这也让 Fable 5.1 前面那些看似分散的变化,有了另一层意义。

一方面,它当然需要继续证明 Claude 处在前沿。Terminal-Bench-Science 翻倍、长时间 Agent 能够无人值守运行几十个小时,至少说明 Anthropic 还在不断把模型能力往前推。

另一方面,只证明“模型更聪明”显然已经不够。

蛋白质设计、科研计算、企业 Agent、网络安全,以及第二部分提到的 Enterprise Frontier Safeguards,都在把 Claude 推向一个方向:进入那些企业本来就愿意花很多钱解决的问题。

Fable 5.1 降低缓存读取价格也是同样的逻辑。Anthropic 没有参加基础 Token 的低价竞争,而是针对长时间 Agent,把典型工作负载的实际成本降低约 25%,高度 Agent 化任务最高降低约 45%。

模型更强,Agent 可以工作得更久;工作时间越长,又必须把单位任务的算力成本压下来。

这可能正是 Anthropic 上市以后最需要证明的一道算术题。增长已经足够快,问题是,在算力承诺也以数百亿美元的速度膨胀时,收入最终能不能跑得比成本更快。

Fable 5.1 的价值,不只是让 Anthropic 在递表前再拿下一张漂亮的 Benchmark 成绩单。从更长时间的 Agent,到科研和高价值企业任务,再到缓存降价、安全、权限和基础设施,Anthropic 正在试图证明一条更完整的链路:

模型能力可以变成工作,工作可以变成收入,而收入最终可以跑赢算力。

几天之后,等 Anthropic 公开招股书,这条链路就不再只是模型公司的产品故事。

它还会变成华尔街给 Anthropic 定价的依据。




上一篇:苹果新CEO首秀:折叠屏泄底、取关库克,9月9日还有什么底牌
下一篇:GPT-5.6降价80%引爆Token促销:AI大厂的“奶茶式”留存争夺战
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-10 16:57 , Processed in 0.781709 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表