找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4703

积分

0

好友

611

主题
发表于 1 小时前 | 查看: 6| 回复: 0

2026年2月6日,人类最后一次跑赢AI。

那天,人类在 OpenRouter 上用掉的 token ,第一次被智能体追平。

Peter Walker推文截图:2026年2月6日人类token消耗最后一次超过智能体

才半年时间,两条线已经拉开了5倍差距。

据 OpenRouter 统计,截至8月10日,Agent 类 token 用量从约0.51万亿涨到7.3万亿,翻了14倍;人类那条线也涨到了1.4万亿,但只有2.8倍。

OpenRouter 7日平均token用量按类型统计图:Agentic token超越人类

如此大的落差,让 Peter 都有点恍惚:像是隔了10年,可2月6日,其实只是半年前。

不看你是谁,只看你怎么用

先说清楚,这组数据打哪儿来、怎么算的。

OpenRouter 是全球最大的模型网关之一,一头接着约70家模型供应商,一头接着开发者,一周要处理28万亿 token。

按它的联合创始人兼 COO Chris Clark 估算,这大约是全球推理量的1%,其中一半来自美国。

这1%的 token,又是怎么分出哪些是人、哪些是 Agent 的?

OpenRouter 不看你是谁,只看你怎么用。具体办法是按 API key 追踪行为:工具调用得勤不勤,两次响应之间隔几秒,一轮对话来回几次。类似的信号一共7项,加权打个分,再把流量分成 Agentic、Mixed、Human 三档。

为什么看行为就能分出来?

道理很简单。人类用 AI 是问一句歇一会儿,中间要读、要想、要打字;Agent 则是一刻不停,工具连着调,回合循环跑。这节奏一看就不是碳基生物。

所以它是一套估算模型,但方向不会错。

一个人类目标,如今可能触发几十轮模型调用和工具调用。token 统计的不是有多少人在用 AI,而是 AI 替人干了多深的活。

一个 Agent 任务,顶一百次聊天

真正拉开人和 Agent 差距的,是双方用法的不同。

人类的请求长什么样?打开对话框,敲一段提示词,等一段回答,复制走,关掉。从头到尾,你和模型总共说了不到十句话,账面上撑死几千个 token。

但智能体的请求,完全是另一副样子。你给它一个目标,它就自己往下走了:读文件、调工具、写结果、再读、再改,一圈一圈磨到任务收尾。

人类在起手那段提示词里塞满了目标、规范和上下文,之后模型就在这份上下文上不断增量读写。当你还在一问一答时,Agent 已经能靠一句话跑一整天。

所以,同一个人,上午还在对话框里手动复制粘贴,下午挂上一个智能体去跑,token 账面立马就会换一个数量级。

Peter 的话一针见血:真正解锁量级的行为变化,是人们开始让智能体长时间自主运行。

再便宜的 token,也能烧穿预算

看到14倍,你的第一反应可能是烧钱。

确实是烧钱,但不是你想的那种烧法。

Peter 补充了一条:因为智能体天然是多轮的,平均一次智能体请求里,近70%的 token 来自缓存提示,而缓存的计价通常低得多。

道理不难懂。Agent 做的是围绕同一个目标反复读写:第一次把那一大堆上下文——代码规范、操作手册、工具清单——灌进去,付一次全价;之后每一轮只做增量更新,命中缓存的部分只按正常输入价的一小部分收。

换句话说,那条陡峭的曲线里,有近七成是被反复复用的同一段上下文。

Agent与人类缓存token使用对比图:Agent缓存率达86%

Agent 与人类的 token 构成对比,缓存 token 几乎贡献了全部增量。a16z 按总量口径写作85%以上,Peter 原帖按单次请求平均为近70%。

这样单价确实降下来了,但架不住用量狂飙。

Uber CTO Praveen Neppalli Naga 今年早些时候透露,公司工程师只用四个月就烧完了全年的 Claude Code 预算。据媒体转述,他本人一场两小时的演示,就花掉了1200美元。

单价打三折,用量涨14倍,这道乘法的结果并不难算。

EY 算过一笔更直观的账:同样一次客服交互,2023年成本约0.04美元,到2026年涨到约1.20美元,30倍。

不是模型变贵了。以前是客户问一句、系统答一句,一条线走到底。现在客户还是问那一句,但背后已经是查工单、调库存、翻记录,想一轮改一轮,折腾十几个回合才吐出一句回复。相同的事,干法变了,价钱就变了。

高盛则估算,智能体 AI 可能把2030年的 token 消耗推高24倍。

任何一项成本半年涨14倍,人们都会开始细抠。Peter 说,这正是开放权重模型和低价 token 服务突然被人盯上的原因。

而且,缓存 token 虽然便宜,它可是要吃内存的。智能体一跑好几个钟头,从头到尾不必重来一遍,靠的就是内存把那一整摊上下文托着。高带宽内存最近为什么这么紧俏,这里也能找到一半答案。

分水岭不在你用哪个模型

那省钱的办法,是不是换个便宜点的模型?

真正的分水岭,不在你用哪个模型。

同一个模型,你拿它当搜索框用,一天几千 token;你把它接上自己的文件、工具和一条能连续跑下去的流程,一天几千万 token 也不稀奇。差距不在模型,而在你有没有把它放进真正的活里。

这个鸿沟有多大,OpenAI 给出的一组数据可以当参照:用得最深的10%的公司,每名活跃用户输出的 token,是典型公司的8.3倍。1月份这个差距还只有2.6倍。

前沿企业与一般企业每位活跃用户输出Token数对比图

半年时间,差距扩大到原来的三倍以上。

拉开差距的不是模型,是配套。同一批统计里,头部公司的活跃用户每周有21%在用插件,典型公司只有9%;技能的采用率是19%对3%。OpenAI 自己内部,这个数字是95%。

把你常做的那几件事打包成一套可复用的技能,智能体就不必每次都从头摸索一遍。少搜几次、少返工几次,省下的都是钱。

token花了,谁来验收

不过,账算得再精,也不等于这活干得放心。

智能体流量暴涨,并不等于 AI 全在自主行动。大量任务仍然是人发起的,中间常常还卡着人工审批。Peter 原帖评论区一位做服务业客户的开发者提到,他服务的那些老板,从来没想过撒手不管,采购、发送、签字,每一步都要绕回人。

但问题是,绕回来未必真的能找到人。另一位从业者说,他们的智能体删掉了广告账户里的18个视频,整整一天之后才被人发现。

从业者评论截图:智能体删除18个视频无人发现

这不是模型犯了多离谱的错,而是根本没人去看那一步。

token 花销可以在半年里翻14倍,验收的人手却翻不了这么多。这大概是这轮增长里最容易被忽略、也最昂贵的一笔账。

分析、调研、初稿、方案,重复的执行动作往后都会过剩。真正稀缺的,是验证、判断,以及决定什么才值得被做。

AI 已经成了 token 的主要消费方,可到今天为止,它还不能替你签字。

未来,真正的问题不再是你用不用 AI。而是 AI 替你干完的那些活,谁来验收,谁来拍板下一步。在云栈社区里,已经有不少开发者在讨论智能体落地的验收机制与团队协作边界,这类话题正在从技术圈蔓延到业务决策层。

参考资料:




上一篇:产品经理3年跨8条业务线:陌生业务快速上手方法论
下一篇:Codex CLI 实战技巧:让 AI 编程助手少返工、可验收
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-26 04:29 , Processed in 0.805721 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表