先给你看一组数据。
2026年8月底,Google Research发布了一篇论文。他们把一个90亿参数的模型(业内叫9B),和一个270亿参数的模型(27B),放在同样的五个基准测试上同台较量。
按照行业常识,这场比赛毫无悬念。参数量差了整整3倍,算力、内存、训练成本都不在一个量级。这就像让一支业余球队去踢皇马,输,是唯一合理的结果。
结果出来,业余球队赢了。
9B的模型,加上一套叫WikiSkill的架构,平均成绩47.4%;而27B的裸模型,只有39.4%。
小模型,打赢了大模型。不是靠堆算力,不是靠练得更大,而是靠一套“攒经验”的方法。
这件事值得所有正在拥抱AI的企业和个人认真琢磨。因为它背后藏着一个远比参数大小更重要的问题:
在AI时代,经验和知识,到底应该怎么管?
一、先讲一个你一定见过的场景
我猜,你所在的公司大概率发生过这样一幕。
一位干了十年的老师傅离职了。走的那天,他按规定交接了所有文档、代码、账号。流程上,没有任何问题。
可一个月后你就发现,真正值钱的东西,他带走了。
那个大客户为什么每年都拖到12月底才打款,是因为对方公司的财务制度;那台进口设备为什么开机前必须空转五分钟,是当年一次事故换来的教训;那个审批流程为什么看起来绕远,实际上是为了绕开某个部门的内部矛盾。
这些东西,从来不在任何文档里。它们在老师傅的脑子里,是十年、二十年踩坑攒出来的。公司花十年养出来的经验,在他办完离职手续的那个下午,一夜归零。
然后呢?新人进来,把同样的坑,原封不动地再踩一遍。客户重新得罪一次,设备重新修一回,流程重新吵一轮。
面对这个问题,大多数公司的解法是:建知识库。把老师傅请回来,让他写文档、录课程、开讲座。
效果怎么样?你大概也见过:写出来的,要么是一份干巴巴的操作清单,要么是没人打开过的培训 PPT 。经验还是没有留下来。
为什么?
因为“经验”“知识”“技能”,看起来是一回事,其实是三种东西。把它们混在一口锅里,就永远管理不好。
而Google这篇论文,恰好把这件事用工程师的语言讲清楚了。
二、Google的解法:把三种东西,分三层放
WikiSkill 是给 AI Agent 设计的进化架构。所谓 Agent,就是能自己干活、自己调工具的 AI 系统。这个架构把 Agent 的成长拆成三层,每层只干一件事。
这个分层,值得逐层拆开看。因为你会发现,它简直就是一份优秀公司的知识管理蓝图。
第一层,叫 Raw Layer,存原始记录。
Agent 每次执行任务的完整过程——它怎么思考的、调用了什么工具、结果成败与否——全部原样保存,而且规定:不可修改。
注意这个细节:不可修改。
为什么这么死板?因为原始记录是事实依据。后面所有的复盘、分析、改进,都要回头翻这些档案。如果记录可以被随手改掉,那所有的分析都建立在流沙之上。
对标到企业,这就是原始凭证思维:会议纪要、客户沟通记录、事故现场报告,第一时间原样归档,谁也不许动。多少公司的“复盘”最后变成互相甩锅,根子就在第一步——事实已经被加工过了。
第二层,叫 Wiki Layer,这是整个架构的心脏。
它把零散的原始记录,编译成结构化的知识:失败的模式、成功的策略、每次改动的来龙去脉,一份一份沉淀下来,跨任务持续积累。
这里有两个设计,我认为是整篇论文最精彩的部分。
第一个:知识永不回滚。
WikiSkill 的进化循环里,AI 每轮会提出技能改进方案,然后接受验证。验证不过,方案就作废,技能退回上一版——但是,支撑这个方案的所有分析、所有踩坑记录,一条不丢,永久保留。
什么意思?就是这次尝试虽然失败了,但“为什么失败”成为了公司的永久资产。下一轮改进时,系统会先看到上一次的失败分析,同一个坑,绝不踩第二次。
你对比一下现实中多数公司的做法:项目黄了,复盘会开完,报告发个邮件,然后石沉大海。半年后另一个团队接着做一个类似的项目,把同样的错,再犯一遍。
失败的尝试可以回滚,失败的认知必须沉淀。这一条,99%的公司做不到。
第二个:知识和技能严格分开。
知识回答“我们知道什么”,技能回答“我们该怎么做”。以前的方法把这两样搅在一个技能文件里,结果每次修改技能,背后的推理依据就丢一次。WikiSkill 把两者拆开:知识层持续积累,技能从知识里生长出来,并且每个技能都附带一份“立法说明”——记录它是为了解决哪个问题而诞生的。
这就像公司发制度文件。差的制度只有条款,没有背景,执行者不知道为什么这么规定,最后要么机械执行,要么阳奉阴违。好的制度每条都附立法说明,改制度的人能看懂初衷,不会一刀切死。
第三层,叫 Skills Layer,真正干活的部分。
当前生效的技能都放在这层,Agent 执行任务时直接调用。它是前两层的最终产出:原始记录喂养知识层,知识层孵化技能层。
三层看完,你发现了吗?这就是一个组织的知识进化模型:事实层保证真实,知识层负责沉淀,技能层负责执行。
三、数据不会说谎:四组数字,四个洞察
理念讲完了,来看论文的实验数据。五个基准测试、五个不同规模的模型,四组结果,每组都有商业含义。
第一组:模型越强,从“攒经验”中获益越大。
在 Qwen 模型家族里,WikiSkill 带来的提升随规模递增:4B 模型涨 12.3 分,9B 涨 17.5 分,27B 涨 23.9 分。
这打破了一个常见的迷思——“我们模型还不够强,先不搞知识管理”。恰恰相反:底子越好的人,越需要好的方法论。给顶尖运动员配备科学训练体系,收益远大于给业余选手。所以,越是 AI 用得深的团队,越应该尽早搭知识沉淀的架构。
第二组:9B 加技能,超过 27B 裸模型。
这就是开头那组数据:47.4% 对 39.4%。
参数量差 3 倍的差距,被一套“攒经验”的架构填平了,还反超。这对算力预算有限的中小企业,是个巨大的好消息:你买不起最大的模型,但你养得起最好的知识库。规模上的劣势,可以用积累上的优势来换。
第三组:别的模型攒的技能,比自己的还好用。
这是最出人意料的一条。9B 模型使用 27B 模型进化出来的技能,成绩 70.2%;用它自己攒的技能,只有 63.4%。
“别人总结的方法论,比自己摸索的还管用”——这在商业世界里太常见了。咨询公司的价值,本质上就是这个:把一个行业里最聪明的大模型(头部企业)的实践经验,提炼成方法论,卖给执行力强的小模型(中小企业)。
论文从技术层面证实:总结策略的能力,和执行策略的能力,是两种可以分离、可以交易的能力。
第四组:抽掉知识层,成绩暴跌 15 分。
消融实验显示,去掉 Wiki 层的访问,平均分从 63.7% 掉到 48.7%。
这一组数据是给所有“重执行、轻沉淀”的组织的当头一棒:技能层再怎么努力,没有知识层的持续喂养,复杂问题的失败模式就是兜不住。反过来推:一家公司如果只考核“干了多少活”,从不考核“沉淀了什么”,它的能力天花板,已经写死了。
四、对企业,对个人,这意味着什么
把视角拉回来。WikiSkill 是给 AI 设计的,但它的底层逻辑,对企业和个人同样成立。
对企业的启示:AI 时代的竞争,正在从“买什么工具”,转向“攒了什么知识”。
2023 年,大家比谁先接入大模型;2024 年,比谁的 prompt 写得好;到了今天,工具的差距越来越小——你用的模型,竞争对手也在用。真正的护城河,变成了那层“Wiki”:你的客户数据沉淀、你的失败案例分析、你的业务知识库。这些东西,买不来,抄不走,只能一天天攒。
所以给企业三个具体建议:
第一,建立“不可变”的原始记录制度。AI 应用的每一次对话、每一次产出、每一次人工修正,原样归档,这是所有进化的原料。
第二,定期把记录“编译”成知识。每月做一次复盘,把零散的案例提炼成“什么情况、怎么处理”的模式库。注意,是持续积累,不是一次性上系统。
第三,让知识长成技能,并给技能附上“为什么”。SOP 不是抄来的模板,而是从自己的知识库里长出来的动作,且每条动作都写清设计初衷,方便日后迭代。
对个人的启示,只有一句话:
你和 AI 协作的每一次经验,要么随风飘散,要么复利增长。区别只在于,你有没有自己的“Wiki 层”。
同样是每天用 AI 写方案,一种人用完就关;另一种人把好用的指令存进文档,把踩过的坑记成清单,三个月后,后者手里的 AI,已经不是当初那个 AI 了——不是模型升级了,是他的技能库进化了。
论文里有句话我印象很深:知识回答“我们知道什么”,技能回答“我们该怎么做”。
个人成长也是一样。知道,是 Wiki 层;会做,是 Skills 层。大多数人卡住的地方,是既不沉淀知识,也不刻意把知识转化成动作。
最后的话
回到开头那场比赛。
9B 打赢 27B,赢的当然不是那 90 亿个参数,而是参数背后那套让它不断变强的系统。
技术会过时,模型会迭代,这一代最强的大模型,三年后也会被更强大的后辈取代。但有一件事不会过时:把经验变成知识,把知识变成能力,这个循环本身,才是任何时代都稀缺的进化引擎。
对组织如此,对个人,亦然。
技术越强大,沉淀越值钱。这是 AI 时代,每个人都该记住的一条法则。