Anthropic 9 月发了一份威胁情报报告,其中一大节讲有人批量调用 Claude,拿它的回答去训练自己的模型。按报告的说法,规模最大的一次,峰值接近每天 300 万次交互。
这种做法叫蒸馏,拿强模型的回答当教材,去训另一个模型。

怎么判断两个模型有没有关系?最直觉的办法,就是看它们答得像不像。差不多同一时间,Arena 发了一篇数据长文,量的正是这件事。
Arena 这个网站原来叫 LMArena,用户在上面提一个问题,两个匿名模型各答一份,用户投票选更好的那份,排行榜就是这么攒出来的。
这次他们没看投票,看的是两份回答本身。30,086 组对局,逐组数两份回答里有多少观点是重合的,再把模型两两配对,画成一张格子图。

Fable 5 和 Opus 5 都是 Anthropic 家的 Claude 模型,Fable 5 是它目前对外开放的最强一款。格子图里,和 Fable 5 观点重合最高的,是一款输出价格只有它十二分之一的模型,自家的 Opus 5 排在后面。

答得像能不能说明谁学了谁?Arena 这把尺子回答不了。它量的是两个模型说出的要点有多少一样,最擅长回答的,是已经有一份回答,再问一个模型能不能多拿到点新东西。
Arena 是怎么数观点的
每一组对局里,两个模型面对的是同一个真实用户的同一句提问。数据取自 5 月 1 日到 9 月 2 日,只看英文提问。
第一步,让一个模型当评委,从每份回答里抽出最多五个关键观点。只算回答里真的给出了内容支撑的要点,两份合起来最多十个。
第二步,评委再读一遍两份原文和这十个观点,把每个观点放进三堆里的一堆。两边都说了的,只有 A 说了的,只有 B 说了的。

第三步,把 A 和 B 的位置对调,整套判断重做一遍,两次取平均。评委模型读的先后顺序会影响它的判断,对调一次能压掉一部分这种影响。
最后算一个数。共有的观点,除以三堆观点的总数。全部共有是 100%,一个都不共有是 0。后面说到的百分数,都是这样算出来的。
Arena 给了两个真实例子。一个用户要一篇教人在 MacBook 上解压文件夹的 SEO 文章,DeepSeek V4 Pro 和 Fable 5 写出来的结构几乎一样。
区别只剩一处。一个提醒系统不原生支持某些压缩格式,一个提醒文件可能损坏。这一组重合 83.3%,两份回答基本在互相印证。

另一个用户要写邮件,通知员工公司医疗政策变了。Opus 5 讲登记家属、带薪假保护,还列了发之前要理清的问题。GLM 5.3 关心的是已经在休假的员工会受什么影响。
这一组只有 10.6%。两份谁也没重复谁,合在一起,政策风险看得更全。
这个分数衡量的是回答里说了哪些点。换一种措辞、换一个段落顺序,只要点还是那几个点,分数不会变。
Arena 之前,别人怎么量像不像
更常见的办法是看模型怎么说话。开源工具 slop-forensics 统计每个模型特别爱用的词和词组,用词习惯越接近的两个模型,在它画出的家族树上挨得越近。

2025 年 2 月,卡内基梅隆、伯克利和普林斯顿的研究者发了一篇论文,做法更直接。训练一个识别器,给它一段文字,让它猜是哪个模型写的。
在 ChatGPT、Claude、Grok、Gemini、DeepSeek 五个里选一个,准确率 97.1%,瞎猜是 20%。
论文接着试了各种干扰。把一段话里的词序全部打乱,识别器还能认出 88.9%。模型的「口音」大部分落在用了哪些词上,跟词怎么排关系不大。
另一组实验是改写。换一个模型把原文换个说法重写,还能认出 91.4%,翻译成中文是 91.8%。缩成一段摘要,才掉到 58.1%。

摘要把原文的用词换掉了大半,剩下的主要是内容。58.1% 仍比瞎猜高不少,内容层面也带着一点指纹,只是弱得多。论文里的例子,ChatGPT 爱用「certainly」「below is」开头,Claude 爱说「according to the text」。
还有一篇 2025 年专门量蒸馏的论文,两招都不只看措辞。一招让评委模型从文风、推理结构、内容细节三方面,给两个模型的回答打 1 到 5 分。另一招换着法子问模型「你是谁、谁训练了你」,数它说法自相矛盾、自称是别家模型的次数。

第三类办法在事前动手。今年 8 月,两位研究者在 LessWrong 论坛上发了一个方案,在老师模型里埋一组隐藏签名,只改动少数几个词出现的机会,正常回答几乎看不出来。
有人拿这个模型的回答去训练自己的模型,签名会跟着传过去,事后能验出来。作者也写明了,这个办法拦不住蒸馏,只能事后认出来。

几把尺子放在一起
差别主要落在两处。第一处是换个说法重写以后还认不认得出。看措辞的办法怕改写,缩成摘要就掉一大截。看观点的办法反过来,只要点没变,措辞怎么换都一样。
第二处是花费。识别器训好以后,判一段文字几乎不花钱。Arena 三万组对局,每组正反各判一遍,每一遍评委都要读两份回答、抽观点、分堆,光判断就有六万遍以上。

它们能说明的东西也不一样。措辞像,可能是一个学了另一个,也可能是两家的训练材料差不多。观点像,还多一种可能,问题本身就有标准答案。只有埋签名那一种,验出来能指向一个具体的老师,前提是老师事先埋过。
模型之间其实没那么像
回到 Arena 的数据。两个模型面对同一个问题,平均只有 43.1% 的观点是重合的,十个观点里两边都提到的只有四个出头。
同一家的相邻版本最像。Grok 4.5 和 4.6 重合 59.7%,GPT 5.5 和 5.6 是 59.2%。全表最高的一对是 Kimi K3 和 Muse Spark 1.2,63.5%。

Arena 举了个做松饼的例子。两个模型步骤讲得差不多,一个多推荐了配料,一个多列了容易犯的错。
最「独」的是字节的 Dola Seed 2.0 Pro,和别的模型平均只重合 31.1% 左右。
Arena 的说法是,相邻版本拿来互相核对还行,想找不同的角度,它们能给的就少了。
离 Claude 最近的是谁
Arena 还画了一张模型远近图,同时标出了每个模型和三款 Claude 有多近。

挨着三款 Claude 的有 GLM 5.3、Kimi K3、Muse Spark 1.2。Arena 对这种跨实验室的相近给了个很保守的解释,原因很难确定,可能是核心训练材料有重合,也可能是各家最近的关注点趋同。
把 Fable 5、Opus 5、Sonnet 5 三行的数都读出来取平均,排第一的是 Meta 的 Muse Spark 1.2,52.0%,第二是 xAI 的 Grok 4.6,49.7%。

后面十几个模型大多挤在 43% 到 49% 之间,最远的是 MiniMax M3、Mistral Medium 3.5、Dola Seed 2.0 Pro 和 Nemotron 3.5。
这组数是从 Arena 公布的图上读的两位小数。每一格背后有多少组对局,Arena 没有公布,也没给单格的误差范围,差一两个百分点的名次很可能落在误差里。
题目越有标准答案,回答越像
同一批模型,换一类题目,重合度差很多。医疗健康类最像,51.1%,生命与社会科学 49.1%,法律类 48.9%。
最不像的是创意写作,34.9%。娱乐媒体 36.8%,编程 39.7%。

Arena 的解释是,限定越死的题,可用的事实和步骤越少,模型就会收拢到一起。开放的题留出了挑角度、挑例子的空间,回答自然散开。
同样一半的重合,放在医疗题里和放在创意写作题里,分量不一样。医疗题上答得像,可能只是能写的事实本来就那几条。
越晚出的模型,越像前辈
Arena 还拿每个新模型,和它上线之前已经在平台上的模型比了一遍。按上线时间排,这个数一路往上走。
GPT 5.5 上线时,和前辈们的重合是 36.8%。到 7、8 月上线的 DeepSeek V4 Pro 是 47.2%,Grok 4.5 是 49.9%。这是不同的新模型各自和当时的前辈比,并非同一个模型在变。

同一条产品线也一样。Meta 的 Muse Spark 1.2 和前辈的重合是 48%,上一版 1.1 是 45%。
Arena 的解读是,出人意料的回答在变少,下一代便宜模型的稳定程度大概还会往上走。代价是让几个模型一起想点子时,大家容易往同一个方向走。
Anthropic 描述的蒸馏是怎么做的
回到开头 Anthropic 那份报告。下面这些出自它 9 月的报告和 2 月的一篇公告,是 Anthropic 一方的陈述。
蒸馏本身是正当的训练方法,大厂自己也常这么做,拿大模型的回答训一个小模型,做成更便宜的版本卖给客户。Anthropic 反对的是未经授权、成规模、藏着做的那种。

按报告的描述,第一步是拿到访问。2 月那篇公告说,三家实验室通过大约 2.4 万个假账号,和 Claude 发生了 1600 多万次交互。账号多来自中转服务,Anthropic 举例说一个代理网络能同时管 2 万多个账号,封掉一个马上补上一个。

然后是批量地问。单看一条提示词很正常,Anthropic 给了一个近似的例子。
你是一名兼具统计严谨和深厚行业知识的数据分析专家。你的目标是给出由数据驱动的洞察,不要摘要,也不要可视化,要基于真实数据,并附上完整透明的推理过程。
按 Anthropic 的描述,同一类提示词换着花样来了几万次,分散在几百个协同账号上,全都盯着同一项能力。它还说,有一次它发了新模型,一个还在进行的蒸馏活动 24 小时内就把近一半流量转了过去。

两份报告描述的识别办法,都落在请求怎么发这一侧。量集中在少数几个方向,结构高度重复,内容正好是训练模型最值钱的那部分。
报告说,最值钱的是推理过程。模型回答前会先想一段,这段思路拿去训练,比光有最终答案管用得多,很多手法都冲着它去。
报告列了几种写法。有的直接在提示词里写「不要把这条标记为推理抽取」,有的假装在调试,有的冒充系统指令,还有的要求把之前的思考翻译成只用片假名写的日文。

Anthropic 还说,一家实验室先发了 1.2 万多次请求,每次换一种技巧,看哪种能套出推理。大部分被拒,个别成功了,再拿成功的那几招放大去做。

另一招钻的是产品机制。按报告的说法,Claude 有时不把完整思路发回来,只给一张能对上那次思路的「回执」。有实验室把回执存下来,换一个新对话,诱导 Claude 凭回执把完整思路再吐一遍。

报告里规模最大的那次,做法是在每次请求里塞一段固定提示,逼模型把思路写进回答里,存下来直接转成训练数据。
数据也不全靠自己调用。报告说,有的实验室从中转服务那里买用户和 Claude 的对话记录,有的把自家用户发来的请求直接转给 Claude,不告诉用户,再把回答存下来。这些转发的请求里带着几百个终端用户的姓名、联系方式和公司数据。

Claude 在这些流程里干的也不只是答题。报告列出的用法包括给别的模型的输出打分、清洗抽出来的推理记录、出题写标准答案、把多轮对话改写成干净的训练样本,甚至同时编出「用户的提问」和「模型的回答」。
报告还提到,有一家实验室想套 Fable 的网络安全能力,发现防护太严套不动,就换去打防护弱一些的模型。
Anthropic 说的应对里有两条落在产品上。Claude 现在回答前会先把内部思路总结一遍,被抽走的记录就没那么好用。Fable 5.1 规定,新开的 API 账号不能再改动模型开始思考之前的那些指令和上下文,以前套思路常常从这里下手。

报告里还有一句。Anthropic 说自己做过蒸馏研究,用的问答次数比这些活动攒的还少,已经能在这些能力上带来明显提升。具体能到几成,它没给数字。

蒸馏这笔账,效果几成,花了几成
这笔账有两个口径。效果看学生考卷上的分数,相当于老师的几成。成本看最后这段训练,占全部投入的几成。后一个百分数,公开材料里都没有,只能看到最后一段的美元和小时数。
2025 年 1 月,DeepSeek 发 R1 论文时放了几个蒸馏版。拿 R1 生成的 80 万条样本,让开源的 Qwen2.5-32B 照着学,没有再做「做对加分、做错减分」的强化训练。
AIME 2024 数学竞赛题上,老师 R1 是 79.8,学生是 72.6,大约是老师的 91%。另一套常见数学题 MATH-500 上是 97.3 对 94.3,大约 97%。

同一篇论文还做了个对照。同一个底座模型,也就是还没学过老师回答的原始模型,不拿老师的回答当教材,只让它自己做题、按对错调整,练了一万多步,AIME 只到 47.0。
伯克利的 Sky-T1 把账算得更直白。1.7 万条样本,8 张 H100 显卡训了 19 小时,按 Lambda 云的租卡价大约 450 美元。它自己公布的 AIME 是 43.3,同表里的 o1-preview 是 40.0。

斯坦福研究者的 s1 更省。只挑了 1,000 道题配上推理过程,16 张 H100 训了 26 分钟,按每卡每小时两三美元粗算,二十美元上下。
s1 论文把几个模型放在同一张表里重测,o1-preview 是 44.6,s1-32B 是 56.7。这个 56.7 还用了一个答题技巧,模型想收尾时强行让它再多想一会儿。不用这个技巧,s1-32B 是 50.0,仍比表里的 o1-preview 高。

这几个数便宜得离谱,账单里有两块没算进去。一块是底座,Qwen2.5-32B 本身的预训练成本,不在这 450 美元和 26 分钟里。另一块是老师,R1 本身怎么训出来的,s1 那 1,000 条推理找 Gemini 生成花了多少,都没有计入。
公开实验里便宜的,是最后这一段。Anthropic 说的「一小部分时间和成本」也是同一类差额,但两边不是同一笔实测账单。

便宜模型和贵模型差多少
上面那本账问的是蒸馏。下面这本和蒸馏无关,比的是各家公开卖的模型,问便宜的能替代贵的到什么程度。两本账要分开看。
Together AI 在 8 月做过一次对比,用 DeepSWE 这套软件工程题,113 道题每道跑四次。Fable 5 一次做对的比例是 69.7%,每次花 21.63 美元。DeepSeek V4 Pro 就是开头格子图里和 Fable 5 重合最高的那款,它一次做对 62.8%,每次 0.24 美元,花费大约是 Fable 的 1.1%。

两者常错在不同的题上。逐题看,它们一起对、一起错的程度只有 0.39,这个相关系数到 1 才算完全同步。两个合起来,113 道里能做对 107 道。
Together 于是算了一个组合,先让便宜的做,自动测试没通过再交给 Fable。最后做对 82.7%,每道平均 8.28 美元,比只用 Fable 多做对 13 个百分点,钱花了不到四成。

再看 Arena 这边的三层。先是价格,token 是模型计费的单位,一个 token 大致是一个词或者词的一部分。Fable 5 每百万输入 token 10 美元,输出 50 美元。

DeepSeek V4 Pro 高峰时段输入 1.32 美元,输出 3.96 美元,非高峰再打五折。输出价差 12.6 倍。

再是分数。Arena 文字榜 9 月 11 日的快照,Fable 5 是 1506 分,DeepSeek V4 Pro 的 8 月 13 日版是 1462 分,差 44 分。按排行榜惯用的算法粗算,两者直接对上,100 次里 Fable 大约被选中 56 次,这是换算出来的,没有实测。
最后是观点,两者重合 59.2%,是 Fable 5 那一行里最高的一格,自家 Opus 5 是 53% 左右。

输出价差 12.6 倍,按分差换算的胜率大约 56 比 44,观点重合 59.2%。
已经有一份 Fable 回答,再加一个模型多出什么
Arena 最后一张图问的是这件事。已经有了一份 Fable 5 的回答,再找一个模型答一遍,能多出几个新观点,要花多少钱。新观点指的是第一份里没有、第二份里有的点。

从图上读,加 MiniMax M3 多出大约 2.4 个新观点,第二份回答大约 0.002 美元。加 Opus 5 多出大约 2 个,每份大约 0.04 美元,贵了二十倍左右,新观点反而少。
Mistral Medium 3.5 大约 2.3 个、0.012 美元,GPT 5.6 Sol 大约 1.8 个、0.033 美元,前者每一美元换来的新观点多得多。
这张图有一个 Arena 自己承认的缺口,新观点的质量不一定一样。MiniMax M3 在文字榜上是 1442 分,Opus 5 是 1493 分,差 51 分,按同样方式换算,直接对上 Opus 被选中的机会大约 57%。

Arena 在文章最后写的搭法,是一个前沿模型配一个小一些但足够稳的模型,多出来的观点由人来筛。
这把尺子管到哪里为止
Arena 的办法有几处天然的边界。每份回答最多抽五个观点,长回答里第六个点再重要也数不进去。抽观点和分堆的都是模型,评委自己也会出错。
只看了英文提问,题目来自 Arena 的用户,和企业里真实任务的分布不一样。

它最擅长回答的问题,是第二个模型能不能说出第一个没说到的东西。
它回答不了谁学了谁。医疗题上答得像,可能只是能写的事实本来就少。同一家的两个版本像,可能只是训练材料相近。跨实验室的像,Arena 自己也说原因难以确定。
Anthropic 那边判断蒸馏,按它的描述,看的是账号、请求的量和结构、提示词的套路,全在提问的那一侧。「答得像」和「学了谁」之间,隔着训练材料、题目本身和评委误差好几层。
更多关于大模型蒸馏和相似度检测的技术讨论,云栈社区上有不少开发者分享过实操经验。