几乎每隔一周,Anthropic 就会发几篇指责中国 AI 团队搞蒸馏的文章,顺带渲染一下“中国 AI 威胁论”。比如谣传中国 AI 创建了超过 24000 个虚假账户、产生了超过 1600 万次交互等等。
但实际情况是,眼下这个阶段,国产模型非但没有去蒸馏国外那几个头部 AI 模型,反而是海外的模型在持续吸收中国 AI 的开源成果。换句话说,最近 Opus 5.5 和 GPT 6.1 Sol 的价格能降下来,很大程度上是因为这两家公司悄悄用上了 DeepSeek 的开源技术。
而且使用下来的质量,跟旗舰模型 Claude Fable 5.1 和 GPT-6 Astra 几乎拉不开差距。
哈哈~
最让人不舒服的是,他们不仅没有一句感谢,反而还在不断通过文章或 CSheng 行为来攻击中国 AI。
国内这些先进模型的价格之所以能打下来,100% 可以确定是在 DeepSeek 发布 KV 缓存论文之后发生的。缓存优化这个堪称天才的发明,被梁圣慷慨地无偿分享给了全世界。
他们是第一个发布 MLA 架构的,将缓存压缩了大约 15 倍,随后又推出了“压缩稀疏注意力”和“重度压缩注意力”。最新的 DeepSeek-V4.1-Flash 通过 CSA2、跨层缓存复用、因果编码器-解码器架构以及 FP4 缓存将其进一步推进,将全局 KV 缓存降至每 token 890 字节。(摘录自 insufferable-dev)
毕竟在服务长上下文模型时,最大的成本之一就是 GPU 显存里那些 KV 缓存占用的空间。

这套缓存技术确实高效得吓人,一口气能把成本压缩几百甚至上千倍。我以前也专门写过文章聊这个,没有夸张成分,就是实话实说。
中国太缺 GPU 了,这也是没办法的事,逼着国内实验室把所有精力都砸在性能优化上,而不是一味去堆模型“智商”。不过说句实在话,如果梁圣当初没有公开这套缓存技术的成果,DeepSeek 基本就是旱地拔葱,手里攥着一张相当大的王牌。
至于“有没有蒸馏”这个问题,我其实很想反问一句:为什么中国实验室蒸馏一下 Anthropic 的模型就成了问题?难道 Anthropic 自己就没做过类似的事?难道它不是照样大规模抓取全世界文本语料来训练模型?
按这个逻辑,所有文本的原始作者和开源软件作者,是不是也应该排队谴责 Anthropic 的达里奥?哈哈,想到这里就有点万物皆无意义的意思了……
问题的关键在于,是 Anthropic 先开了这个抱怨的头。本来 LLM 的训练,本质上就是大规模地、未经明确同意地使用人类文本等知识产权。不抱怨还好,大家心里默认了——毕竟学习本身就是这么回事。当一个人创造了某样东西,其他人会观察它并从中学习。每一个共同生活的人类群体,以各种形式实践这件事,已经长达数万年甚至更久。这个就叫学习。人类创造的知识,本来就是全人类的共同产物。我们都是站在巨人的肩膀上。
大家还记得比尔·盖茨对乔布斯说的那句话吗?
“我们都是小偷,史蒂夫。我们都从施乐偷了东西。你只是气我先到了而已。”
非得开这个抱怨的头,真的没什么道理。

有个老外的评价我觉得挺到位:“如果中国模型这么做,我对它们的意见要小得多,因为它们免费开放自己的模型,而西方的大型 LLM 提供商只抛出零星碎片,而非其主要工作成果。所以他们不仅虚伪,我还很确定,如果中国模型没有被公开发布,他们根本不会这么大张旗鼓。”
不过,我其实很想知道的是:为什么国产模型有那么多都选择了开源?是为了抢占生态的领先地位吗?关于大模型的开源策略,这确实是个有意思的话题。
以及另一个更尖锐的问题:一旦国产模型真正取得领先,它们会不会立刻转向闭源,把模型权重锁死?
在这个人工智能技术快速迭代的窗口期,开源与闭源的博弈恐怕还会持续很久。而 Anthropic 这种一边用着开源红利、一边忙着指责别人的姿态,说实话,真不如多花点精力把模型本身做好。