找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

6162

积分

0

好友

779

主题
发表于 前天 19:44 | 查看: 2| 回复: 0

AI算力与高性能计算硬件融合概念图

AI 开始优化 AI,循环加速由此启动。

2.8 万亿参数的大模型,到底该怎么跑快?

最近,海内外团队都把目光投向当前最大的 开源模型——Kimi K3。K3 以 2.8 万亿总参数、104B 激活参数刷新了开源模型的能力上限,但普通 AI 服务器很难承载这么大的体量。Kimi 官方建议使用 64 卡甚至更大规模的 AI 服务器才能装下。有业内人士透露,未经深度优化的超节点跑 Kimi K3,初始性能可能只有 10 tokens/s 左右。

2025-2026年各旗舰开放模型参数量变化折线图

围绕“如何让 2.8 万亿参数的 Kimi K3 跑得更快”,国内外团队几乎同时给出了答案。

9 月 21 日,浪潮信息在 AICC 2026 发布元脑 SD200 Ultra 超节点 AI 服务器,通过紧耦合 128 颗本土 AI 芯片,单机承载 2.8 万亿参数的 Kimi K3,Token 生成时延首次压到 5.85 ms。

浪潮信息元脑SD200 Ultra超节点AI服务器发布会现场

9 月 23 日,海外 TPU 推理优化团队 Inferact 开源 tpu-megakernels,用 16 颗谷歌 TPU v7 芯片把整个 K3 装进一个 kernel(内核),再配合 DSpark 投机解码,低并发 Decode 吞吐达到 709 tokens/s。

Kimi K3 在16×TPU v7 与 16×GB200 上的 tokens/s 对比

一边是本土芯片的商业化超节点,一边是 Google TPU 上的开源推理项目,两条路线指向同一个技术方向:打破算子边界,把大模型推理的计算过程融合到极致。

大模型推理的竞争,正在从模型算法层下沉到系统软件、芯片互联与内存管理层。

01 万亿 MoE 太难跑,海内外团队同时盯上算子融合

万亿参数大模型推理为什么慢?很多人第一反应是算力不够,但实际上瓶颈更多来自数据搬运和内存带宽。

据 SemiAnalysis 分析,K3 一次前向计算对 HBM 的带宽需求约为 1.5TB;896 个 Expert 分布在不同芯片上,每次前向还会触发超过 120 次 All-to-All 通信。即使芯片算力很强,数据传输跟不上,大量计算资源也会被白白闲置。

Decode 阶段的矛盾尤其突出。每生成一个 token,模型都要持续读取大量权重。vLLM、TensorRT-LLM 等传统推理框架通常会启动大量 Kernel,每个 Kernel 完成自己的加载、计算和写回,再启动下一个 Kernel。

计算之间因此出现大量细小的“空泡”,这些碎片化空泡累积起来,就形成了实际速度与理论峰值之间的差距。

既然 Kernel 边界是浪费的来源,那能不能干脆消灭边界?

Inferact 的思路是把整个模型变成“一个 Kernel”。其 megakernel 方案基于 Google Pallas,将 K3 的 92 个 MoE 层放到一次 Pallas 调用中,在一个 Kernel 内完成整个解码过程。计算当前层时,下一层权重就可以通过异步 DMA 提前从 HBM 搬到片上 VMEM。

这套打法的关键,是 TPU v7 的架构特性:每个 TensorCore 自带 64 MiB VMEM,数据进入 VMEM 后,生命周期可以由程序显式控制。Kernel 作者可以主动安排哪些权重提前搬运、哪些激活继续驻留、哪些数据用完立即释放。说白了,Inferact 做的是把整个模型当成一条连续的数据流。

Inferact megakernel 数据加载、计算与存储流水线时序图

浪潮信息没有把整个模型彻底压成一个 Kernel。

团队的做法是,把大量基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。针对 K3 的推理特点,他们将 KDA、Gated MLA、MoE 中的众多基础算子融合为计算与通信协同执行的大算子,算子数量降低 10 倍,模型推理性能提升 3 倍以上。

SD200 Ultra 超级算子:算子数量降低10倍,推理性能提升3倍以上

具体分两步。第一步,把细粒度算子“焊”成大算子,减少中间停靠。按片上存储容量划分数据块,让前一步的结果直接留在寄存器或片上缓存中供后一步使用,减少 kernel launch 次数,也避免中间结果反复写入和读取 HBM。

第二步,把通信和计算融合,让数据传输与计算同步进行。超级算子按照 Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让下一块数据预取、当前数据计算和上一块结果写回同时进行。跨芯片通信也按 Tile 推进,把通信延迟尽量藏进计算过程里。

可以看到,前者把整个 Decode 过程放进一个 megakernel,后者把大量细粒度算子融合成超级算子。它们共同指向一点:传统“一个 Op(算子)对应一个 Kernel”的计算方式正在松动。

02 用 K3 优化 K3:让 AI 参与超级算子优化

超级算子能减少推理中的数据搬运与等待,但它的设计和优化本身也是一项复杂工程。数据如何复用、计算与通信如何衔接、不同阶段如何形成流水,都需要结合具体模型和硬件条件去设计和验证。

这些工作过去需要大量人工投入。能不能让 AI 参与其中,提高超级算子的生成与优化效率?

为此,浪潮信息在元脑 SD200 Ultra 适配 Kimi K3 的过程中引入了 超级算子智能体,让 Kimi K3 参与自身推理优化。针对 K3 的推理特点,智能体生成通算融合、Tile 级流水的超级算子,推动计算、通信与数据搬运协同执行。

浪潮信息首席 AI 战略官刘军在采访中打了个比方:过去大模型推理由数百个算子串联执行,就像绿皮火车途经数百个小站,反复启停装卸数据,效率很低;而超级算子像一站直达的高铁,省去了中间停靠的开销。

刘军说,以往行业清楚这套模式的短板,但人工算子优化调度的工作量巨大。现在 Agent 带来了新的解法:浪潮信息采用“用 K3 优化 K3”的思路,依托超节点系统架构,由 AI 智能体自动生成超级算子,再通过模型校验迭代,性能又提升了 50%,形成循环加速。

可以看到,模型已经从被优化的对象,开始变成优化基础设施的工具。这可能成为下一代推理优化的重要范式。

03 芯片一张牌,系统一张牌:超节点打的是系统战

Agent 时代,Token 消耗正以数百万倍速度增长。Gartner 2026 年 3 月报告显示,一个 Agent 工作流每任务消耗的 Token 量是标准聊天机器人的 5 到 30 倍;高盛预测,到 2030 年全球 Token 消耗量将较 2026 年增长 24 倍,达到每月约 120000 万亿 Token。

高盛预测:AI Agent Token 使用量到 2030 年增长 24 倍

需求侧爆发,算力供给如何接住?这里有两个典型困境。

第一个是 Kimi K3 代表的“向上”。模型越来越大,推理能力越来越强,长上下文、复杂推理、多 Agent 协同越来越多,单机越来越难承载,算力系统必须不断突破模型能力上限。

第二个是 DeepSeek 代表的“向广”。越来越多用户开始调用低成本模型,Token 需求快速扩张。模型本身可能已经足够便宜,但如果算力供给跟不上,低价 Token 就很难持续。

浪潮信息的回答是两条线并行:Capability AI Compute(能力型智算)+ Capacity AI Compute(容量型智算)。

向上,SD200 Ultra 以 5.85ms/token、单用户 170 tokens/s,让前沿模型跑得起也跑得快。向广,HC2000 多元算力机组采用 DirectCom 2.0 极速架构,让 Prefill、Decode、FFN 按负载匹配多元芯片,同等投资下 Token 产能提升 10 倍。

Agent 时代 AI 计算的两个发展维度:能力型智算与容量型智算

中国玩家的护城河在哪里?单看芯片,与 NVIDIA 仍有差距,单卡算力、生态、工具链都有明显短板。但到了超节点层面,系统级创新可以追平甚至超越那些单卡更强、系统却很松散的方案。

以浪潮信息 SD200 Ultra 为例,3D Hyper Mesh 架构紧耦合 128 颗本土 AI 芯片,提供 8TB 统一编址显存和 64TB 内存,通信时延低至 0.69 微秒。通过对称内存技术,首次在基于本土 AI 芯片的超节点上实现 GPU 显存直连,AllReduce 通信时间降低 3.5 倍。

SD200 Ultra 紧凑扩展架构:128 芯紧耦合、8TB 显存与 64TB 内存的统一寻址设计

刘军提到,超节点最基本的特征是显存统一寻址。只有做到这一点,才能把这么大的模型完整放进去;否则只能叫节点集群,还是得把模型拆成若干段。

总的来看,芯片是一张牌,系统工程是另一张牌。当芯片之间能更紧密地连接,内存能形成统一空间,通信能藏进计算过程,算子又能由 AI 持续优化,单芯片性能之外的系统红利就开始释放。对本土算力来说,这条路径尤其重要。

04 结语:万亿模型推理需求爆发,效率革命才刚刚开始

AI 算力竞争,正在从造出更快的芯片,转向把现有芯片组织到极致。Inferact 用 16 颗 TPU 证明一个 kernel 可以装下 2.8 万亿参数;浪潮信息用 128 颗本土芯片证明,系统级紧耦合加超级算子,能让本土算力跑进第一梯队。

两条路线,同一个方向。大模型推理的效率革命刚刚开始。对中国 AI 产业来说,这个方向的特殊意义在于:在芯片工艺受限的约束下,系统级创新是确定性最高的追赶路径。浪潮信息迈出的这一步,值得被更多人看见。这也是云栈社区持续关注系统级优化进展的原因。




上一篇:Muse 带火个人智能体赛道,字节豆包被曝对标产品 4 月已内测
下一篇:美团万亿模型LongCat实测:接入Claude Code复刻Muse前端与3D赛车
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-3 01:36 , Processed in 0.619595 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表