过去几年,AI 浪潮中受益最大的无疑是 NVIDIA,无论训练还是推理都离不开采购 GPU 显卡。不过,根据最新预测,到了2028年,GPU 恐怕不再是唯一的主宰,谷歌的自研 TPU 有望后来居上。
在 AI 芯片技术路线中,可以简单分为以 NVIDIA 为主的 GPU 通用计算,以及以谷歌为主的 ASIC 专用计算。谷歌自研的张量处理器(TPU)已有十年历史,但长久以来部署量远不及 NVIDIA 的 GPU。然而过去两年,各家厂商都不希望算力完全被捆绑在 NVIDIA 显卡上,自研 AI 芯片开始爆发,谷歌的 TPU 部署量也随之迅速增长。第七代 TPU v7 已经投入部署,今年 4 月发布的第八代 TPU v8 首次针对训练和推理做了区分。
其中,TPU v8t 偏重 AI 训练,虽然谷歌表示也可用于推理,但主要面向训练负载。每个 Pod 节点堆叠了 9,600 颗 v8t 芯片,FP4 性能达到 121 EFlops,并配备 2PB HBM 内存,内存带宽 19.2TB/s,芯片内部带宽 400GB/s——相比上一代,几乎所有指标都是 2~4 倍的提升。v8i 则主要面向 AI 推理负载,规格有所降低,每个节点仅 1,152 颗芯片,算力降至 11.6EFlops,但内存带宽保持 19.2TB/s 不变。
再下一代的第九代 TPU v9 会更加激进,将采用 4 芯封装技术,对封装提出更高要求。因此,除了原有的台积电合作外,谷歌还会启用 Intel 的 EMIB 封装,分给 Intel 大约 300 万颗 TPU 芯片的订单。这也预示着 TPU v9 这一代的总出货量极为惊人——供应链消息指出,谷歌 2028 年部署的 TPU v9 数量将达到 1,200 万至 1,500 万颗。这是什么概念?作为对比,NVIDIA 的 AI GPU 显卡几乎供应了市面上大多数算力厂商,预计今年销量为 820 万颗,到 2028 年将提升到 1,240 万颗。这意味着,谷歌 TPU 将首次在芯片数量上超越 NVIDIA 的 GPU。
ASIC 路线的 AI 芯片数量超过 GPU,这件事本身并不令人意外。谷歌、微软、亚马逊等云巨头显然不希望 AI 芯片完全依赖 NVIDIA 或 AMD,自研芯片不仅能降低成本,还能减少技术依赖。可以预见,未来 AI 芯片市场的竞争格局将更加多元化。
|