NVIDIA 这几年吃尽了 AI 爆发的红利,单凭 AI GPU 就筑起了市值 5 万亿美元的商业帝国。但越是这样,越有厂商想摆脱对 NVIDIA 芯片的依赖,只是这条路远没有想象中好走。
NVIDIA 在 AI 领域的技术壁垒实在太厚,除了大家熟悉的 CUDA 软件生态,如今又多了一个越来越显眼的武器——NVLink。Theregister 发文指出,NVIDIA 正在 NVLink 之上构建一个全新的知识产权帝国。
本周一,NVIDIA 向联发科投资 35 亿美元,后者也成为最新采纳 NVLink Fusion 技术授权公司。NVLink Fusion 是 NVIDIA 将自家高速芯片互联技术商业化后的产物,允许其他企业购买授权,把自研芯片与 NVIDIA 芯片连在一起。
如果 AI 客户买了 NVIDIA 的 Vera CPU 芯片,就可以通过 NVLink Fusion 接上自家的 XPU 芯片;反过来,如果买的是 NVIDIA 的 GPU 芯片,同样能用这项授权把自研 CPU 挂进去。倘若客户还想用这项技术扩展网络互联,那还得再单独购买 NVSwitch 的技术授权。
对 NVIDIA 而言,开放 NVLink Fusion 授权不仅意味着多了一笔授权收入,更关键的是开辟了新的生意路径:即便客户不采购整套 NVIDIA AI 系统,单买 CPU 或者 GPU 也是价值不菲的买卖。更重要的是,这种授权模式把客户牢牢拴进了 NVIDIA 的生态圈——既然不想依赖 NVIDIA 的 GPU,那依赖 NVLink Fusion 或者 NVSwitch 技术本质上也没差多少,而这些互联芯片在 AI 数据中心建设成本中的占比正变得越来越高。

不过,硬件绑定终归只是表象,CUDA 软件生态才是 NVIDIA 更深的护城河。而 AMD 在优化层面的追赶速度,正好在最新对比测试中得到了直观印证。
AMD 显卡跑实际应用历来比 NVIDIA 吃亏很多,但最近 AMD 说 CUDA 不足为虑也不是没有依据。SemiAnalysis 发布了一份 AMD 与 NVIDIA 显卡在 Qwen3.5 397B 和 MiniMax M3 两款开源大模型上的性能与成本对比,出战的是两边当前最强的 MI355X 与 B300。
AMD 这边对照了两个时间点:8 月 12 日和最新的 8 月 31 日。NVIDIA 的显卡性能一如既往保持水准,AMD 则是在这两周里快速优化追赶。

在 Qwen3.5 大模型上,AMD 仅用两周时间就把 MI355X 的表现拉高了一大截。8 月 12 日时 90 TTFT(首字时间)大多落在 2.0 秒至 5.5 秒之间;到 8 月 31 日,大多数工况的时延已经压缩到 0.9 秒至 3.5 秒区间,响应速度近乎翻倍。
此前 MI355X 的吞吐性价比天花板约在 50M tok/$左右;优化后在 1.5s~2.5s 的低时延段就冲破了 80M~110M tok/$,并在 TP2 工况下最高达到约 140M tok/$,差不多是原来的三倍。这个成绩已经相当接近 NVIDIA 现役旗舰 AI 卡 B300,只不过后者在低时延区间依然保持领先。

MiniMax M3 大模型上的结果也类似。8 月 12 日时 MI3550X 跟 B300 差距还很悬殊,到了 8 月 31 日,优化后的 MI355X 交互速度从大约 55 tok/s/user 提升到了 230 tok/s/user,同样是三倍左右的增长。

整体来看,AMD 过去两周对 MI355X 的优化效果非常突出,两款开源大模型在各种工况下的速度提升普遍有 2 到 3 倍,部分场景甚至超过 3 倍。尽管还不能说已经反超 B300,但相比之前的天差地别,差距已经大幅收窄。
别忘了 AMD 还有性价比这张牌。MI355X 的每小时 TCO 成本是 1.5 美元,B300 是 2.26 美元,相差约三分之一,折算下来 MI355X 的整体效益相当可观。

这些提升基本兑现了 AMD 发布 ROCm 10 时的宣传:硬件不变,光靠各种软件优化,就能把大模型推理性能提升 3 倍以上。有了这层基础,AMD 确实不必再在 CUDA 生态面前抬不起头。今年 AMD 还会推出性能更强的 MI455X 新一代 AI 平台,继续优化下去,赶超 NVIDIA 一次也并非没有可能。

不过,NVIDIA 与 AMD 在高端市场打得热闹,普通消费者却没沾到多少实惠——消费级显卡市场反而迎来了一波意料之外的全面涨价。
常年蹲守等降价的等等党这次彻底无奈了。过去短短一个月,全球消费级显卡市场平均价格直接上涨 15%,原本指望新系列上市带动旧款降价的预期彻底落空。
调研机构 TechSpot 发布的最新全球 GPU 定价追踪报告显示,截至 8 月底的统计周期内,显卡市场整体均价涨幅达到 15%,全品类几乎没有漏网的降价产品。在纳入追踪的 10 个全球市场中,剔除 RTX 5090 这类极端异常的超高溢价产品后,其余在售显卡的实际售价较官方建议零售价 MSRP 平均高出 28%,几乎所有新品都脱离了刚发布时的定价区间。
具体到阵营,英伟达 GeForce 显卡当月平均涨幅达到 19%,AMD Radeon 显卡涨幅为 11%,后者明显温和得多。公版建议售价 1999 美元的 RTX 5090,目前美国市场实际售价已经摸到 5000 美元(约合 34200 元人民币),相对官方指导价溢价高达 145%,在 10 个全球市场的平均溢价也有 136%——刚好踩中了网友此前调侃的“5090 卖 5090”数字巧合。
RTX 5060 Ti 16GB 是目前溢价第二高的消费级型号,美国市场溢价 70%,全球平均溢价 53%;而同型号的 8GB 版本全球平均只溢价 14%。反差背后,是高容量显存型号正承受远高于小显存型号的涨价压力。其余主流型号里,RTX 5070 Ti 全球平均溢价 44%,RTX 5080 也达到 38%,中高端产品的涨幅普遍超出普通消费者的预期。
AMD 阵营这边,RX 9060 XT 16GB 是目前溢价最高的 Radeon 型号,全球平均溢价 28%;RX 9070 只溢价 13%,算是当前整个显卡市场定价最理性的主流型号之一;RX 9070 XT 的全球平均溢价也只有 21%。英特尔 Arc 系列的 B580 目前溢价 25%,定位更低的 B570 则长期供应吃紧,很难正常现货买到。
行业普遍认为,这轮集体涨价的核心驱动力是 GDDR7 显存产能被大量调配到 AI 计算硬件领域,留给消费级显卡的产能占比被持续挤压,供需失衡直接推高了终端售价。TechSpot 分析师也在报告中给出参考:当前市场环境下,AMD Radeon 全系显卡的性价比已经明显优于英伟达 GeForce,是普通玩家更务实的选择。
至于这波涨价的本质,其实是 AI 算力需求爆发直接外溢到消费级市场的典型信号。未来很长一段时间,高显存容量的消费级显卡大概率都会处于供应紧张状态。打算靠等等党心态等显卡大幅跳水的玩家恐怕会持续失望,刚需用户按需入手即可,没必要硬等一场不存在的暴跌行情。

高端 GPU 供需紧张的同时,英伟达并未停下技术迭代的脚步,而是持续通过软件与画质技术升级夯实产品竞争力,进一步巩固自身在消费级与游戏 GPU 市场的地位。
英伟达已正式宣布,DLSS 5 将于太平洋时间 9 月 3 日晚 9 点(北京时间 9 月 4 日 12:00)随 NBA 2K27 首发上线。与此同时,英伟达发布的路线图显示,这项全新神经渲染技术的优化工作还远未结束,今年 10 月还将迎来重要版本更新,届时性能会再度跃升。

英伟达指出,DLSS 5 在过去半年里的开发进展极快:从 2026 年 3 月初次展示时需要双路 RTX 5090 驱动,到如今实现全系 RTX 50 显卡单卡支持,运行效率已经提升了 5 倍。根据最新内部预测,10 月版本有望把性能增益推高至原始基准的 7.5 倍,相当于在当前即将发布版本的基础上再涨 50%。

技术层面,这种爆发式增长主要源于系统级管线优化与神经模型的深度精炼。简单来说,英伟达通过“算法减法”,在保证画质增强效果的同时,降低了每一帧神经渲染所需的计算周期。这也意味着此前被诟病的性能负增长问题,有望在后续版本迭代中得到显著缓解,从而释放更多算力去提升基础帧率。
不过话说回来,DLSS 5 本质上仍是一项高负载技术。未来 GPU 架构是否会为了适配神经渲染而在 AI 单元上押注更激进的硬件倾斜,目前还没有定论。
以上内容由云栈社区编辑整理,仅供技术交流参考。