为什么大模型在 CUDA 上写算子得心应手,一碰到 昇腾 NPU 就直接“翻车”?是关键代码没写对,还是它压根就读不懂手里的编程手册?
答案或许比你想的更残酷:大模型对 Ascend C 的认知几乎一片空白。
这是 AgenticCANN 中最具穿透力的判断,也点破了当前 AI 算子自动化领域的一个盲区:
绝大多数研究都建立在 CUDA 语料充足的前提上,却很少有人关注那些预训练数据几乎为零的专用计算架构。
随着 AI 算力架构走向多元化,华为昇腾等 NPU 平台已经成为推理侧的重要算力选项。但 Ascend C 采用与 CUDA 完全不同的显式数据流编程模型,公开代码资源极度稀缺,大模型既不懂基础语法,也读不懂编译器报错,直接套用现有进化框架会陷入永远编译失败的死循环。

香港城市大学团队提出的 AgenticCANN 框架,正是为解决这一痛点而生。它没有选择在搜索算法上反复内卷,反而从两个底层维度破局:
- 一是用结构化的多层级领域知识,主动给大模型补上缺失的硬件认知,把盲目的随机生成变成有边界的定向搜索;
- 二是用阶段自适应的智能体调度策略,让高探索模式负责突破初始瓶颈,高收敛模式负责后续性能打磨,兼顾效果与成本。

图 2:AgenticCANN 整体框架总览。双阶段架构:第 1 代生成阶段注入完整领域知识体系突破可行性瓶颈;第 1 代之后的演化阶段动态调度不同智能体交互模式实现高效收敛。
实验结果极具说服力:在华为昇腾 910B 硬件上,逐元素与归一化算子的生成可行性达到 90%至 100%,融合算子达到 56%; 在 1B 参数的盘古 大模型 上,RMSNorm 内核最高实现 6.65 倍加速,替换全模型归一化层可带来 8%至 10%的端到端推理提速。

表 4:五类典型算子在 Fix-Loop 模式下的可行率与内核加速比。在低语料 NPU 上,知识 + 自适应智能体架构显著优于面向 CUDA 的传统演化方案。
更重要的是,知识注入带来的可行性提升是单调且普适的,并非针对单个算子的特例。这项工作不仅给出了昇腾算子自动化的落地方案,更为所有低语料专用硬件的代码生成提供了一套可复用的方法论。
一、NPU 算子自动化的死局:当 CUDA 红利撞上昇腾的语料荒漠
在 CUDA 生态里,大模型自动生成高性能算子早已不是新鲜事。基于大语言模型的代码迭代方案已经能在 NVIDIA GPU 上产出媲美资深专家手写的内核代码,部分场景甚至能超出手工优化的性能。但这套在 GPU 上被反复验证的成熟方法论,一旦平移到华为昇腾的 Ascend C 编程模型上,会直接遭遇系统性的全面失效。
要理解失效的根源,必须先看清 Ascend C 与 CUDA 的本质差异。
- CUDA 建立在 SIMT 执行模型之上,程序员通过线程块和线程束来组织并行计算,共享内存和寄存器的管理有相对灵活的运行时机制做兜底。
- 而 Ascend C 是一套显式数据流架构,核心围绕统一缓冲区(UB)的切分展开:程序员必须手动把大张量拆成能放进 UB 的小块,通过任务队列(TQue)管理乒乓缓冲,让数据搬运和向量计算重叠起来,还要手动插入同步屏障保证执行顺序。
这种架构的优势是消除了隐式运行时开销,硬件利用率可以做得很高,但代价是对代码的约束极其严苛。切分大小不对齐、队列进出不平衡、同步位置有偏差,任何一个微小的错误都会直接导致编译失败或者运行时内存越界。对于人类开发者来说,这需要长时间的硬件知识积累才能熟练掌握;对于大模型来说,这意味着预训练语料里几乎没有相关知识,连入门的门槛都摸不到。

表 1:CUDA(GPU)与昇腾C(NPU)的架构对比。最关键的差异在于大模型的知识储备差距:CUDA有海量开源代码沉淀,而Ascend C的公开语料极度稀缺。
从问题本质来看,现有自动算子生成框架都遵循闭域进化的假设。论文将算子设计问题形式化为一个带约束的优化任务:在保证编译通过且数值结果正确的前提下,找出执行延迟最低的内核实现。
而现有进化框架的搜索逻辑,完全建立在闭域假设之上:所有信息都来自任务内部,没有任何外部领域知识注入。
这套逻辑在 CUDA 上成立,是因为大模型的预训练分布里已经包含了大量 CUDA 代码,它能看懂编译器报错,也知道基本的优化方向。但在 Ascend C 场景下,这个假设彻底崩塌。
论文给出了一个非常直白的结论:对于任何非逐元素的算子,大模型仅凭预训练知识生成有效代码的概率几乎为零。编译器抛出的硬件相关报错,在大模型眼里就是一串无法理解的乱码,改来改去都碰不到正确答案,进化搜索会永久困在编译失败的死循环里。
除了可行性瓶颈,单一智能体模式也有天然的矛盾。大模型的交互模式可以分为三类:
- 单轮生成模式成本低、结构稳,但从零写不出有效代码;
- 修复循环模式靠日志反馈迭代,能力中等;
- 全工具智能体模式可以读写文件、反复编译,探索能力最强,但容易把代码结构改得面目全非,也就是所谓的结构漂移。
如果全程只用一种模式,要么突破不了初始瓶颈,要么后期优化效率极低、token 成本极高。
总的来说,低语料硬件场景下,算子自动化的核心矛盾已经从如何调优性能转变为如何生成可编译、可运行的有效代码。闭域进化的既有方法论在数据稀缺的硬件平台上会彻底失效,单纯提升智能体的自主能力无法从根源上解决可行性瓶颈。
二、AgenticCANN 整体架构:知识引导下的双轮驱动进化范式
面对闭域进化的死局,AgenticCANN 没有选择继续在搜索算法或者智能体能力上死磕,而是从根源上补全了大模型缺失的硬件领域知识,同时让不同能力的智能体在合适的阶段出场。整个框架的设计逻辑可以概括为两个核心机制:知识编排的生成系统,以及阶段自适应的进化策略,两者相互配合,分别解决可行性瓶颈和进化效率问题。
2.1 三种算子设计范式
论文给出了三种算子设计范式的对比,清晰地展示了 AgenticCANN 在整个技术演进中的位置。
- 第一种是直接生成,不管是人类专家手写还是大模型单轮输出,都是单点尝试,效率很低;
- 第二种是基于种群的进化,靠多候选的集体启发式搜索迭代,比单点强,但还是闭域的,在低语料场景下走不通;
- 第三种就是 AgenticCANN 的知识增强智能体进化,主动引入外部知识工具,给搜索过程加上引导。

图 1:算子设计范式对比。(c) AgenticCANN 方案,本质是搜索引导信号的升级:从闭域引导,升级为引入外部领域知识的开域引导。
2.2 AgenticCANN 整体架构:三个紧密耦合的功能模块
从整体架构上看,AgenticCANN 由三个紧密耦合的功能模块组成。
| 模块 |
描述 |
| 知识层 |
管理一套多层级的领域知识分类体系,支持按算子模式路由和按进化阶段组装,为大模型提供预训练中缺失的硬件规则。 |
| 生成与进化层 |
承载从单轮生成、修复循环到全工具智能体的全套交互模式,依据搜索阶段动态调度。 |
| 评估层 |
在真实 NPU 上执行编译、数值校验、性能测速三步流水线,并将诊断信息回传至知识层,指导后续代码修复。 |
整个流程可以用算法 1 的伪代码完整概括。简单来说,框架拿到一个算子需求后,先判断它属于哪种计算模式,然后进入多代进化循环。每一代开始时,先根据当前阶段组装对应的知识上下文,再选择对应的智能体交互模式。
- 如果是第一代初始化,就用高探索模式生成初始种群;
- 如果是后续世代,就用高收敛模式基于父代变异生成子代。

算法 1:AgenticCANN 完整框架伪代码。初代全量知识 + 高探索工具智能体突破低语料可行性壁垒;迭代世代仅精简知识 + 低开销修复循环,平衡探索与收敛。
每个候选代码都会经过真实硬件的三步评估,不合格的会触发针对性的知识引导修复,合格的进入种群,通过环境选择保留优秀个体进入下一代。

图 2:框架总览。双阶段设计精准匹配了低语料场景的两阶段痛点:先解决“有没有”的问题,再解决“好不好”的问题。
这种设计的核心洞察在于,不把知识当成补丁贴在现有框架外面,而要让知识贯穿整个进化生命周期的每一个环节。从最开始的代码生成,到编译报错修复,再到数值问题修正,最后到性能调优,每一步都有对应层级的知识做引导。同时,也不能用同一种智能体模式走完全程,要根据每个阶段的任务特点,匹配最合适的交互方式,才能在效果和成本之间找到最优解。
总之,AgenticCANN 的本质并非在已有进化框架上加一个知识库,而是将领域知识作为整个搜索过程的底层引导信号,贯穿算子生成、编译修复、正确性校验、性能调优的全生命周期,从根本上降低低语料场景下的搜索空间复杂度。
三、六层知识编排体系:精准投喂的硬件认知方法论
直接把整份几百页的硬件开发手册塞进提示词是最低效的做法。大模型的上下文窗口承载力有限,无关信息越多,关键约束被忽略的概率就越高,反而会起到反效果。AgenticCANN 的解法是把零散的硬件知识拆解成一套六层认知体系,再根据进化的不同阶段按需投喂,既保证关键信息不缺失,又最大限度避免上下文稀释。

表 2:面向硬件编程的多层知识分类体系。分层设计的好处是可以按需取用,不用每次都把全部知识塞进上下文。
3.1 六层知识分类体系
这套六层知识分类体系是整个框架的基石,每一层对应大模型认知硬件的一个层级,从抽象的心智模型一直落地到具体的代码语法。
- L0 编程模型层:讲清楚流水线、任务队列、UB 内存这些基础概念,帮大模型建立对硬件工作方式的基本认知
- L1 模式指引层:讲数学语义到代码结构的映射规则,比如一个归一化公式对应怎样的数据流向
- L2 硬件约束层:规定 UB 容量限制、内存对齐要求、缓冲队列规则这些必须遵守的硬边界
- L3 切分策略层:给出具体的切分计算公式和尾部处理方法,直接指导内存访问效率
- L4 API 参考层:提供向量 API 的函数签名,保证语法层面的正确性
- L5 范例代码层:给出经过验证的算子内核骨架,提供可参考的结构模板
3.2 分阶段组装
有了分类体系之后,下一步就是分阶段组装。如果每一代进化都把六层知识全放进去,不仅浪费 token,还会让大模型在后期优化时分心,乱改不该改的结构。AgenticCANN 的策略是,不同的进化阶段只给对应的知识层级。
初始化阶段全量注入六层知识,帮大模型从零搭建完整的认知框架;变异阶段只保留 L2 到 L4 的精简约束,防止子代偏离父代的正确结构;编译修复阶段侧重硬件约束和结构范例,专门解决队列、API 这类语法错误;正确性修复阶段结合模式指引和完整范例,解决数值不匹配的问题;性能调优阶段只保留切分策略,让大模型专注优化内存带宽。
这种按需投喂的效果非常显著。 提示词长度从初始化阶段的约 800 token,降到性能调优阶段的不足 100 token,单代的 prompt 成本减少了 8 倍。更重要的是,精准的知识注入能让大模型的注意力集中在当前要解决的问题上,不会因为无关信息产生不必要的结构改动。
3.3 算子模式的路由
除了分层分阶段,知识体系还有一个重要设计:基于算子模式的路由。不同类型的算子,优化逻辑和切分方式完全不一样。 比如规约操作的切分策略和逐元素变换就有本质区别,融合算子还要考虑多步操作的流水衔接。
AgenticCANN 维护了一套模式分类系统,涵盖逐元素、规约、Softmax、广播、归一化、矩阵乘、卷积、注意力、索引、池化、缩放、融合等十几种常见计算模式,每种模式都对应一套专属的六层知识资产。框架拿到算子需求后,先自动推断它的计算模式,再调取对应的知识包。 这种解耦设计的好处是,扩展支持新的算子类型时,只需要补充对应模式的知识资产,核心的路由和进化算法都不用改。
为了让知识编排的效果更具象,论文以 LayerNorm 为例,给出了实际注入的知识片段。

图:层归一化知识注入片段(K1–K4)。这些高度精简的知识点,直接将生成可行性从0%拉到了90%。
这些内容都极其精简,加起来也没几行字,但就是这一点点精准的知识注入,直接把 LayerNorm 的生成可行性从 0%拉到了 90%。
总结一下,结构化、分层级、分阶段的知识编排,是 AgenticCANN 解决可行性瓶颈的核心手段。它用最小的上下文成本,给大模型补上了预训练缺失的硬件底层规则,让盲目的随机生成变成了有边界的定向探索。
四、分阶段智能体调度:破解探索与收敛的固有矛盾
解决了“能不能写出来”的可行性问题,接下来要处理“能不能越写越好”的进化效率问题。大模型的交互模式不是能力越强越好,自主能力太高容易破坏代码结构稳定性,能力太弱又突破不了初始瓶颈。AgenticCANN 用阶段自适应的调度策略,让不同能力的智能体各司其职。
论文定义了三种典型的智能体交互模式,构成一条完整的能力光谱。
- 第一种是单轮生成模式,一次输出完整代码,没有反馈循环,也没有工具调用,它的探索能力很低,但结构稳定性很高,token 成本也最低;
- 第二种是修复循环模式,在单轮生成的基础上加入闭环反馈,编译或运行出错时,把日志加上阶段专属知识一起喂给大模型,迭代修复,它的探索和收敛能力都处于中等水平;
- 第三种是工具智能体模式,给大模型开放读文件、改代码、编译运行的全套工具,能和环境实时交互,探索能力最强,但容易引入破坏性的结构改动,收敛稳定性很差。

表 3:智能体交互模式谱系。高探索能力必然以牺牲结构收敛稳定性为代价,这正是单一模式无法适配全流程的根本原因。
过去的框架大多采用单一模式走完全程,要么前期卡壳,要么后期低效。AgenticCANN 的阶段自适应调度策略,就是为了解开这个死结。它的逻辑非常直白:在初始化的第一代,可行性壁垒最高,这时候就上高探索模式,用工具智能体或者修复循环,先把能编译、能跑对的种子代码找出来;到了后续的进化世代,核心目标变成性能优化,这时候就切换到高收敛模式,用单轮生成或者轻量修复循环,在保留正确结构的前提下做精细化打磨。
这种动态调度带来的收益非常惊人。
论文在 GELU 算子上做了不同模式的对比实验,结果极具说服力。
- 工具智能体模式确实很强,它能写出单版最快的内核,延迟只有 30.37 毫秒,但后续世代的进化增益几乎可以忽略不计,消耗了 418 万 token,性能只提升了 0.04%,相当于花了十几倍的成本,几乎没带来进步。
- 反观修复循环模式,初始性能没那么极致,但后续进化非常稳定,只花了 35 万 token,就带来了 26%的性能提升,token 成本只有工具智能体的 8.4%,进化效率天差地别。

表 4:内核进化过程中不同交互模式的性能对比。智能体自主能力越强,长期进化效果反而越差。
除了世代间的调度,在错误修复环节,知识注入的时机也非常关键。 论文跟踪了不同算子在错误驱动修复迭代中的性能变化,LayerNorm 只需要一轮迭代,就能从没优化的 0.39 倍基线水平提升到 2.68 倍加速。原因就是在修复时精准注入了 L3 层级的切分启发式知识,一次就命中了核心优化点。 RMSNorm 经过 4 轮修复达到 1.41 倍加速,Softmax 则基本和基线持平,说明厂商编译器对标准规约拓扑已经做了深度优化,留给自动生成的额外空间不大。
这里的底层逻辑是,进化的效率取决于变异的方向性。
- 如果变异是盲目的,大部分改动都是无效甚至有害的,收敛就会很慢,成本也很高;
- 如果有知识做引导,每一次变异都朝着大概率正确的方向走,收敛自然就快。
分阶段调度本质上就是在探索成本和收敛效率之间找最优解:最难的阶段用最强的探索能力破局,走上正轨之后用最稳的方式提速。
回顾一下,单一智能体模式无法同时兼顾初始探索和后续收敛。在低语料硬件场景下,高自主能力的工具智能体只适合用于初始种子发现,后续的性能迭代必须用结构稳定的轻量模式,才能用极低的 token 成本实现持续的性能提升。
五、全维度实验验证:从算子基准到生产部署的完整链路
所有设计最终都要落到真实硬件上说话。论文的全部实验都在搭载华为昇腾 910B NPU 的专属集群上完成,覆盖了从典型算子深度诊断、大规模分层验证到生产级大模型部署的完整链路。 我们可以从三个维度拆解实验结果:知识编排的实际效果、分阶段进化的效率收益,以及生产环境下的真实部署价值。
5.1 典型算子深度诊断
首先看典型算子的整体可行性表现。 论文选了六个代表不同执行模式的算子做深度分析,结果非常直观地验证了知识编排的价值。 在没有主动知识注入的闭域生成模式下,所有非逐元素算子的可行性都是 0%,大模型连一个有效的归一化、规约或者融合算子内核都写不出来。加入结构化知识编排之后,逐元素和归一化类算子的可行性达到了 90%到 100%,同时带来最高 2.71 倍的性能加速;复杂的融合算子也达到了 56%的可行性门槛;只有广播类算子仍然是 0%,这也划定了当前框架的能力边界。

表 5:典型算子模式的整体可行性与加速比。没有知识注入就没有可行性,算子越复杂,难度越高。
为了搞清楚每一层知识到底起了多大作用,论文在 LayerNorm 上做了细致的消融实验。从零知识的 0%可行性开始,逐步加入不同层级的知识:
- 只加 L0 编程模型知识,可行性升到 40%, 说明建立基础的硬件心智模型就能解决一部分问题;
- 再加 L2 硬件约束,可行性直接跳到 60%, 这是单层级带来的最大边际收益,也证明了内存对齐、队列平衡这些硬规则是编译通过的核心门槛;
- 再加 L5 范例代码,可行性升到 80%, 具体的结构骨架能大幅降低大模型的试错成本;最后用上全量的分阶段知识组装,达到 90%的可行性和 2.71 倍的执行加速。

表 6:LayerNorm上的知识分类消融实验。可行性从0到90%的单调上升过程,证明了知识注入的收益是可叠加、可预测的。

图 3:LayerNorm上的知识消融效果。这条单调上升的曲线是对知识编排价值最直接的量化证明。
5.2 大规模分层验证
单算子消融还不够,论文又做了更大规模的分层基准测试,覆盖 14 个逐元素算子,验证知识编排的普适性。三组实验分别对应无知识、仅给范例代码、全量分阶段知识三种配置。 结果显示,有效解的数量从 8 个增加到 10 个再到 12 个,可行性从 57%单调提升到 71%再到 86%;同时平均内核执行延迟从 741.3 微秒降到 721.6 微秒再降到 711.0 微秒。
具体到单个算子,Hardtanh 的延迟降低了 18.4%,Softplus 降低了 15.2%,Swish 降低了 17.0%,提升都非常显著。这说明知识注入不是某个算子的特例,而是具有普遍的增益效果。

图 4:14个逐元素算子的大规模知识注入验证。可行性和性能的双重提升,证明知识编排能让代码跑起来,也能让代码跑得更快。
5.3 生产级大模型部署的完整链路
最有实际价值的实验,是生产级大模型的端到端部署。研究团队把优化后的内核直接集成到 1B 参数盘古大模型的推理流水线里,在真实昇腾 910B 上跑通了全流程。 profiling 分析显示,归一化内核虽然计算量不大,但占了全模型端到端延迟的 11%,因为推理场景下张量尺寸小,这类操作属于延迟绑定型,瓶颈在内存带宽而不是计算。优化后的 RMSNorm 内核,在推理尺寸下比标准 PyTorch 实现最快达到 6.65 倍加速,向量流水线利用率从原生的 14.2%提升到了 81.6%。

图 6:1B 参数量盘古大模型推理性能剖视。AgenticCANN 生成的内核实现了 6 倍以上的加速比,这种小尺寸推理场景恰恰是业务中最常见的。
如果把 Transformer 骨干里全部 53 个归一化层都替换掉,预计能带来 8%到 10%的端到端推理延迟降低。对于大规模部署的推理业务来说,这是非常可观的成本节约。

表 8:1B盘古模型尺寸下RMSNorm的执行延迟基准。在推理场景的典型小尺寸下,自动生成算子价值尤为突出。
回顾整个实验,从单算子消融到大规模基准,再到生产级模型部署,三层实验完整验证了 AgenticCANN 的有效性。知识注入带来的可行性提升是单调且普适的,最终产出的算子可以直接落地到真实 大模型 推理场景,带来可观测的端到端性能收益。
六、能力边界与局限:正视低语料场景下的现实瓶颈
作者坦诚公布了当前框架的失效场景,也深入分析了背后的技术原因。
首先是完全失效的场景。 广播类算子在所有模式下可行性都是 0%,核心瓶颈是动态索引对齐问题,大模型目前还无法很好地处理不同张量之间的步长和偏移推理。 更复杂的缩放点积注意力算子,更是在所有 8 组实验配置下全部失败,没有产出任何有效内核。
6.1 注意力算子的失败归因
论文对注意力算子的失败做了详细的归因,总结出三个叠加的结构性瓶颈。
| 瓶颈 |
描述 |
| 高维约束耦合 |
注意力计算包含 QK 转置、逐行 Softmax、加权聚合 V 三个子操作,交叉依赖形成的多变量循环结构,超出了当前大模型的空间推理能力。 |
| 主从切分不对齐 |
多头注意力会引入头数、序列长度、隐藏维度多个动态切分维度,主机侧的切分数据结构必须和内核侧的初始化参数严格对应,这种运行时约束很容易写错。 |
| 统一缓冲区溢出 |
中间的注意力分数矩阵尺寸和序列长度的平方成正比,很容易就超过 200KB 的 UB 物理上限,需要做块级切分和重计算策略,这对算法设计能力要求很高。 |
6.2 框架层面局限
除此之外,框架还有几个层面的局限。
- 在模型泛化性上,目前实验主要用了 DeepSeek-V4 系列模型,跨不同模型家族的迁移效果还没有做全面验证,还不能确定知识注入的收益是不是模型无关的。
- 在算子覆盖度上,54 个算子的基准主要验证了基础算子,全尺寸的注意力、卷积这些核心计算模式还没有覆盖,而这两类算子才是 Transformer 和 CNN 工作负载里的绝对主力。
- 在知识构建成本上,新增一种算子模式需要 5 到 8 小时的专家工时来搭建知识资产, 虽然这些规则具备很高的可复用性,但初始的人工投入还是存在的。
对应的,未来的优化方向也很清晰。针对复杂算子的布局推理问题,可以加入动态布局模拟器,在编译前就给大模型反馈内存布局和索引是否正确;针对知识构建成本,可以尝试从编译日志和历史修复案例里自动提取约束规则,逐步减少人工参与;针对注意力这类复杂算子,可以用分层分解的思路,把大算子拆成已有的基础算子组合,而不是一次性生成完整实现。
总而言之,AgenticCANN 当前的能力边界清晰:在逐元素、归一化、简单规约等模式上已经达到生产可用水平,但在广播、注意力、卷积等涉及复杂索引和多维耦合的算子上仍有明显瓶颈。突破这些边界需要从知识表达和搜索策略上做进一步的底层创新。
总结与展望:多元化算力时代的自动化新范式
站在 AI 异构计算的大背景下看,AgenticCANN 的价值绝不止于给昇腾 NPU 做了一套自动算子生成工具。它提出的知识编排加分阶段智能体进化的范式,为所有低语料专用硬件的代码自动化提供了一套可复用的方法论。
这项工作的核心贡献可以归纳为三个层面。
- 第一,它重新定义了低语料硬件场景下的算子生成问题,明确指出核心矛盾已经从性能调优转向可行性突破,把学界的注意力从数据富足的 CUDA 舒适区,引向了更具普遍意义的稀缺数据场景。
- 第二,它提出了一套完整的解决方案:六层知识分类体系解决了硬件知识的结构化表达问题,分阶段组装机制解决了上下文效率问题,模式化路由解决了扩展性问题,从知识管理的角度给出了系统性的答案。
- 第三,它通过真实硬件上的大规模实验和生产级部署,完整验证了这套方法的实际效果,给出了详实的量化数据和边界分析,为后续工作打下了扎实的基础。
往更远的方向看,这套方法论的想象空间很大。
- 一方面,知识的构建可以从人工逐步走向自动化。 现在的规则靠专家整理,未来可以从成功的生成案例和失败的编译日志里自动挖掘共性模式,自动补充和更新知识 taxonomy,让框架具备自我迭代的能力。
- 另一方面,算子的复杂度可以持续向上突破,从基础算子到简单融合,再到复杂的注意力和卷积算子,最终实现端到端的全模型自动优化。
如果再进一步,这套方法可以迁移到更多专用计算架构上,不管是自研的 DSP、TPU 还是可重构计算芯片,只要有硬件文档和基础的编译工具链,就能快速搭建起对应的自动算子生成能力,大幅降低新硬件的软件适配成本。
随着 AI 算力架构走向多元化,大模型与专用硬件之间的适配会成为越来越重要的基础设施问题。过去我们依赖大量工程师手写算子来榨取硬件性能,未来这个工作很大程度上可以由大模型配合知识系统来完成。 AgenticCANN 走出了用知识增强破解低语料困境的第一步,它证明了只要给大模型合适的结构化引导,即使是完全陌生的硬件领域,也能产出具备生产价值的代码。 沿着这条路走下去,AI 编译器和自动算子生成的边界会被持续拓宽,最终可能彻底改变底层算力软件的开发范式。
如果你也对算力、推理优化和 AI 基础设施感兴趣,欢迎来 云栈社区 分享你的想法。