过去几年,手机厂商在AI领域的竞争几乎绕不开三个维度:模型参数、NPU算力和端侧部署能力。端侧AI逐渐成为手机「标配」之后,厂商们比拼的重心也开始悄悄发生变化。
随着手机AI能力持续提升,新的矛盾浮出水面。芯片算力越来越强,但模型运行时需要处理的数据也在同步膨胀。处理器算得再快,也得先拿到数据——模型越大,需要存放和调度的数据就越多,存储和内存自然成了端侧AI体验中不可忽视的一环。
在今年的高通骁龙峰会上,江波龙带来的 iSA 智能体成为首批适配第六代骁龙8超级至尊版的产品,并配合 UFS 4.1 一同亮相。此前 iSA 已经在 AMD 锐龙 AI Max+ 395 平台上完成过联合调优,如今顺利延展到旗舰手机平台。它瞄准的正是当前手机市场的核心难题:当端侧模型体积持续膨胀,手机AI的竞争早已不是单纯比拼 CPU、GPU 和 NPU,数据放在哪里、如何调度,同样左右着用户的实际体验。
大模型塞进手机,先扛不住的是内存?
过去手机上的 AI 大多执行单次任务——识别一张照片、总结一段文字,任务持续时间短,需要同时处理的数据也不多。但现阶段的 Agent 完全不同,它需要理解上下文、拆解任务、调用不同模型,有些任务甚至持续运行很长时间,模型规模和运行时长都在不断增加。问题在于,手机 DRAM 的容量根本跟不上模型规模的增长速度。
这个问题已经严重到什么程度?江波龙副总裁、嵌入式存储事业部总经理黄强在接受雷科技专访时给出了一组数据:目前旗舰手机的 DRAM 普遍为 12GB 到 16GB,应付日常需求绰绰有余,但 30B 级大模型开始进入手机后,对容量、速度、功耗、成本和能效比都提出了远超现有硬件水平的要求。手机内部空间和散热条件有限,不可能像云端服务器那样不停堆硬件。
江波龙旗下慧忆微副总裁王舒翀进一步拆解了内存的「家底」:安卓系统本身就要占用几 GB 内存,如果后台再跑几个大型 App,真正能留给 AI 的空间就所剩无几。而一个未经充分压缩和优化的 30B 模型,仅参数就可能占用约 30GB。换句话说,即便当前最高端的旗舰手机,也无法把模型参数全部塞进 DRAM。
不过这次高通峰会上展示的 30B MoE 模型,对模型侧、推理侧和存储侧都做了针对性优化。模型通过剪枝、量化等方式压缩体积,MoE 架构每次推理只激活一部分专家参数,再配合端侧推理和存储优化,最终把运行期间需要占用和调度的资源控制在数 GB 量级。按照江波龙的说法,这套 30B 模型目前已经在手机参考设计上流畅运行。

MoE,也就是混合专家架构,现在已经被越来越多的大模型采用。它的原理并不复杂:一个 MoE 模型里有许多负责不同任务的「专家」,每次推理不会让所有专家倾巢出动,而是根据任务需求只挑一部分参与计算。
既然一次只会用到部分专家,那些暂时未被激活的参数就没必要一直占用 DRAM 空间。江波龙的 iSA 方案正是把专家参数存放在容量更大的手机 NAND 中,等模型需要调用这些「专家」时,再把对应参数搬进 DRAM。
空间问题有了解决思路,但读写速度又成了新的坎。
王舒翀打了一个很形象的比方:手机上普通 App、照片和文件的数据通常比较连续,NAND 很多时候可以顺着往下读,就像拿着一本书从前往后翻,前后内容挨在一起,速度快得很。但 MoE 不一样,每次调用哪个专家取决于当前任务——这一次可能是专家 A,下一次又跳到专家 F,更像是查工具书,需要什么就翻到对应章节。
这种读取模式对存储的要求也随之改变。过去很多数据可以一口气连续读,现在模型频繁在不同专家之间切换,NAND 需要不断跳转读取不同的数据,随机读取的重要性骤然上升。对于端侧大模型来说,UFS 仅凭很高的顺序读取速度已经不够了,面对更零散的数据调用必须同样足够快。
更麻烦的是,NAND 读写再快也快不过 DRAM。模型需要的专家如果已经在 DRAM 里,手机 NPU 可以直接调用计算;但如果还躺在 NAND 中,就得先搬运过来再算,输出速度又会被拖慢。
iSA 要解决的,恰恰就是这个问题。
把模型装进手机,只解决了一半问题
江波龙给出的答案是「智能预取」:尽可能赶在 NPU 真正需要某个专家之前,把对应数据从 NAND 预先调入 DRAM。
但提前读取有个前提:iSA 得先知道模型接下来可能用到哪些专家。
iSA 会参考模型本身的运行规律,同时结合当前上下文。首次加载时,可以借鉴已有的专家激活规律;进入推理阶段后,用户输入的 Prompt、之前积累的上下文,以及当前所处的推理阶段都会成为参考信息。上层推理引擎会把这些信号传递给 iSA,iSA 再据此判断接下来可能触达哪些专家,提前准备相应数据。

举个具体场景:用户刚刚还在查询夏威夷茂宜岛的相关信息,下一轮继续追问当地酒店和景点的概率,显然远高于突然跳转到北京天气。对模型来说,前后两轮对话存在上下文关联,对应的专家调用也有规律可循。iSA 利用这些信息扩大预取范围,提前把可能用到的专家从 NAND 搬进 DRAM。
当然,预取再聪明也不可能次次命中。如果提前调入 DRAM 的专家最后没有派上用场,真正需要的数据还是得回头从 NAND 重新读取。王舒翀透露,iSA 的预取策略可以根据实际情况调整激进或保守:多预取一些,命中率更高,但会带来额外 I/O 开销;少预取一些,对存储压力更小,但预测失败时的等待时间也会拉长。不同模型的专家激活规律存在差异,所以 iSA 现阶段还需要针对具体模型和推理引擎做适配调优。
iSA 解决了「什么时候取、取哪些数据」的问题,但具体的数据读写最终还是要落到存储硬件上。这次与 iSA 一同亮相的江波龙 UFS 4.1,承担的就是这部分工作。
前文提到,MoE 调用专家时的数据读取比较零散,对随机读取的要求更高。江波龙 UFS 4.1 配合慧忆微自研主控,可以针对这类 AI 负载优化随机读取效率和访问延迟,让 iSA 提前选中的专家参数更快从 NAND 调入 DRAM,尽可能减少 NPU 等待数据的时间。再往下,慧忆微自研 UFS 主控除了完成实际数据读写,还负责数据放置、空间管理和磨损均衡等工作,对存储寿命和长期稳定性同样有帮助。
除了 MoE 专家权重,还有一个东西在持续吃掉内存——KV Cache。
大模型进行多轮对话时,为了减少重复计算,会把此前已经算过的一部分信息保留下来。聊得越久、上下文越长,KV Cache 占用的空间就越大。以前手机 AI 做一次图片识别或文字总结,任务很快就结束了;Agent 时代则可能连续规划一次旅行、分析一份长文档,甚至跨多个 App 持续工作,对 KV Cache 的需求将明显增加。

手机只有十几 GB 的 DRAM,还得同时分给系统和其他 App,KV Cache 自然不能一直往里堆。iSA 对这部分数据做了分层管理:把一部分缓存挪到容量更大的存储中,同时清理已没有必要继续保留的缓存。这样一来,专家权重和 KV Cache 都可以根据实际使用情况在 DRAM 和 NAND 之间灵活调度,把有限的 DRAM 留给当前最需要的数据。
把更多的 AI 运行数据交给 NAND 之后,另一个问题随之而来:闪存寿命会不会受影响?
毕竟 Agent 如果以后真成了手机常驻功能,模型参数和相关数据每天都会被频繁访问,存储的读写压力会显著增加,时间长了难免让人担心寿命。对此黄强表示,十几 GB 的模型对 DRAM 来说确实很大,但放进 256GB、512GB 的 NAND 里,占比就小了很多,对寿命的影响相当有限。而且慧忆微自研主控可以配合 iSA 进行寿命管理、空间优化和磨损均衡,如果某些区域写入次数过多,还能重新调整数据位置,避免长期集中擦写。
不过需要承认,目前 Agent 还没有真正成为手机上的高频常驻应用,不同模型的读写方式、使用频率和工作负载也各不相同。如果未来 AI 一天运行几个小时甚至长期挂在后台,NAND 的写入量、功耗和温度究竟会增加多少,只能等真实终端长期运行之后才能拿到准确数据。同样需要量产验证的,还有 iSA 最终能省下多少 DRAM、降低多少首 Token 延迟,以及提升多少 Token 生成速度。换一套模型、推理引擎甚至终端环境,最后得出的数据都可能不同,因为这些因素都会影响预取效果。
从Demo到量产,iSA离我们还有多远?
第六代骁龙8超级至尊版并非 iSA 首次适配的计算平台。此前江波龙已经在 AMD 锐龙 AI Max+ 395 平台上完成联合调优,覆盖了 AI PC、AI BOX 等产品形态。但手机的情况有所不同:内存容量更小,功耗和散热约束更严格,iSA 需要面对的挑战自然更多。
目前 iSA 最大的瓶颈还是适配。不同大模型的专家激活规律不同,iSA 必须根据模型特点分别调整。这次 Demo 使用的是阶跃的模型和无量火的推理引擎,江波龙需要和两边共同优化。落到真正的手机产品上,还要考虑手机厂商自研模型、系统调度策略和 App 运行策略。想用同一套预取策略复刻所有结果,并不现实。
好消息是,硬件这边已经准备得差不多了。黄强在专访中表示,搭载慧忆微自研主控的江波龙 UFS 4.1 标准产品已实现批量出货,具备规模化量产商用的条件。下一步将推动 iSA 导入具体手机项目,针对功耗、稳定性和可靠性做进一步验证。

所以 iSA 距离真正出现在量产手机上,主要差的是最后的适配和工程化工作。
对江波龙来说,这最后一步可能比之前的更关键。参考设计上的 30B MoE 证明了方案可行性,但手机厂商真正关心的是用了 iSA 之后能省下多少 DRAM、首 Token 延迟能降多少、长时间运行又会增加多少功耗。这些数据只有跑在量产机上,才真正有说服力。
而对普通用户来说,没人在意专家参数究竟放在 DRAM 还是 NAND 里,也不会关心背后的智能预取跑了多少次。我们最终能感受到的,无非是手机上的 Agent 响应会不会更快、长时间使用 AI 手机的功耗会不会飙升、后台挂着 AI 时会不会拖累其他 App 的流畅度。
如果 iSA 最后能把这些问题处理好,江波龙这次在骁龙峰会上展示的 30B MoE,可能就不只是一个 Demo 了。至少下一次我们聊起手机端侧 AI,除了看 SoC 和模型,可能还得多看一眼存储。