欢迎访问深圳市中小企业公共服务平台电子信息窗口

高通重构手机AI芯片架构 NPU存储器容量大增50%

2026-09-17 来源:钜亨网
49

关键词: 高通 Hexagon NPU 代理式AI 移动芯片

随着代理式AI(Agentic AI)逐步成为手机端AI发展重心,高通也重新调整移动芯片架构,新一代顶级移动平台将以全新Qualcomm Hexagon NPU为核心,不仅导入专为Transformer工作负载打造的Element Accelerator,NPU共享存储器容量更大幅增加50%,借此降低外部存储器访问需求,支持更长上下文、多模型协作及并行AI代理运作。

高通指出,代理式AI与过去生成式AI最大的差异,在于未来并非由单一大型模型处理所有任务,而是会依照任务、情境及用户需求,动态调度不同的专用模型。因此,手机端AI所需要的也不只是更高的推理性能,而是能够支持持续运作、多模态处理、低延迟及模型协同调度的全新计算架构。

此次新一代Hexagon NPU最大的架构升级之一,就是扩充共享存储器容量。高通表示,NPU存储器子系统容量增加50%,让更多模型状态、激活值及中间张量能保留在芯片本地端,减少频繁访问DDR存储器的需求,进一步降低存储器带宽瓶颈及功耗。

高通指出,随着AI代理需要处理更长的上下文、更多工具及多项并行任务,存储器访问效率的重要性持续提升。通过更大的共享存储器,可让AI代理以更短等待时间完成回答、修正、规划与执行动作,同时提升token生成速度,并让AI代理在不同工具及任务之间切换时更加流畅。

除存储器架构升级外,高通也在Hexagon NPU中导入全新Element Accelerator,专门加速生成式AI及代理式AI大量采用的Transformer工作负载,并结合向量、矩阵及标量扩充功能,提升大型模型推理及AI代理决策、路由与协同调度效率。

高通同时将混合专家模型(Mixture-of-Experts,MoE)视为未来手机端大型AI模型的重要架构。高通指出,一个拥有300亿参数的MoE模型,可保有数百亿个参数,但每次生成token时,仅需激活约30亿个经路由选择的参数。

相较传统Dense模型每次推理都需要动用大部分模型参数,MoE可根据输入内容动态选择不同专家模型,借此降低计算量及存储器带宽需求,让更大型的AI模型有机会在手机端运行。

为进一步降低存储器压力,高通也导入从闪存至系统存储器的专家模型管理及缓存机制,可依照实际需求加载不同模型,搭配更大的NPU共享存储器,提升模型切换效率。

在AI模型精度方面,新一代Hexagon NPU支持INT2、INT4、INT8、FP8及FP16等多种格式,让开发者可依照性能、存储器占用、模型品质及功耗需求进行调整。

其中,针对INT4模型,高通表示,新平台可带来最高50%的预填充(Prefill)性能提升,同时改善解码吞吐量、推测解码(Speculative Decoding)及整体每秒token数,进一步缩短AI模型处理长篇输入资料及产生回应所需时间。

高通也强调,在代理式AI架构下,CPU与NPU的协同运作将更加重要。Hexagon NPU主要负责Transformer及AI推理运算,CPU则负责多步骤工作流程中的路由、协同调度及资料管理,确保资料能即时提供给NPU使用。

高通认为,未来移动AI将逐步从单一模型推理,转向多模型、多代理及持续运作的架构,而新一代Hexagon NPU通过Element Accelerator、更大的共享存储器、MoE模型支持以及低精度运算能力,目的就是让更多代理式AI功能直接在设备端完成,在降低延迟及功耗的同时,也兼顾资料隐私。