/ 新闻

骁龙新一代旗舰平台的NPU,把智能体装进了手机

发布时间:2026-09-21 18:53:11

从功能手机到智能手机,再到智能体手机,手机的角色一直在变。骁龙新一代旗舰移动平台正是为这个转变而来,CPU、GPU、NPU三大模块协同发力,支撑起智能体AI的完整体验。

相比CPU、GPU这两个更基础、更成熟的SoC组成单元,NPU的发展从源头上就与AI强相关——Neural Processing Unit,神经网络处理单元。也正因如此,在智能体时代,NPU几乎成为智能终端在算力层的“标配”。骁龙新一代旗舰平台搭载的全新Hexagon NPU,给出的答案可以简单归纳成两句话:算得更快,算得更多。




 

算得更快:让智能体“想”得干脆利落

智能体和传统AI应用最大的区别,在于它不是“问一句答一句”,而是一连串任务的协同——理解意图、拆解步骤、调用工具、跨应用操作。这套流程要跑得顺畅,NPU必须同时做好两件事:把大模型最核心的运算加速,把智能体的决策逻辑处理好。

高通在Hexagon NPU中引入了全新的Element Accelerator,专为生成式AI和智能体AI的Transformer工作负载打造。它结合了向量计算单元和标量计算单元——向量单元负责高吞吐量的AI数学运算,加速大模型推理中的关键计算;标量单元则处理智能体的决策逻辑、路由和编排。这套设计的含义是:NPU不仅能“算”,还能“想”。智能体在推理过程中需要选择走哪条路、调用哪个工具、下一步做什么,这些控制逻辑的复杂度远超传统AI任务,Element Accelerator让NPU第一次同时具备了“重计算”和“轻调度”两类能力。

快,是能感知到的。对于INT4精度的模型,预填充性能提升最高可达50%,40亿参数模型首个词元生成时间低于1.5秒——用户与智能体对话时,几乎感觉不到等待。



 

算得更多:让大模型真正“住”进手机

端侧大模型部署有一个容易被忽视的瓶颈:数据搬运比计算本身更耗资源。模型每生成一个词元,都需要读取用于保存对话上下文的KV缓存。如果NPU片上空间不足,这些数据就必须在NPU和设备主内存之间频繁搬移,推高时延和功耗。用户感受到的“智能体反应迟钝”“答到一半忘了上下文”,根源往往在这里。

Hexagon NPU的做法是把共享内存容量较前代增加50%,让模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,大幅减少对外部内存的访问频次。简单说,数据留在NPU内部,智能体就不用每次都“跑一趟内存”。


免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。

如有疑问请发送邮件至:bangqikeconnect@gmail.com