从功能手机到智能手机,再到智能体手机,手机的角色一直在变。骁龙新一代旗舰移动平台正是为这个转变而来,CPU、GPU、NPU三大模块协同发力,支撑起智能体AI的完整体验。
相比CPU、GPU这两个更基础、更成熟的SoC组成单元,NPU的发展从源头上就与AI强相关——Neural Processing Unit,神经网络处理单元。也正因如此,在智能体时代,NPU几乎成为智能终端在算力层的“标配”。骁龙新一代旗舰平台搭载的全新Hexagon NPU,给出的答案可以简单归纳成两句话:算得更快,算得更多。

算得更快:让智能体“想”得干脆利落
智能体和传统AI应用最大的区别,在于它不是“问一句答一句”,而是一连串任务的协同——理解意图、拆解步骤、调用工具、跨应用操作。这套流程要跑得顺畅,NPU必须同时做好两件事:把大模型最核心的运算加速,把智能体的决策逻辑处理好。
高通在Hexagon NPU中引入了全新的Element Accelerator,专为生成式AI和智能体AI的Transformer工作负载打造。它结合了向量计算单元和标量计算单元——向量单元负责高吞吐量的AI数学运算,加速大模型推理中的关键计算;标量单元则处理智能体的决策逻辑、路由和编排。这套设计的含义是:NPU不仅能“算”,还能“想”。智能体在推理过程中需要选择走哪条路、调用哪个工具、下一步做什么,这些控制逻辑的复杂度远超传统AI任务,Element Accelerator让NPU第一次同时具备了“重计算”和“轻调度”两类能力。
快,是能感知到的。对于INT4精度的模型,预填充性能提升最高可达50%,40亿参数模型首个词元生成时间低于1.5秒——用户与智能体对话时,几乎感觉不到等待。

算得更多:让大模型真正“住”进手机
端侧大模型部署有一个容易被忽视的瓶颈:数据搬运比计算本身更耗资源。模型每生成一个词元,都需要读取用于保存对话上下文的KV缓存。如果NPU片上空间不足,这些数据就必须在NPU和设备主内存之间频繁搬移,推高时延和功耗。用户感受到的“智能体反应迟钝”“答到一半忘了上下文”,根源往往在这里。
Hexagon NPU的做法是把共享内存容量较前代增加50%,让模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,大幅减少对外部内存的访问频次。简单说,数据留在NPU内部,智能体就不用每次都“跑一趟内存”。
更大的突破在模型层面。骁龙新一代旗舰平台支持在终端侧运行300亿参数的混合专家(MoE)模型,每次生成一个词元仅激活约30亿个被路由选中的参数。当前的DDR内存无法承载300亿参数规模的模型,高通的解法是一套从闪存到内存的智能加载机制——模型本体存储在闪存中,用到哪个“专家”再临时调入。配合INT2、INT4、INT8、FP8和FP16五种精度策略,开发者可以根据任务复杂度灵活平衡性能、内存、模型质量和功耗。

从能跑到一直跑:NPU正在重新定义手机的AI角色
骁龙新一代旗舰平台的Hexagon NPU,思路很明确:让AI不只是能在手机上跑,而是能一直跑、快速跑、更智能地跑。
“算得更快”解决的是响应问题——Element Accelerator和更大共享内存的协同,让智能体的每一步推理都干脆利落,用户不用等。“算得更多”解决的是能力问题——MoE和多精度策略的合力,让手机第一次有了承载百亿级参数模型的能力,智能体能做的事从“查天气、设闹钟”扩展到真正的复杂任务。
当手机从等你操作变成主动帮你做事,芯片的评价标准也随之改变。过去看的是峰值算力,未来看的是能不能在功耗红线之内,持续、稳定地输出智能体验。Hexagon NPU正在为这个标准建立新的基线——它不是一颗更快的NPU,而是一颗为智能体运行模式重新设计的计算核心。这或许才是智能体手机时代,NPU真正的价值所在。