快科技9月11日消息, 继 CPU 、 GPU 之后,高通正式公布了新一代旗舰处理器的Hexagon NPU。
高通技术公司产品市场高级总监Cisco Cheng在署名博客中表示,智能体AI将定义移动计算的下一个时代,这些智能系统能够理解用户个人情境、跨应用协同运行、持续推理,并根据用户意图完成操作。
这意味着移动端AI芯片需要解决的不只是算得快,还要解决持续算、低延迟算以及多任务协同算的问题。
针对这一趋势,作为专为终端侧智能体AI打造的新一代Hexagon NPU,引入了两项关键变化,分别是Element Accelerator以及更大共享内存系统。
Element Accelerator是此次架构升级的核心,针对Transformer工作负载进行了专门优化,并结合向量计算单元与标量计算单元。
其中标量计算单元负责智能体的决策逻辑、路由和编排,向量计算单元提供高吞吐量AI数学计算,加速大模型推理过程中关键的计算任务。配合Fast Action Loops和KV-Cache加速,支持最长32K的上下文长度。
另外随着模型规模不断增大,AI性能的瓶颈并不一定单纯来自算力,数据在计算单元和外部内存之间频繁搬运,同样会带来明显的延迟和功耗。
对此新一代Hexagon NPU引入的更大共享内存系统,容量较前代增加50%,让模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,减少对外部内存的访问频次。 智能体在处理更长上下文、调用更多工具以及执行更多并发任务时能保持流畅响应。
高通还正与领先的内存和模型厂商合作,把MoE混合专家模型引入终端侧AI架构,让大参数模型在端侧运行成为可能。
一个300亿参数的MoE模型,每生成一个词元只激活约30亿个被路由选中的参数,配合基于闪存的模型加载机制和缓存技术,以低功耗和低内存需求实现大模型级别的AI体验。
精度策略上,平台支持INT2、INT4、INT8、FP8和FP16,开发者可在性能、内存、模型质量和功耗之间灵活平衡。
对于基于INT4的模型,该平台可实现最高50%的预填充性能提升,首词元生成时间缩短至1.5秒,解码吞吐更快,推测解码增强。
从整个架构来看,高通希望打造的已经不只是一个AI加速器,而是一套围绕终端侧智能体AI构建的计算体系。
随着更多AI功能从云端向终端迁移,手机本地算力需要承担的任务也将越来越复杂,高通此次围绕NPU计算单元、共享内存、模型架构和精度支持进行的布局,也是在为下一阶段的端侧AI能力提前铺路。
至于整个新一代旗舰平台的具体信息,则将在9月22日至24日(北京时间9月23-25日)的夏威夷骁龙峰会公布。


粤公网安备 44010602000162号
网友评论