首页 > 热点播报 > 正文

高通公布下一代Hexagon NPU:两大关键变化!手机也能跑300亿参数模型

快科技9月11日消息, 继 CPU 、 GPU 之后,高通正式公布了新一代旗舰处理器的Hexagon NPU。

高通技术公司产品市场高级总监Cisco Cheng在署名博客中表示,智能体AI将定义移动计算的下一个时代,这些智能系统能够理解用户个人情境、跨应用协同运行、持续推理,并根据用户意图完成操作。

这意味着移动端AI芯片需要解决的不只是算得快,还要解决持续算、低延迟算以及多任务协同算的问题。

针对这一趋势,作为专为终端侧智能体AI打造的新一代Hexagon NPU,引入了两项关键变化,分别是Element Accelerator以及更大共享内存系统。

Element Accelerator是此次架构升级的核心,针对Transformer工作负载进行了专门优化,并结合向量计算单元与标量计算单元。

其中标量计算单元负责智能体的决策逻辑、路由和编排,向量计算单元提供高吞吐量AI数学计算,加速大模型推理过程中关键的计算任务。配合Fast Action Loops和KV-Cache加速,支持最长32K的上下文长度。

另外随着模型规模不断增大,AI性能的瓶颈并不一定单纯来自算力,数据在计算单元和外部内存之间频繁搬运,同样会带来明显的延迟和功耗。

对此新一代Hexagon NPU引入的更大共享内存系统,容量较前代增加50%,让模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,减少对外部内存的访问频次。 智能体在处理更长上下文、调用更多工具以及执行更多并发任务时能保持流畅响应。

高通还正与领先的内存和模型厂商合作,把MoE混合专家模型引入终端侧AI架构,让大参数模型在端侧运行成为可能。

一个300亿参数的MoE模型,每生成一个词元只激活约30亿个被路由选中的参数,配合基于闪存的模型加载机制和缓存技术,以低功耗和低内存需求实现大模型级别的AI体验。

精度策略上,平台支持INT2、INT4、INT8、FP8和FP16,开发者可在性能、内存、模型质量和功耗之间灵活平衡。

对于基于INT4的模型,该平台可实现最高50%的预填充性能提升,首词元生成时间缩短至1.5秒,解码吞吐更快,推测解码增强。

从整个架构来看,高通希望打造的已经不只是一个AI加速器,而是一套围绕终端侧智能体AI构建的计算体系。

随着更多AI功能从云端向终端迁移,手机本地算力需要承担的任务也将越来越复杂,高通此次围绕NPU计算单元、共享内存、模型架构和精度支持进行的布局,也是在为下一阶段的端侧AI能力提前铺路。

至于整个新一代旗舰平台的具体信息,则将在9月22日至24日(北京时间9月23-25日)的夏威夷骁龙峰会公布。

网友评论

热门IT产品
  1. ¥1999
    荣耀X80 Pro Max
    ·
  2. ¥4699
    HUAWEI Mate 80
    ·
  3. ¥1699
    华为畅享90 Pro Max
    ·
  4. ¥8999
    苹果iPhone17 Pro
    ·
  5. ¥7499
    OPPO Find X9 Ultra
    ·
  6. ¥9999
    苹果iPhone17 Pro Max
    ·
  7. ¥4499
    荣耀Magic8
    ·
  8. ¥3399
    iQOO Neo11至尊版
    ·
  9. ¥1599
    REDMI Note 17 Pro
    ·
  10. ¥4199
    REDMI K100 Pro Max
    ·