GPU正成为端侧推理的“融合中心”:Imagination E系列架构揭秘

作者: 李祥敬

责任编辑: 李祥敬

来源: CBISMB

时间: 2026-09-24 11:50

关键字: AI GPU Imagination

浏览: 1

点赞: 0

收藏: 0

端侧芯片正面临5-10年生命周期的适配挑战。传统的“CPU+DSP+NPU+GPU”高度异构方案,正暴露出内存墙、调度延时和软件碎片化三大成本。Imagination给出的答案是:不再外挂独立的AI加速器,而是将AI Tensor Core直接融入GPU核心,让GPU成为端侧推理的“可编程融合中心”。

一、异构架构的“隐性成本”,所有单元都在向“可编程”靠拢

在手机、汽车等真实端侧应用中,一个完整的任务流通常是:感知数据→建模→推理→决策→GPU渲染输出。

从任务角度看,这是一个需要在确定时间内(如32G带宽预算内)完成的整体。但从芯片设计角度看,它却被切割得支离破碎:

  • 视频流处理交给DSP;
  • AI推理交给NPU;
  • 渲染交给GPU;
  • 一些难以执行的算子又回流到GPU。

这种高度异构的结构,带来了三个难以回避的代价:

  • 内存墙:​数据在DDR、SRAM及各IP之间频繁搬移,直接推高功耗。
  • 调度延时:​任务在CPU、NPU、GPU之间来回切换,延迟层层叠加。
  • 软件栈集成:​各家IP的软件栈与集成方式不同,给工程师带来沉重的开发负担。

更关键的是,芯片一旦流片,硬件配置即固定。而一颗端侧芯片的生命周期往往长达5至10年,期间必然会出现当前架构无法预见的模型与需求。如何让架构具备足够的灵活性与可编程性,是端侧推理芯片设计的核心命题。

面对上述挑战,产业界正在发生有趣的“趋同”:

  • CPU​在增加向量与矩阵运算能力;
  • NPU​发现自己过于专用,开始增加可编程性;
  • GPU​本身拥有海量并行度,正从以图形为主,逐步走向计算与AI场景。

Imagination的判断非常明确:GPU正在成为这个可编程的中心。​与其在GPU之外堆叠独立的AI加速器(这只会加剧上述三大成本),不如把AI能力直接放进GPU里面。当AI Tensor Core与GPU通用计算紧密结合,内存搬运、调度延时和集成工作都将大幅简化。

二、Imagination E系列架构揭秘:把AI放进计算核心

作为全球领先的GPU IP供应商,Imagination在其E系列GPU IP中实践了这一理念。其核心思路是:在计算中心里加入AI能力,让它尽可能靠近通用计算部分。

具体实现上,AI能力被放置在离USC(统一着色集群)​极近的位置。USC提供了GPU最通用的FP32算力,而新增的AI部分负责Tensor Core式的矩阵运算。两者协同工作,使得寄存器、内存开销及缓存可以在同一个架构内完成,彻底告别跨IP的数据搬运。

在底层,E系列保证了图形渲染与AI能力的硬件级结合。通过多核扩展,例如四核配置即可提供超过200TOPS的INT8算力​与13TFLOPS的浮点运算能力,足以满足端侧大模型推理的算力需求。

针对端侧部署对内存带宽极度敏感的特点,E系列在底层广泛支持多种轻量化权重格式,为端侧推理铺平道路。

将渲染与计算融合进同一个核心,真正的挑战在于调度。

Imagination在硬件中内置了固件,专门负责统一调度图形图元与张量任务,有效降低延迟。同时,多任务隔离是重中之重。例如,在汽车场景中,当娱乐系统崩溃时,仪表盘和自动驾驶推理绝不能受影响。E系列通过硬件机制管理不同任务的优先级、内存空间独占,确保关键任务的安全与稳定。

在软件层面,Imagination借鉴了行业成熟路径(类似NVIDIA),在中间层提供了完整的AI软件栈:

  • ImgNN:​AI算子库
  • ImgGC:​图优化库,用于大模型端侧部署的图层编译优化
  • ImgFFT:​傅里叶变换等常见运算库

上层应用可以直接调用这些底层优化库,结合硬件调度,实现性能与功耗的最佳平衡。

基于这套融合架构,Imagination公布了一系列实测数据,展示了图形与AI结合带来的显著提升:

基础算力跃升:传统卷积运算,相比上一代提升4.4倍;矩阵运算,提升4.8倍。

游戏与超分场景:在《古墓丽影:暗影》等重度负载中,通过AI计算处理光粒子等效果,调度更紧凑,功耗大幅下降。

最具代表性的是AI超分技术:先渲染540P画面,再通过AI放大至1080P。由于计算ALU与RAM距离极近(不再是独立IP),内存吞吐极为高效。结果是:渲染1080P可在2.3毫秒​内完成,带宽节省54%;借助AI超分与压缩技术,可去除65%​的权重。

端侧大模型推理:在大模型测试中,E系列表现亮眼:Prefill阶段(计算密集型),相比上一代提升4.3-4.7倍;Decode阶段(带宽敏感型),融合架构能更好地支持端侧大模型推理。

在实际场景演示中,千问3.5的4B模型已在端侧流畅运行。首Token输出达到亚秒级,Decode阶段可达120tokens/秒。无论是汽车、盲人识图、工业质检还是本地邮箱处理,数据在端侧处理既能保护隐私,又能摆脱信号限制。

三、展望:下一代更融合、更紧凑

Imagination技术支持总监艾克透露了Imagination的路线图:E系列这一代解决了“把AI融合到GPU里面”的问题。下一代,Imagination将致力于更好地配置、把核做得更大、扩展性更强,以适应从大到小的各种融合需求。长远来看,目标是追求更有效率、密度更高、整个Pipeline更紧凑的架构。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。
地址:北京市朝阳区北三环东路三元桥曙光西里甲1号第三置业A座1508室 电话:13391790444或(010)62178877
版权所有:电脑商情信息服务集团 北京赢邦策略咨询有限责任公司
声明:本媒体部分图片、文章来源于网络,版权归原作者所有,我司致力于保护作者版权,如有侵权,请与我司联系删除

京ICP备:2022009079号-2

京公网安备:11010502051901号

ICP证:京B2-20230255