GPU正成为端侧推理的“融合中心”:Imagination E系列架构揭秘
作者: 李祥敬
责任编辑: 李祥敬
来源: CBISMB
时间: 2026-09-24 11:50
关键字: AI ,GPU ,Imagination
浏览: 1
点赞: 0
收藏: 0
端侧芯片正面临5-10年生命周期的适配挑战。传统的“CPU+DSP+NPU+GPU”高度异构方案,正暴露出内存墙、调度延时和软件碎片化三大成本。Imagination给出的答案是:不再外挂独立的AI加速器,而是将AI Tensor Core直接融入GPU核心,让GPU成为端侧推理的“可编程融合中心”。
一、异构架构的“隐性成本”,所有单元都在向“可编程”靠拢
在手机、汽车等真实端侧应用中,一个完整的任务流通常是:感知数据→建模→推理→决策→GPU渲染输出。
从任务角度看,这是一个需要在确定时间内(如32G带宽预算内)完成的整体。但从芯片设计角度看,它却被切割得支离破碎:
- 视频流处理交给DSP;
- AI推理交给NPU;
- 渲染交给GPU;
- 一些难以执行的算子又回流到GPU。
这种高度异构的结构,带来了三个难以回避的代价:
- 内存墙:数据在DDR、SRAM及各IP之间频繁搬移,直接推高功耗。
- 调度延时:任务在CPU、NPU、GPU之间来回切换,延迟层层叠加。
- 软件栈集成:各家IP的软件栈与集成方式不同,给工程师带来沉重的开发负担。
更关键的是,芯片一旦流片,硬件配置即固定。而一颗端侧芯片的生命周期往往长达5至10年,期间必然会出现当前架构无法预见的模型与需求。如何让架构具备足够的灵活性与可编程性,是端侧推理芯片设计的核心命题。
面对上述挑战,产业界正在发生有趣的“趋同”:
- CPU在增加向量与矩阵运算能力;
- NPU发现自己过于专用,开始增加可编程性;
- GPU本身拥有海量并行度,正从以图形为主,逐步走向计算与AI场景。
Imagination的判断非常明确:GPU正在成为这个可编程的中心。与其在GPU之外堆叠独立的AI加速器(这只会加剧上述三大成本),不如把AI能力直接放进GPU里面。当AI Tensor Core与GPU通用计算紧密结合,内存搬运、调度延时和集成工作都将大幅简化。
二、Imagination E系列架构揭秘:把AI放进计算核心
作为全球领先的GPU IP供应商,Imagination在其E系列GPU IP中实践了这一理念。其核心思路是:在计算中心里加入AI能力,让它尽可能靠近通用计算部分。
具体实现上,AI能力被放置在离USC(统一着色集群)极近的位置。USC提供了GPU最通用的FP32算力,而新增的AI部分负责Tensor Core式的矩阵运算。两者协同工作,使得寄存器、内存开销及缓存可以在同一个架构内完成,彻底告别跨IP的数据搬运。
在底层,E系列保证了图形渲染与AI能力的硬件级结合。通过多核扩展,例如四核配置即可提供超过200TOPS的INT8算力与13TFLOPS的浮点运算能力,足以满足端侧大模型推理的算力需求。
针对端侧部署对内存带宽极度敏感的特点,E系列在底层广泛支持多种轻量化权重格式,为端侧推理铺平道路。
将渲染与计算融合进同一个核心,真正的挑战在于调度。
Imagination在硬件中内置了固件,专门负责统一调度图形图元与张量任务,有效降低延迟。同时,多任务隔离是重中之重。例如,在汽车场景中,当娱乐系统崩溃时,仪表盘和自动驾驶推理绝不能受影响。E系列通过硬件机制管理不同任务的优先级、内存空间独占,确保关键任务的安全与稳定。
在软件层面,Imagination借鉴了行业成熟路径(类似NVIDIA),在中间层提供了完整的AI软件栈:
- ImgNN:AI算子库
- ImgGC:图优化库,用于大模型端侧部署的图层编译优化
- ImgFFT:傅里叶变换等常见运算库
上层应用可以直接调用这些底层优化库,结合硬件调度,实现性能与功耗的最佳平衡。
基于这套融合架构,Imagination公布了一系列实测数据,展示了图形与AI结合带来的显著提升:
基础算力跃升:传统卷积运算,相比上一代提升4.4倍;矩阵运算,提升4.8倍。
游戏与超分场景:在《古墓丽影:暗影》等重度负载中,通过AI计算处理光粒子等效果,调度更紧凑,功耗大幅下降。
最具代表性的是AI超分技术:先渲染540P画面,再通过AI放大至1080P。由于计算ALU与RAM距离极近(不再是独立IP),内存吞吐极为高效。结果是:渲染1080P可在2.3毫秒内完成,带宽节省54%;借助AI超分与压缩技术,可去除65%的权重。
端侧大模型推理:在大模型测试中,E系列表现亮眼:Prefill阶段(计算密集型),相比上一代提升4.3-4.7倍;Decode阶段(带宽敏感型),融合架构能更好地支持端侧大模型推理。
在实际场景演示中,千问3.5的4B模型已在端侧流畅运行。首Token输出达到亚秒级,Decode阶段可达120tokens/秒。无论是汽车、盲人识图、工业质检还是本地邮箱处理,数据在端侧处理既能保护隐私,又能摆脱信号限制。
三、展望:下一代更融合、更紧凑
Imagination技术支持总监艾克透露了Imagination的路线图:E系列这一代解决了“把AI融合到GPU里面”的问题。下一代,Imagination将致力于更好地配置、把核做得更大、扩展性更强,以适应从大到小的各种融合需求。长远来看,目标是追求更有效率、密度更高、整个Pipeline更紧凑的架构。






京公网安备:11010502051901号