AI2.0:物理AI推动融合可编程AI计算架构重塑未来系统设计
2026年08月24日 17:20 发布者:eechina
Imagination E系列GPU融合图形处理与AI算力并用高度可编程性来应对物理AI的计算需求与物理制约作者:北京华兴万邦管理咨询有限公司 翔煜 商瑞
8月20日,第六届集成电路设计创新会议暨应用展(ICDIA 2026)在南京扬子江国际会议中心开幕,Imagination的E系列图形处理硅知识产权(GPU IP)凭借面向端侧人工智能(AI)与图形系统的架构创新,获评“2026强芯TOP100——架构创新奖”。

在同期举办的具身智能生态论坛上,Imagination技术经理孙千喆以《面向机器人领域的GPU融合计算与加速解决方案》为题发表演讲,指出随着机器人等物理AI系统的自主化程度不断提高,提供支撑的相关端侧芯片的计算架构已超越传统GPU或专用AI加速器的范畴,需要在一颗晶粒(die)上用一个可编程单元来将感知、世界模型、推理和图形处理融合(converge)在一起,以帮助系统用户打破在新一代系统中遇到的计算和物理制约因素。

一场奖项认可,一场技术演讲,看似各有侧重,实则指向同一个正在浮出水面的产业判断:物理AI和一部分端侧AI正在推动新一代计算架构走出“专用加速器”的舒适区,转而要求一个能够同时承载场景信息处理、图形处理、AI计算与智能的融合算力单元,Imagination的E系列GPU是业界首个采用此类架构并可编程的融合处理器,此次获奖与被讨论也使其成为这一趋势的缩影:其“GPU融合可编程AI架构,面向未来系统设计”的产品定位,回应的恰恰是当下物理AI系统设计面临的结构性挑战。
物理AI系统设计的三重矛盾
机器人这样的物理AI系统的工作负载正以令硬件设计者焦虑的速度演进。从感知、世界建模、推理、人机交互到生成式AI应用,几乎每年都会涌现出新的算法。与之相对,专用加速器的性能增长往往依赖一条固定流水线,以兑现单一代际的性能承诺,这导致了软件栈日趋割裂,使研发工程师不得不随加速器的每次换代重写算子,系统架构的扩展性被一次次透支。

具身智能正在引起广泛的关注和参与,图为人头攒动的“2026世界机器人大会”(图片来源:华兴万邦)
比算法迭代更隐蔽的成本,藏在数据搬运里。在典型的异构SoC中,CPU、GPU、NPU与编解码器各自挂载独立的SRAM(静态随机存取存储器),每一次数据交换都要跨越内存边界,而跨内存边界移动数据的能耗,据估算可达计算本身的数十倍,延迟与抖动也随之累积。与此同时,功能安全要求关键路径获得隔离,能效优化又要求算力共享,混合关键性带来的矛盾让单一固定架构难以两全。
算法演进与固定流水线的矛盾、数据搬运的隐性能耗、安全隔离与算力共享的冲突——这三重矛盾共同构成了端侧系统设计的基本约束,再加上机器人这样的物理AI许多工作负载都并发进行使情况更加令人焦虑。同时,阻碍物理AI前进的因素还有物理和化学问题,电池容量并不能快速提升,而且在机器人十分宝贵的腔体空间,不能无限制添加硬件,还会遇到散热问题。也正因为如此,如何以一套架构用GPU融合计算与AI,不再是一个可选项,而是下一代系统设计绕不开的命题。
Neural Cores与Burst Processors:可编程底座上的两项创新
Imagination的E系列GPU IP专为端侧AI与图形系统而设计,依托高效的并行处理架构,在实现卓越图形性能的同时,可支持从2 TOPS(每秒万亿次运算)到200 TOPS的INT8 AI工作负载,覆盖图形渲染、桌面应用、智能手机自然语言处理、工业视觉以及自动驾驶等场景。因此,E系列GPU是开发用于机器人和自动驾驶汽车等物理AI应用的绝佳底层IP产品。

支撑E系列特有的GPU融合AI加速器架构创新是两项深度集成于GPU中的创新。Neural Cores(神经核)作为GPU内置的AI加速单元,最高可扩展至200 TOPS(INT8),在显著提升AI与计算性能的同时,与GPU及异构计算的软件生态体系全面融合;GPU中集成的Burst Processors(爆发处理器)则通过架构层面的设计,使边缘应用的平均功耗效率提升25%,在不牺牲性能的前提下,为端侧设备争取到更长的续航与更充裕的散热余量。
而贯穿这两项创新的共同底座是可编程性。GPU作为可编程处理器,能够有效应对图形、计算与AI算法的不断演进;开发者既可以通过Vulkan、OpenCL等主流API直接解锁AI能力,也可以借助基于开放标准的软件栈,将现有代码轻松迁移至神经核。Imagination提供的高效计算库与图编译器进一步释放GPU潜能,使每一次算法迭代都不必等待新的硬件流片。
AI进入计算路径:融合架构如何省掉每一次内存往返
如果说可编程性是E系列的方向,融合计算就是它的实现路径。这一架构由四个要素共同支撑:共享内存层级,以一套SRAM/缓存结构同时服务感知、推理、世界建模与图形;共享调度器,在SIMT(单指令多线程)管理下对计算、矩阵乘、采样器与DMA流水线进行在线细粒度调度。共享编程模型,则以OpenCL、PyTorch、llama.cpp、ONNX、Vulkan等一套工具链打通各计算平面;灵活架构,以统一的ISA、DDK与产品家族,从单瓦级设备覆盖到多芯粒系统。

这一思路与传统“外挂式”(Bolt-on)NPU模式形成鲜明对照。在Bolt-on模式下,NPU与GPU各自持有独立的存储与流水线,每层推理都要发生内存往返,不支持的算子还需回退到CPU;而E系列将矩阵乘加速器(MMA)直接集成进统一着色簇(USC),与其余计算共享内存、调度与编程模型,中间结果留在片上,数据搬运与调度抖动同步下降。
在更细的执行粒度上,tile-local SRAM实现局部执行,微分块(micro-tiling)让层间折叠为单一内核,imgGC图编译器把相邻算子融合进同一个着色器,PVRIC无损帧缓冲压缩与ASTC/HDR纹理压缩进一步削减带宽需求。
如果说共享内存与调度解决的是数据“搬不搬”的问题,数据通路的设计则回答了数据“怎么算”的问题。FP32、FP16/BF16、FP8、INT8与MXFP4共享同一条数据通路,吞吐最高可达FP32的16倍,精度格式混用不产生额外的格式转换开销——感知骨干网络、世界模型、VLA(视觉—语言—动作)策略与量化CNN各取所需,系统设计不必为单一精度提前站队。
同一套可编程架构,覆盖从机器人到汽车的算力曲线
当前,机器人正在走下舞台,走进生产和生活。对机器人与具身智能而言,融合架构的收益最为直观。一颗芯片需要同时承载四个计算平面:负责传感器接入与融合、计算机视觉与DNN推理的感知平面,负责SLAM(同步定位与建图)、VLA与场景推理的世界模型平面,负责渲染、手势识别与遥操作的HMI平面,以及负责实时驱动与监督的控制安全平面。确定性控制环与感知—行动环两条闭环在同一芯片上并存,恰好是共享调度与共享内存所擅长的场景。

然而,对机器人厂商而言,融合架构的价值不止于把四个计算平面塞进一颗芯片,更在于它能否跨越从原型到量产的那道坎。原型到量产之间,横亘着一道“硅缺口”。实验室里用基于通用GPU的开发模块验证算法是正确路径,但量产机器人必须装进密封壳体、靠电池供电、把BOM压到消费或工业级可接受的范围,还要支撑长达十年的软件迭代与升级。
出货只有50台时,开发模块的成本微不足道;出货5万台时,它就成了整机BOM清单上的绝对主角,这推动市场竞争变成谁先把成本降到比基于通用GPU开发模块远远更低的程度。于是问题变成了:量产需要一颗真正的芯片,而这颗芯片一旦流片就固定了,因此,如果它是专用NPU或者其他加速器,算法每演进一代就可能需要重新流片,其巨大的经济性挑战已经在智能驾驶芯片企业难以盈利中得到了体现。
如果它是通用GPU,虽然可以通过软件实现更新,但是复杂系统和应用显然还需要(外挂)AI加速器,从而带来了物理AI的空间、功耗和电池续航等物理化学问题。
如果它是Imagination E系列这样GPU融合可编程AI加速器,不仅新算法通过软件更新即可落地,同时还能提供可根据需求设定的AI加速器,用同一颗硅片能撑过整个产品生命周期。

当机器人要走下舞台时,对于物理AI,除了解决算力问题,还需要解决一系列物理(和化学)问题(图片来源:华兴万邦拍摄于WRC2026)
安全能力也为这条算力曲线提供了纵深。Imagination GPU 所承载的分布式安全机制(DSM),包括ECC(纠错码)与Parity奇偶校验、CRC(循环冗余校验)、Safety Pairs安全对、双核锁步固件、调度器联锁与Tile区域保护,以不翻倍芯片面积为代价实现持续故障覆盖,支持ISO 26262(汽车功能安全标准ASIL-B, ASIL-D)安全标准,并已在车规场景完成验证,可以快速移植到机器人和其他物理AI领域。
面向消费与桌面市场,Imagination E系列硬件级虚拟化支持每核最多16个虚拟机或者操作系统且内存完全隔离,多核去中心化扩展与固件管理调度则让同一架构平滑覆盖AI PC与桌面计算。作为规模化验证,基于Imagination GPU架构的设备全球累计出货已达110亿台。
架构是曲线,芯片是曲线上的点
一颗芯片只是曲线上的一个点,一个架构才是曲线本身——这是Imagination反复强调的判断,也是理解其E系列GPU的正确坐标。从单瓦级延伸到多芯粒,从机器人延伸到汽车,Imagination E系列GPU以同一套标准软件栈与工具链,把图形、计算与AI收敛到同一个可编程平台之上。
回到ICDIA的奖项与具身智能论坛的演讲,它们之所以值得被放在一起讨论,是因为二者共同确认了一件事:在端侧AI与图形、计算、感知和AI加速持续融合的趋势下,能够跟上长周期算法演进的架构,同时又能更好地适配物理AI的各种物理化学约束,而不是某一款固定功能的加速器,不是纯粹的通用GPU,而是一种GPU融合可编程加速的算力底座。
Imagination E系列GPU以“GPU融合可编程AI架构”回应“面向未来物理AI系统设计”,不绑定单一工作负载,让系统设计有能力跟上算法的下一次演进,也让芯片设计公司开发的物理AI SoC有更长的生命周期,有更多芯片出货来摊销研发成本并早日盈利。
