从GPU到具身智能 Imagination E系列GPU荣获2026年“强芯TOP100”架构创新奖

随着机器人和具身智能领域的AI负载日益复杂,Imagination正凭借其GPU融合加速架构,探索一种更高效、更灵活的边缘计算方案。

8月20日,2026年“强芯TOP100”评选结果在第六届中国集成电路设计创新大会暨IC应用博览会(ICDIA 2026)上揭晓。Imagination Technologies的E系列GPU IP荣获“2026强芯TOP100——架构创新奖”,以表彰其创新的GPU架构在AI与计算负载方面的探索。

9edc89ee-9d35-11f1-ab55-92fbcf53809c.jpg

作为一家纯粹的GPU IP公司,Imagination持续将GPU技术从传统图形领域延伸至AI和通用计算。该奖项进一步认可了Imagination在GPU架构上的持续创新。

活动期间,Imagination技术经理孙千喆也发表了演讲,探讨了公司面向机器人和具身智能的GPU融合加速理念。她阐述了E系列如何通过统一的计算架构来应对日益复杂且并发的负载。


机器人并非单一负载——而是多种负载并发运行

随着具身智能的发展,机器人正从执行预定义任务,演变为能够感知环境、理解世界、做出决策并与人类交互的智能系统。

这意味着机器人需要同时处理多种类型的负载。

孙千喆描述了四类关键负载:

感知——包括传感器数据接入与融合、计算机视觉、DNN推理和SLAM,需要高带宽和混合精度计算。

世界模型——负责场景理解、策略推理和决策制定,越来越多地采用大模型架构,如VLA、扩散Transformer和混合专家模型。

控制与安全——负责实时驱动和安全监控。这些负载要求确定性和隔离性,依然适合由CPUMCU及其他实时处理单元承担。

人机与环境交互——包括实时渲染、手势识别和远程操作,需要图形和AI负载协同工作。

例如,当仓库机器人检测到有人进入其行进路径时,它需要识别该人员,根据世界模型重新规划动作,执行确定性制动,并传达其意图——所有这些都需在相同的时间窗口内完成。

感知、世界模型、推理和交互需要并发进行,而非顺序执行。

这正是Imagination GPU融合加速方案的核心所在。


GPU正成为具身智能的核心AI计算引擎

那么,GPU在具身智能中究竟扮演什么角色?

简单来说,如果说MCU和实时处理器负责帮助机器人“精准可靠地移动”,那么GPU可以看作是它的“感知与思考引擎”——帮助机器人理解周围环境、解读世界,并基于AI模型做出决策。

具身智能要求机器人持续处理来自摄像头、激光雷达等传感器的数据,同时运行计算机视觉、SLAM、Transformer、VLA等AI模型。这些负载高度并行且计算密集,天然适合GPU加速。

GPU AI计算的价值不仅在于提供更高的算力性能,更关键的是,它能让机器人在有限的功耗预算内“看见、理解、推理和决策”。

因此,具身智能需要的不仅仅是针对单一AI模型优化的专用加速器,而是需要一种能够并发处理感知、AI推理、世界建模和图形负载的计算架构,同时随着AI模型的不断演进保持灵活性。

这正是Imagination GPU融合加速理念的核心——以GPU为计算基础,将AI、计算和图形负载统一在同一架构中,为具身智能提供更灵活、高效的边缘计算平台。


从多加速器到融合GPU架构

传统的异构计算系统通常为不同负载配备不同的专用加速器。虽然这可以优化单个任务,但随着AI模型和应用快速演进,也会带来新的挑战。

不同的加速器可能拥有各自独立的内存、队列、编译器和软件栈。数据在它们之间移动会增加功耗、延迟和软件集成成本。

Imagination认为,真正的融合不仅仅是把多个计算模块放在同一芯片上,而是让不同负载共享内存层次、调度机制和编程模型。

E系列正是围绕这一原则设计的。

在E系列架构中,矩阵加速单元MMA被集成到统一着色器架构中,与通用计算共享SRAM、调度机制和编程模型。这使得AI矩阵运算、通用计算和图形负载能够在同一架构内协同工作。

对于机器人应用而言,这意味着当新模型或新算子出现时,开发人员不一定需要等待新的固定功能硬件,也不必重建整个软件栈。


减少数据搬移以提高效率

在边缘AI系统中,数据搬移的成本往往比计算本身更为显著。访问片外DRAM所消耗的能量,大约比一次算术运算高出两个数量级,尽管具体比例因工艺技术和访问模式而异。因此,E系列高度重视数据局部性,并致力于减少不必要的数据搬移。

包括块内SRAM、微分块(microtiling)、图级融合和压缩在内的多项技术,有助于将中间数据保持在靠近计算资源的位置,减少对外部存储器的访问。

微分块技术允许部分结果在生产者和消费者之间保持本地化,从而实现多个计算层的融合。Imagination基于MLIR的图编译器imgGC可在编译时执行图级优化、布局、融合和调度。

PVRIC无损帧缓冲压缩,配合ASTC和HDR纹理格式,可进一步降低外部存储器带宽需求。减少数据搬移不仅能提高能效,也有助于降低延迟和系统级抖动。


一套架构应对持续演进的AI模型

机器人的AI模型发展迅速。一个系统今天可能使用CNN和Transformer,明天可能转向扩散模型、VLA模型,或者完全新颖的架构。芯片开发和部署可能需要数年时间,而模型的演变可能只需数月。对于机器人产品而言,可编程性和软件连续性因此变得愈发重要。

E系列支持多种精度,包括FP32、FP16、BF16、FP8、INT8和MXFP4,采用统一的数据通路和块内存架构。

因此,不同负载可以在同一系统中使用不同的精度级别——例如,安全关键路径使用FP32,感知任务使用FP16或BF16,VLA和量化推理则使用FP8或INT8。

在软件层面,模型可直接来自PyTorch和ONNX,imgGC负责图优化、布局、融合和调度。imgNN、imgBLAS和imgFFT等库为神经网络和经典计算负载提供优化内核。

执行可通过OpenCL进行,Vulkan则可用于图形相关负载。这种方法有助于减少开发人员为不同硬件架构重写模型的需求,从而降低软件移植和开发成本。


从原型到量产:机器人需要一个计算主干

如今,许多具身智能机器人使用15W至130W级别的开发模块进行原型设计。这些平台拥有成熟的生态系统和高计算性能,是开发和展示新型机器人系统的有效途径。

然而,从原型到量产产品,经济性会发生改变。量产机器人需要在密封外壳内运行,依靠电池供电,并满足消费或工业BOM成本约束。同时,它还需要能够适应多年的软件和模型演进。

因此,机器人需要的不仅仅是一个更大的AI加速器,而是需要一个计算主干,能够支持不同负载、产品配置,以及平台生命周期内未来的软件需求。

无人机、自主移动机器人(AMR),到协作机器人、医疗机器人,乃至最终的人形机器人,计算能力、功耗和芯片面积的需求可能相差数个数量级。

而E系列保持一致的是:统一架构、统一工具链、统一DDK。

多核扩展和Chiplet就绪的互连架构为跨不同产品需求扩展提供了灵活性,而统一的软件栈使开发人员能够在不同产品和代际间延续其软件投入。


以GPU融合构建下一代边缘智能

从图形渲染到AI推理,从通用计算到机器人感知,负载正日益走向融合。

Imagination认为,下一代边缘智能需要的不仅仅是更大、更多的专用加速器,而是一种能够在性能、能效、数据搬移、可编程性和安全隔离之间取得平衡的计算架构。

凭借E系列,Imagination正通过GPU融合加速架构,将其成熟的GPU技术延伸到机器人和具身智能领域。通过允许不同负载共享硬件资源、内存层次、调度机制和软件工具,E系列为日益复杂的边缘AI系统提供了灵活的基础。

荣获2026年“强芯中国TOP100——架构创新奖”,是对E系列创新架构的认可,也是对Imagination持续致力于推进基于GPU的计算技术的肯定。

GPU从图形到融合计算,Imagination正持续构建开放、可编程、高效的GPU架构,为下一代AI和机器人提供计算基础。

  • 随机文章
  • 热门文章

您可以还会对下面的文章感兴趣:

暂无相关文章