首页必读视频专题飞象趣谈光通信人工智能低空机器人智能汽车终端会展特约记者

砍掉SoC“边境税”,Imagination GPU成为融合“重心”最优选

2026年9月21日 08:31CCTIME飞象网作 者:魏德龄

飞象原创(魏德龄/文)如今,几乎所有的设备都在通过引入AI来实现更强的功能,无论是手机、汽车、机器人,还是工业摄像头,它们出现了一种“融合”的趋势,所有的任务不再是各司其职,而是在同一个工作流中运行,使用同一块电池,共享同一套资源与预算。

然而,表面正在发生的融合,却在一切运转的核心,即在小小的芯片层面并没有产生真正的融合,不同的任务交给了不同的专用芯片与加速器。例如图形的任务给了GPU、信号处理给了DSP、神经网络通过NPU,以及最开始的老朋友CPU。无论是谁,本质上都是一颗颗的专用芯片或加速器。

于是,每一个融合的任务流背后,却要在SoC经历所谓“边境税”的困扰。

SoC里的“边境税”

“把它们都塞进SoC,就会带来一个大问题:各个部件之间要通过外部内存来回传数据,而外部内存是最贵的。我把这种昂贵的数据通信叫作‘边境税’。”Imagination Technologies CEOMarkus Mosen形容这种状态让每个部件都像一座孤岛,系统在用最贵的方式将孤岛进行连接。

这种高昂的成本主要来自三个方面:一是数据在外部内存来回搬运耗掉的能量;二是数据通信带来的时延;三是开发投入的工程和人力成本。

而从技术趋势的走向来看,各个计算模块正在互相靠拢,形成融合。例如,CPU加了向量和矩阵扩展,NPU加了更宽的数字格式支持,GPU也在吸收AI计算和神经渲染。Markus Mosen认为,在这一融合趋势之下,真正需要的是一个共享的、可编程的“重心”。一旦有了一个可共享的可编程“重心”,整套系统就更灵活,数据传输量大降,计算资源利用率也上来了。

于是,问题转移到了哪一个计算模块最具备担负起融合“重心”的职责。

Imagination的“GPU-First”战略

“GPU是用户体验的核心。不管手机、平板、笔记本还是数字座舱,我们看到的每一个像素,背后都是GPU在渲染。”Imagination首席营收官Jake Kochnowicz抛出了这样一个结论,甚至是对于开发者而言,不管哪家的GPU,开发者面对的是同一套行业标准编程模型,代码写出来基本能跑在各家GPU上。他还用驾驶员与发动机形容了如今CPU与GPU之间的关系,GPU是发动机,提供把活干完所需的马力;CPU是驾驶员,做极高效率的规划和编排。

选择GPU作为融合重心的综合考量在于,GPU本身就是可编程的,已经在各种设备和边缘端规模部署,驱动、工具链、公开标准、开发者生态均已成熟。同时,任何显示设备都离不开图形处理,其他计算模块难以短时间内补齐该能力。

作为全球最好的GPU技术提供商的Imagination自然看到了其中的机遇。该公司近年来对其人工智能路线进行了重大重构,全面转向了“GPU-First”战略,将AI计算能力全面集成到其具有优势的GPU产品线中。

在2025年发布的E系列GPU将可编程AI加速高效集成进渲染管线。凭借一颗处理器、一套软件栈,它既可独立运行,也可与CPU及其他加速器协同,支持生成式AI、神经渲染与游戏等多种工作负载。

“对E系列来说,我们把矩阵乘法直接嵌进了GPU,就放在现有图形算术单元的旁边。这意味着AI能把GPU现成的一整套东西都用上:寄存器、控制、缓存、固件、驱动、工具链,还有围绕GPU的整个生态,这是对既有投资极高的杠杆利用。”Jake Kochnowicz表示这种架构带来的最直观性能反馈就是在最大四核配置时,FP16超过100 TFLOPS,FP8超过200 TFLOPS,实现了相比上代D系列四倍以上的性能提升。

矩阵能力直接嵌进GPU算术单元内部的设计解决了所谓的“边境税”问题。E系列在统一架构、统一内存层级与统一调度下运行,缩短了数据传输路径,消除了数据在片上各孤岛间频繁搬运的“距离成本”这意味着图形开发者只要写一套shader(Vulkan或OpenCL),在同一套编程范式下就能跑,不用再把数据引出到DDR。

Imagination的架构创新还不仅仅局限于硬件,在软件开发、专利和技术上也投入了大量资源。Imagination全新的Neural Super Resolution(NSR,神经超分辨率)AI加速超分辨率解决方案,拥有高度优化的神经超分辨率算法,并结合了拥有大量专利的压缩技术,可去除给定神经网络中超过一半的权重,从而实现一种极其轻量级、带宽需求极低的算法。

该时序超分辨率方案针对Imagination GPU进行了深度优化,并采用单次处理方式,结合Imagination专有的网络自压缩技术,可移除神经网络中约65%的冗余权重,模型更省电。在1GHz单核E系列GPU上,典型的540p到1080p超分辨率操作延迟低至2.3毫秒。

融合架构实现显著性能提升

“从图形与人工智能的融合出发,我们将目光更多地投向人工智能本身。”Jake Kochnowicz介绍Imagination选择专注于人工智能的基础构建模块:矩阵乘法和卷积。前者性能提升近5倍,极大地降低了延迟,从而实现了快速、响应灵敏的人工智能。后者提升至上一代的4.4倍。这种组合真正实现了涵盖机器人、个人助理、内容生成等领域的多模态AI处理。

与上一代D系列相比,该处理器在典型边缘语言模型上的预填充性能提升了4.7倍。以Qwen 3.5 4B为例,在典型工作负载下,一款1.5GHz的四核E系列GPU可实现0.2秒的首次Token生成时间,以及每秒150个Token的解码吞吐量。

E系列还在人工智能、计算机视觉、信号处理和通用计算中广泛使用的基础计算操作方面提升了性能。例如,与D系列同类产品相比,E系列运行Conv2D内核的速度快4.4倍,运行GEMM内核的速度快4.8倍。在矩阵乘法工作负载下,GPU利用率可达89%。

图形处理作为E系列的核心。该架构带来了显著的图形性能提升,包括对DirectX 12 FL11_0的支持。在实际游戏工作负载中,E系列与上一代同类产品相比,性能提升高达54%,其四核配置在部分AAA级桌面游戏中可实现超过60fps的帧率。每瓦性能提升最高达39%。在四核配置下,能够以60 FPS以上的表现,顺畅运行《博德之门3》等AAA级桌面游戏。

值得一提的是,在Imagination专门在媒体会现场展示了从手机、PC,再到汽车等多种应用场景下,ImaginationGPU所能胜任的各种设备类型,实现一种架构即可覆盖从边缘端的物理AI到数据中心级别的所有应用场景。

Imagination正在将已经处在用户体验核心的GPU,以新融合架构变身融合重心,让AI能力可以直接应用于一个拥有数十亿设备的既有生态上。在用户日常AI交互融合的背后,一场计算架构的融合同样正在发生。

编 辑:魏德龄
飞象网版权及免责声明:
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
推荐阅读

精彩视频

精彩专题

关于我们广告报价联系我们隐私声明本站地图

CCTIME飞象网 CopyRight © 2007-2026 By CCTIME.COM

京ICP备08004280号-1 电信与信息服务业务经营许可证080234号 京公网安备110105000771号

公司名称: 北京飞象互动文化传媒有限公司

未经书面许可,禁止转载、摘编、复制、镜像