砍掉SoC“边境税”,Imagination GPU成为融合“重心”最优选
飞象原创(魏德龄/文)如今,几乎所有的设备都在通过引入AI来实现更强的功能,无论是手机、汽车、机器人,还是工业摄像头,它们出现了一种“融合”的趋势,所有的任务不再是各司其职,而是在同一个工作流中运行,使用同一块电池,共享同一套资源与预算。
然而,表面正在发生的融合,却在一切运转的核心,即在小小的芯片层面并没有产生真正的融合,不同的任务交给了不同的专用芯片与加速器。例如图形的任务给了GPU、信号处理给了DSP、神经网络通过NPU,以及最开始的老朋友CPU。无论是谁,本质上都是一颗颗的专用芯片或加速器。
于是,每一个融合的任务流背后,却要在SoC经历所谓“边境税”的困扰。
SoC里的“边境税”
“把它们都塞进SoC,就会带来一个大问题:各个部件之间要通过外部内存来回传数据,而外部内存是最贵的。我把这种昂贵的数据通信叫作‘边境税’。”Imagination Technologies CEOMarkus Mosen形容这种状态让每个部件都像一座孤岛,系统在用最贵的方式将孤岛进行连接。
这种高昂的成本主要来自三个方面:一是数据在外部内存来回搬运耗掉的能量;二是数据通信带来的时延;三是开发投入的工程和人力成本。
而从技术趋势的走向来看,各个计算模块正在互相靠拢,形成融合。例如,CPU加了向量和矩阵扩展,NPU加了更宽的数字格式支持,GPU也在吸收AI计算和神经渲染。Markus Mosen认为,在这一融合趋势之下,真正需要的是一个共享的、可编程的“重心”。一旦有了一个可共享的可编程“重心”,整套系统就更灵活,数据传输量大降,计算资源利用率也上来了。
于是,问题转移到了哪一个计算模块最具备担负起融合“重心”的职责。
Imagination的“GPU-First”战略
“GPU是用户体验的核心。不管手机、平板、笔记本还是数字座舱,我们看到的每一个像素,背后都是GPU在渲染。”Imagination首席营收官Jake Kochnowicz抛出了这样一个结论,甚至是对于开发者而言,不管哪家的GPU,开发者面对的是同一套行业标准编程模型,代码写出来基本能跑在各家GPU上。他还用驾驶员与发动机形容了如今CPU与GPU之间的关系,GPU是发动机,提供把活干完所需的马力;CPU是驾驶员,做极高效率的规划和编排。
选择GPU作为融合重心的综合考量在于,GPU本身就是可编程的,已经在各种设备和边缘端规模部署,驱动、工具链、公开标准、开发者生态均已成熟。同时,任何显示设备都离不开图形处理,其他计算模块难以短时间内补齐该能力。
作为全球最好的GPU技术提供商的Imagination自然看到了其中的机遇。该公司近年来对其人工智能路线进行了重大重构,全面转向了“GPU-First”战略,将AI计算能力全面集成到其具有优势的GPU产品线中。
在2025年发布的E系列GPU将可编程AI加速高效集成进渲染管线。凭借一颗处理器、一套软件栈,它既可独立运行,也可与CPU及其他加速器协同,支持生成式AI、神经渲染与游戏等多种工作负载。
“对E系列来说,我们把矩阵乘法直接嵌进了GPU,就放在现有图形算术单元的旁边。这意味着AI能把GPU现成的一整套东西都用上:寄存器、控制、缓存、固件、驱动、工具链,还有围绕GPU的整个生态,这是对既有投资极高的杠杆利用。”Jake Kochnowicz表示这种架构带来的最直观性能反馈就是在最大四核配置时,FP16超过100 TFLOPS,FP8超过200 TFLOPS,实现了相比上代D系列四倍以上的性能提升。
矩阵能力直接嵌进GPU算术单元内部的设计解决了所谓的“边境税”问题。E系列在统一架构、统一内存层级与统一调度下运行,缩短了数据传输路径,消除了数据在片上各孤岛间频繁搬运的“距离成本”这意味着图形开发者只要写一套shader(Vulkan或OpenCL),在同一套编程范式下就能跑,不用再把数据引出到DDR。
Imagination的架构创新还不仅仅局限于硬件,在软件开发、专利和技术上也投入了大量资源。Imagination全新的Neural Super Resolution(NSR,神经超分辨率)AI加速超分辨率解决方案,拥有高度优化的神经超分辨率算法,并结合了拥有大量专利的压缩技术,可去除给定神经网络中超过一半的权重,从而实现一种极其轻量级、带宽需求极低的算法。
该时序超分辨率方案针对Imagination GPU进行了深度优化,并采用单次处理方式,结合Imagination专有的网络自压缩技术,可移除神经网络中约65%的冗余权重,模型更省电。在1GHz单核E系列GPU上,典型的540p到1080p超分辨率操作延迟低至2.3毫秒。
融合架构实现显著性能提升
“从图形与人工智能的融合出发,我们将目光更多地投向人工智能本身。”Jake Kochnowicz介绍Imagination选择专注于人工智能的基础构建模块:矩阵乘法和卷积。前者性能提升近5倍,极大地降低了延迟,从而实现了快速、响应灵敏的人工智能。后者提升至上一代的4.4倍。这种组合真正实现了涵盖机器人、个人助理、内容生成等领域的多模态AI处理。
与上一代D系列相比,该处理器在典型边缘语言模型上的预填充性能提升了4.7倍。以Qwen 3.5 4B为例,在典型工作负载下,一款1.5GHz的四核E系列GPU可实现0.2秒的首次Token生成时间,以及每秒150个Token的解码吞吐量。
E系列还在人工智能、计算机视觉、信号处理和通用计算中广泛使用的基础计算操作方面提升了性能。例如,与D系列同类产品相比,E系列运行Conv2D内核的速度快4.4倍,运行GEMM内核的速度快4.8倍。在矩阵乘法工作负载下,GPU利用率可达89%。
图形处理作为E系列的核心。该架构带来了显著的图形性能提升,包括对DirectX 12 FL11_0的支持。在实际游戏工作负载中,E系列与上一代同类产品相比,性能提升高达54%,其四核配置在部分AAA级桌面游戏中可实现超过60fps的帧率。每瓦性能提升最高达39%。在四核配置下,能够以60 FPS以上的表现,顺畅运行《博德之门3》等AAA级桌面游戏。
值得一提的是,在Imagination专门在媒体会现场展示了从手机、PC,再到汽车等多种应用场景下,ImaginationGPU所能胜任的各种设备类型,实现一种架构即可覆盖从边缘端的物理AI到数据中心级别的所有应用场景。
Imagination正在将已经处在用户体验核心的GPU,以新融合架构变身融合重心,让AI能力可以直接应用于一个拥有数十亿设备的既有生态上。在用户日常AI交互融合的背后,一场计算架构的融合同样正在发生。
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
2026 PT展前瞻:从“经营流量”到“经营智能”,五大看点抢先看
明天,北京国家会议中心将迎来一场属于通信行业的聚会。9月22日至24日,2026年中国国际信息通信展览会(PT EXPO CHINA 2026,以下简称PT展)将在这里举行。本届展会以“强网兴算 智汇生态”..[详细]
AI手机走向个人智能 让AI离你更近
AI手机竞争的下半场,比的不再只是模型,而是系统有多懂你。这个9月,手机圈的新品大战还在继续,操作系统却悄悄成了主角。荣耀发布行业首个真正实现系统级Agent Harness商用落地的MagicOS 1..[详细]
苹果下场折叠屏手机,这个品类依旧不完美
上周,苹果正式发布了传闻已久的折叠屏手机iPhone Duo,以苹果的生态能力而言,软件的适配似乎并不成本。但很多人还期待着苹果凭借着供应链整合能力,来解决折叠屏手机硬件上的几个顽疾,但..[详细]
新易盛张金双:打破光瓶颈,迎接高速光模块下一个黄金周期
在第27届CIOE中国国际光电博览会期间举办的“光引未来•大咖说”高端对话上,成都新易盛通信技术股份有限公司商务副总张金双,解析了硅光、薄膜铌酸锂、LPO(线性可插拔)/LRO(线性接..[详细]
直击2026中国算力大会,查看三大运营商的算力成绩单
随着人工智能等新一代信息技术快速发展,算力已成为推动科技创新、产业升级和社会进步的重要驱动力。根据最新发布的《2026综合算力全景分析》显示,我国综合算力基础持续夯实,正从“建得多..[详细]
一阖一辟谓之变!读懂中国联通“四大图谱”
人工智能大潮涌动,越来越多的行业开始从技术进步中受益,继而更加坚决、深入地引入人工智能技术和服务。作为全球领先的电信运营商,中国联通将如何应对这场全新的科技革命?[详细]













