AI算力的下一场竞争是“生产Token”
过去两年,AI算力行业经历了一次明显的重心转移。
最初,企业争抢的是GPU。随着大模型快速发展,算力成为AI应用落地的前提,地方政府和企业纷纷建设数据中心、采购GPU,甚至一度出现“有卡就有算力”的行业共识。
但当企业真正开始把大模型部署到自己的业务环境中,问题随之从“有没有GPU”变成“GPU能不能真正跑起来”。
这中间隔着一整套复杂的软件工程。
GPUStack CEO秦小康在接受界面新闻采访时称,目前市场上存在大量GPU、模型和推理后端,不同硬件、模型和推理框架之间形成复杂的组合关系。一款模型即使拿到了GPU,也不能直接运行,需要经过推理后端适配以及针对具体硬件的性能优化。
GPUStack因此从最初的GPU资源管理,转向覆盖GPU管理、模型部署、推理引擎适配和运营管理的“一揽子工程”。
如果把AI算力比作水电基础设施,GPU是发电设备,模型和应用是用电、用水的一端,那么GPUStack更像一家“水力公司”——它不生产GPU,也不制造大模型,而是负责把分散的算力组织起来,根据需求调度,让算力能够稳定地转化为Token。
这背后变化的是AI算力产业的计量方式:从“有多少张卡”,开始走向“这些卡能生产多少Token”。
从“抢GPU”到“用好GPU”
国产GPU正在经历一个重要的产业阶段。
秦小康认为,过去两年AI基础设施最明显的两个变化,一是开源模型快速追赶并进入更多应用场景,二是非英伟达体系的GPU开始被更多真实业务验证。对国产算力而言,这意味着行业关注点开始从芯片本身向软件生态和实际使用效率移动。
这也是GPUStack切入的核心位置,一块国产GPU真正进入生产环境,要解决的并不只是硬件问题。秦小康对界面新闻表示,目前最普遍的两类问题,一类是模型和GPU无法适配,导致GPU直接闲置;另一类是模型虽然能够运行,但硬件性能无法充分释放。
他提到一个金融客户的案例,该客户此前基于华为GPU运行模型,经优化后吞吐量提升8至9倍、推理延迟降低80%至90%。不过这一案例属于极致优化效果;对于原本已经具备较好优化基础的场景,平台方面认为,20%至30%左右的利用率提升已经属于行业较好的水平。
这里真正值得关注的,并不是某个平台能够把利用率提高多少个百分点,而是国产GPU产业的竞争正在向软件栈延伸。
“单纯做GPU算力编排本身并不是最难的事情,真正复杂的是推理后端和推理引擎的适配优化。”GPUStack CTO梁胜认为,不同GPU对应不同的软件体系,不同模型又有不同的运行要求,模型架构还在快速变化,导致AI算力基础设施仍处于类似早期PC时代“驱动不断适配”的阶段。
GPUStack试图通过可插拔的推理后端机制解决这一问题:模型厂商推出新的模型或定制化推理后端时,不必重新改造整个平台,而是通过接口快速接入。
这也是GPUStack与传统GPU云、单纯GPU调度工具之间的一个区别。
该公司认为,目前这一市场并不存在一个完全对应GPUStack的竞争对手,海外已经形成多种GPU编排和AI基础设施方案,例如NVIDIA旗下Run:ai主要解决GPU调度、资源池化和集群编排;Kubernetes生态中的Kueue、Volcano等开源项目也在解决GPU工作负载调度问题;Anyscale则更多从分布式计算和AI工作负载扩展切入。欧盟委员会在分析GPU编排软件市场时,也将Run:ai与Slurm、ClearML、Anyscale、Kubeflow等视为不同程度的替代方案。
GPUStack则试图把竞争位置进一步向上延伸:不仅管GPU,还要把GPU、模型、推理引擎和Token服务串起来。
这意味着它真正面对的竞争,并不只是另一家GPU调度软件公司,而是企业自己搭建平台、芯片厂商自有软件栈、云厂商AI基础设施以及各种开源项目的组合。
这也是开源模式对GPUStack的重要意义,其团队认为,AI硬件和模型都在高速迭代,不可能依靠单一企业完成所有适配,因此需要硬件厂商、模型厂商和开发者共同参与。GPUStack目前已经形成11万级部署体量,用户的真实使用和反馈成为产品迭代的重要来源。
算力开始拼效率
AI算力行业的商业模式也正在发生变化。
秦小康认为,目前国内不少Token工厂仍然采取项目制模式,主要服务万卡以上的大型算力集群。但未来不可能所有企业都依赖少数大型公有算力中心。对于金融、能源、制造等大量对数据安全、成本和业务场景有要求的企业而言,私有部署仍然存在需求。
这意味着,AI算力市场可能出现一个新的分层:少数超大型算力中心提供基础算力,大量企业建设自己的“小型Token工厂”。
GPUStack瞄准的正是后者,从商业逻辑上看,这与过去云计算的发展有一定相似之处:基础设施逐渐标准化之后,企业不再需要自己搭建所有底层系统,而是购买一套成熟的软件和服务,把底层复杂性屏蔽掉。
帝欧水华集团董事长朱江的经历,提供了一个来自“买方”的观察。
作为传统产业企业,其团队此前已经开始建设算力业务,并尝试自己搭建算力管理体系。朱江向界面新闻回忆,该公司曾投入上百万元自研,但AI工程化人才稀缺,GPU适配、软件部署和漏洞修复都需要大量投入。最终,开源的GPUStack降低了自研门槛,使企业能够更快完成多品牌GPU的统一管理和算力服务搭建。
朱江对行业的判断是,GPU短缺不会永远存在。随着GPU供给增加,企业竞争的重点将从“谁能拿到GPU”转向“谁能把GPU管理好、利用好”。其所在企业已经将算力业务视为第二增长曲线。
这实际上也是GPUStack试图回答的行业问题:当GPU逐渐从稀缺资源变成一种可以被规模化采购的生产资料,新的瓶颈会在哪里?
答案可能不是更多的GPU,而是如何把不同品牌的GPU、不同模型和不同推理引擎组织成一个稳定的生产系统。
因此,“Token工厂”并不只是给AI算力换了一个新名字,它指向的是AI基础设施的一次变化——AI行业正在从争夺算力资产,转向争夺算力效率;从建设算力中心,转向建设能够持续生产Token的基础设施。
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
智能体规模化落地,企业园区网络从“管道”迈向“智能基座”
根据中国信息通信研究院最新发布的《万兆AI园区网络以太技术研究报告》,随着智能体 AI(AI Agent)的规模化落地,正在重构企业园区的业务模型与运行范式,对园区网络带来了深刻而巨大的影响..[详细]
国家数据发展研究院胡坚波:如何打通词元落地最后一公里
词元(Token)作为智能时代数据要素的价值锚点,为数据实现可计量、可定价、可交易提供统一的技术标尺,既打通了一条原始数据向智能服务转化的价值通路,也从现实层面,破解了数据要素价值难..[详细]
走进京津冀,解锁算力蓬勃发展新样本
随着人工智能等新一代信息技术快速发展,算力已成为推动科技创新、产业升级和社会进步的重要驱动力。今年4月,中共中央政治局会议部署推进“六张网”建设,算力网正式纳入国家新型基础设施建..[详细]
数智共昇,湘聚有为:探访湖南 “人工智能 +” 发展新图景
近年来,湖南积极推进数智融合、低碳高效的产业创新,华为、中国电信、中国移动、中国联通等企业也纷纷在湖南建设数智基础设施基地,与本地企业合作探索“人工智能+”应用,取得了丰硕的成果..[详细]
银河通用王鹤:期待具身智能与人形机器人的核心突破时刻
在2026世界机器人大会的主题论坛上,银河通用机器人股份有限公司创始人、首席技术官王鹤就道出了大家的心声。他在题为“推动具身智能与人形机器人的核心突破时刻”的演讲中,既分享了具身智..[详细]
6G新变革:当网络变“聪明”,普通消费者如何受益?
无论是4G、5G,还是6G,对于普通消费者而言,可能无法分辨其中的区别,也不关心连接方案通过什么样的底层技术方案,只有更好的体验才能产生明显的升级感知。与此同时,消费者的连接需求,又..[详细]













