VLA、世界模型、多模态——Superfluid Lab到底在“炼”什么丹?
Superfluid Lab这个名字挺抽象,这是元戎启行打造的国内首个面向物理世界基础能力研究的 AI Lab,名字取自物理学里的“超流体”——一种摩擦力接近于零的物质状态。但它的技术方向其实很具体。
核心就一件事:训练一个能够理解物理世界的通用基础模型。
从“分科教学”到“整体理解”
先说说以前的智驾系统是怎么做的。
接近“分科教学”——识别车辆是一门课,预测轨迹是一门课,规划路线又是另一门课。工程师把这些能力分别训练出来,再拼成一套系统。
这种方式的问题在于:每个模块都只负责自己那一亩三分地,缺乏对全局的理解。就像一个球队,前锋、中场、后卫各自练各自的,上了场才发现配合不起来。
基座模型的思路不一样。它先教机器理解世界——通过海量数据学习物体、空间、运动和因果关系,再把这些理解迁移到不同任务中。
遇到一个此前没专门训练过的场景,模型也有机会根据已有认知作出判断。
这就是大模型和小模型的本质区别。小模型更像条件反射——见过的东西能处理,没见过的就抓瞎。大模型追求的是认知智能——理解规律,然后举一反三。
元戎在GTC上展示的VLA基座模型有约400亿参数规模。但参数规模只是表象,真正的差异在于架构的统一——驾驶决策、场景理解、行为评估全部放在同一套模型里,而不是多个模块拼接。
具体研究什么?
Superfluid Lab聚焦三个技术方向:VLA模型、世界模型、多模态理解。
VLA视觉-语言-动作模型把视觉感知、语言理解和动作执行揉在一起。以前的车只能“看”,VLA能让车既“看”又“理解”还能“行动”。
举个具体的例子:看到一块“前方施工”的牌子,传统系统只做文字识别,VLA能理解“施工”意味着什么——前面可能有障碍物、车道可能变窄、可能需要减速变道。理解语义,然后转化为行动。
世界模型解决的是“世界会怎么变化”的问题。
传统自动驾驶的逻辑是“看见什么就应对什么”——看见一个人就刹车,看见一辆车就绕行。这是反应式的。
世界模型追求的是预测式的——理解物理世界的因果规律,提前预判接下来会发生什么。
一个塑料袋滚到路中央和一块石头滚到路中央,后果完全不同。塑料袋可以碾过去,石头得绕开。一个真正理解物理世界的模型,应该能区分这两种情况,而不是看见“有东西”就一律刹车。
元戎在模型预训练阶段采用了视频预测任务来让模型理解世界——视频的每一个像素都能作为监督信号,数据利用率达到100%。这意味着模型不只是“看”视频,而是在学习“视频里的世界接下来会怎么变”。
多模态则是把视觉、语言、传感器数据等各种信息融合起来,让模型对世界的理解更全面。
一个更难定义的目标
Superfluid Lab的定位文件里有一句话:不局限于单一应用场景,致力于打造支撑具身智能、机器人控制与真实环境交互的通用AI基座。
翻译一下:这套模型不光给车用。
车只是一个载体,一个验证场景。真正想做的,是一个能理解物理世界、能在物理世界里行动的通用智能。将来机器人、无人机、机械臂都能用同一套底层能力。
这就是为什么元戎说自己的长期愿景是成为“物理世界的AI基础设施”——“就像通信、电力一样,成为支撑现实世界运行的基础能力”。
通信和电力没人会天天念叨,但离了它们什么都不转。元戎想做的就是这个——让AI理解并作用于物理世界的能力,变成像水电一样随时可调用的东西。
为什么元戎能做这件事?
一个关键条件是数据。
元戎已经有超过50万辆量产车在路上跑。研究人员的模型可以面对持续变化的真实交通环境,可以观察一个判断怎样变成车辆动作,也可以看到算法在真实世界中犯下的错误。
对于研究物理AI的人来说,这是一套规模庞大的真实世界实验装置。其他AI实验室很难复制这个条件——他们没有这么多车在真实世界里跑。
从开车到理解世界
元戎的计划是:先让模型学会开车,完成之后再把模型从汽车迁移到更多机器和场景中。
能够应对开放道路的模型,才有资格进入更多物理场景。智驾因而成为物理智能的试金石——负责验证能力,却不再限定能力的边界。
Superfluid Lab因此不是传统意义上的智驾研发部门,也还不是一家独立的基础模型公司。它处在两者之间,借用商业化业务积累的资源,寻找超出业务边界的答案。
一个塑料袋和一块石头有什么不同?这个问题看似简单,但让机器理解其中的物理差异,需要的是对世界本质的认知。
Superfluid Lab就在做这件事。
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
加速价值跃升:华为解锁数智化转型服务新路径
伴随人工智能技术的飞速进步,越来越多的个人消费者和企业开始大量使用AI应用,在收获诸多便利的同时,也遇到了很多挑战。政企用户期待在推进软硬件升级的同时,也能获得规划、建设、运营、..[详细]
AI驱动流量暴增倒逼网络革新 增强上行能力成必答题
当前全球AI技术飞速发展、应用场景日益增多,对移动通信网络也提出了诸多挑战。在近日发布的2026年6月版《爱立信移动市场报告》中,爱立信详细分析了AI驱动的流量增长趋势,向全球运营商提出..[详细]
股民心态与光通信无关,刷大盘不如多洞察
今年以来,股市与光通信行业产生了紧密联系,也成了很多人茶余饭后的谈资,就连网络上的段子都开始调侃SPA店里的按摩师都要买入光模块。一时之间,曾经很多人都不知为何物的东西,成为你懂我..[详细]
从香江防线到草原新城:UQC如何重塑全球安全与创新版图
在2026世界人工智能大会期间举办的未来计算•未来算力论坛上,深圳理工大学教务长、国际欧亚科学院院士赵伟,用一句话就交代了当今量子计算究竟发展到了什么程度,并且还让原本极具学术..[详细]
2030年用户数将达9.5亿!IPv6开启高质量发展新征程
近日,中央网络安全和信息化委员会印发《深化互联网协议第六版(IPv6)技术创新和融合应用实施方案(2026—2030年)》(以下简称《实施方案》),明确到2027年,IPv6端到端贯通水平全面提升..[详细]
AI下一站:从“虚拟世界”走向“物理世界”
过去几年,人工智能行业竞争主要集中在大模型上,比拼的是参数、数据训练和推理能力,甚至每隔几个月,模型榜单的座次就会发生变化。而在2026 世界人工智能大会的论坛现场,最明显的感受是,..[详细]













