首页必读视频专题飞象趣谈光通信人工智能低空机器人智能汽车终端会展特约记者

“AI教母”李飞飞说的“数据荒漠”,入口在哪?

2026年9月16日 13:58CCTIME飞象网

大语言模型能“吃掉”整个互联网的文本来学习。物理世界,可没有这么一本现成的“百科全书”。

李飞飞再次出手了。7月底,她带着刚被 World Labs 收购的 SceniX 创始人李昀烛,一起上了硅谷顶级风投 a16z 的播客节目,直言目前卡住具身智能的不是芯片、不是算法,是数据荒漠。

李飞飞创办的 World Labs 擅长生成式模型和 3D 重建,几张照片就能生成一个几何一致的 3D 空间;SceniX 擅长高精度物理仿真、接触建模、虚实对齐。

合体后,双方准备先给机器人造一个和物理世界高度对齐的仿真世界模型,让机器人在模型里训练、试错、评估,再把策略直接部署回真机,实现 R2S2R(Real-to-Sim-to-Real)。

如何实现?

第一步,Real-to-Sim(真实 → 仿真):把真实机器人、传感器、环境和交互过程搬进仿真模型,不只还原外观和几何,还要复现重量、摩擦、柔性形变、接触反馈。

第二步,Sim-to-Real(仿真 → 真机):在这个对齐的世界里训练和评估策略,再直接部署回真机;真机跑出的新数据又回流反哺世界模型,形成闭环。

事实上,早在今年6月,World Labs 就在一篇长文《世界模型的功能分类》里把炒得滚烫的“世界模型”拆成了三种功能:渲染器负责把世界画成像素给人看,仿真器负责维护符合物理规律的世界状态,规划器负责根据当前状态和目标决定下一步动作。三者之所以能协同,靠的是一个共同的底层——空间上下文。所有图像、视频、3D 信息在同一套坐标里,物体、环境、时间在这套坐标里形成关系,而不是一张张孤立的图。

Real-to-Sim的第一道门槛,是“Real”

把一只透明的玻璃杯放在桌上。看见、伸手、握住,三岁小孩都能轻松做到。对机器人来说,这可能是它今天最难的一道题。在主流视觉方案里,机器人看到的透明物体几乎是“隐形”的,机器人看到的不是“一只杯子”,而是“一个洞”。它不知道该在哪里收拢手指,也不知道该用多大力气。

这个“洞”,不是算法不够强,也不是算力不够大。它在物理层面就丢了。

李飞飞说的“空间上下文”,恰恰是从这里开始建立的。而这个建立过程,今天远没有想象中那么可靠。

要把真实环境搬进仿真,必须先拥有高质量真实数据。想复现重量,就得先在真实世界称出这个物体的质量;想复现摩擦,就得先测出接触面的摩擦系数;想复现柔性形变,就得先记录材料受力后的形变曲线;想复现接触反馈,就得先采集力觉与触觉信号。

仿真世界要和物理世界“高度对齐”,这句话说起来轻巧,做起来却要拿真金白银去换。

也正因为如此,高质量的数据更加稀缺。

过去数据采的是“画面”,未来采的是“物理属性”。过去采的是二维像素,未来要采的是多维时空数据。

机器人“看”世界的方式,有三个结构性失真

今天机器人感知世界的主流方案,可以概括成四个字:先成像,后计算。

摄像头、双目视觉、结构光、ToF、激光雷达、IMU——每一类传感器各自把世界“拍”下来,再由算法在后端做融合、标定、对齐,最后拼出一个三维世界。

这条路支撑了过去十年的进展,功不可没。国内的感知层玩家已有近 800 家,速腾聚创在 2025 年人形机器人激光雷达市场占比达 35%,禾赛的产品已经用在波士顿动力 Atlas 上。这是一个拥挤而成熟的赛道。

但“先成像,后计算”有三个结构性缺陷,恰好打在了“空间上下文”的要害上:

其一,空间对不齐。多摄像头之间存在物理间距,物体边缘与深度必然出现偏差。

其二,时间不同步。不同传感器的采样频率与触发时序不一致,动态场景里目标位置会漂移。机器人看到的“现在”,其实是几个不同时刻拼出来的假象。

其三,材质缺失。透明、高反光、吸光材质对普通 RGB 相机天然不友好,重建时频繁出现孔洞。

目前,机器人身上搭载的传感器越堆越多,融合标定成本越抬越高,系统反而越来越不稳定。

如果先计算,后成像呢?

今年年初,一家叫时空张量的科技公司另辟蹊径,跳出传统多传感器融合的迭代思路,提出“先计算,后成像”的创新技术架构,将感知逻辑彻底反转。

时空张量自研了全球首台 7D 空间智能传感器,定名为“天眼”。“天眼”依托“一路双光”光路设计,在单条光路、一枚硬件之上,同步完成三维测距与二维语义成像,在光子抵达感光元件之前就启动空间计算,从物理根源消除多传感器带来的数据割裂问题,实现“超越融合”的感知效果。这一架构的巧妙之处在于:数据在源头就是对齐的、同步的、统一的,无需后期再做跨传感器的融合与标定。

时空张量提出的 7D 感知,就是在一枚传感器内一次性采集 X/Y/Z 三维坐标、RGB 色彩语义、高精度时间戳等七大维度信息。过去需要摄像头、激光雷达等多款硬件拼接才能拿到的数据,单台设备即可统一输出,空间位置、颜色语义与时间维度天然对齐,为上层算法提供了“开箱即用”的高质量输入。

性能参数同样亮眼。产品感知量程覆盖 0.15—30 米,近距离可达毫米级精度,中远距离保持厘米级精度,一套硬件同时兼顾远距离导航避障与近距离灵巧抓取两大需求。硬件原生每秒输出 3072 万点超稠密点云,以 25Hz 全分辨率实时生成三维数据,并且内置 AI 算力,可直接输出彩色深度点云,无需外部算力二次运算,显著降低整机端的算力负担与集成复杂度。

对机器人厂商而言,这套方案的吸引力还在于系统级收益:单一硬件替代多传感器组合,意味着供应链管理更简单、装配工序更少、整机成本结构更清晰,同时数据源头的一致性也让算法团队从繁琐的标定与同步调试中解放出来,把精力投向真正的智能层开发。而这,正是“空间上下文”最需要的输入形态。

攻克材质盲区:透明与高反光不再“失明”

最受产业关注的,是这家公司攻克了困扰行业已久的材质盲区难题。凭借“先计算,后成像”的底层原理,传感器不依赖物体表面反射特性,能够对透明玻璃、高反光金属等传统视觉方案频频失效的物体实现无空洞完整重建——这在过去几乎是不可能完成的任务。

落地的想象空间也随之打开:家政机器人抓取玻璃杯,3C 产线机械臂识别反光焊点,仓库分拣异形包裹,户外机器人在强光环境作业……这些长期困扰行业落地的高难场景,天眼都能稳定输出完整、可靠的三维空间数据。某种意义上,天眼解决的不仅是“看得见”,更是“看得真”——让机器人在复杂真实场景中拥有接近人类的材质理解能力,这正是从实验室 Demo 走向规模化商用的关键一跃。对整机厂商而言,这意味着更简单的硬件方案与更低的成本——可帮助减少 2—3 颗传感器硬件,标定综合成本降低 60% 以上,SLAM 建图精度最高提升 3 倍,直接转化为产品竞争力。

时空张量技术体系源自中国科学院西安光学精密机械研究所与中国工程物理研究院光电领域多年的科研积累,科研底色的深度决定了技术路线的高度。目前,天眼传感器已经开启商业化落地:车载版本进入头部新能源车企上车测试,同时深度参与下一代人形机器人视觉系统方案开发,从汽车到人形机器人双线并进。

做世界模型的数据入口

李飞飞倡导的空间智能至少包括三层:

最上层是理解与推理,这是世界模型在做的事,让机器懂得空间的因果;

中间层是表征与生成,3D 重建、神经渲染、高斯泼溅,把空间变成可计算的对象;

而最底下那一层,是捕获,把真实世界数字化。

推理可以被修正,生成可以被重训,唯独捕获是一次性的:真实世界,需要被正确地记录。

李飞飞判断,机器人下一阶段的关键竞争,是“谁能更快生成大量可学习、可交互、可验证的世界”。

这个判断还可以放得更大。当人类开始批量生成世界,游戏、影视、建筑、设计、VR、机器人、科学、医疗、教育,所有需要三维空间的行业,都会进入同一场比赛。

而这些行业共同的前置环节是一样的:数字世界的可信度,首先取决于真实世界是怎么被看见的。

数字孪生的第一步,实则不是生成,而是采集。

当所有人都在讨论世界将被如何生成,时空张量回答了一个更底层的问题——世界,怎么被正确地看见。

编 辑:高靖宇
飞象网版权及免责声明:
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
推荐阅读

精彩视频

精彩专题

关于我们广告报价联系我们隐私声明本站地图

CCTIME飞象网 CopyRight © 2007-2026 By CCTIME.COM

京ICP备08004280号-1 电信与信息服务业务经营许可证080234号 京公网安备110105000771号

公司名称: 北京飞象互动文化传媒有限公司

未经书面许可,禁止转载、摘编、复制、镜像