Scalabot发布HERON-CRA:从理解世界,到自主行动
一周前,Scalabot发布了HERON技术架构体系下的首个模型——HERON-World Model,让机器人学习世界、预演未来。但对于真正进入真实世界的机器人来说,这只是开始。
真实世界并不会按照预设的轨迹运行。物体会移动,环境会变化,任务会被打断,机器人也难免出现偏差。一次细微的位移、一次意外的碰撞,都可能让原本正确的动作逐渐偏离目标,最终导致整个任务失败。
因此,一个真正具备通用操作能力的机器人,不仅要知道应该怎么做,还需要知道:如果现实没有按照预期发生,接下来应该怎么办?
它需要记住过去发生了什么,判断自己距离目标还有多远,在错误中学习并修正行动,更要把一次真实世界中的经验,转化为下一次的能力。
基于这一思考,9月15日,Scalabot发布HERON技术架构体系下的第二个模型——HERON-Context Reinforcement Action Model(CRA)。
如果说HERON-World Model让机器人开始学习世界、预演未来,那么HERON-CRA则是进一步让机器人能够记住过去、从错误中学习,并将一次经验转化为下一次能力。
围绕这一目标,HERON-CRA构建了Context Expert、RL Engine与Cross-Embodiment Pretraining三项关键能力:让机器人理解任务如何发生,从错误中持续修正,并将学到的能力跨越不同身体与任务进行迁移。
从“会做”,到“会学习”,再到“越做越好”,HERON-CRA让机器人进一步具备了一套能够在真实世界中持续进化的行动能力。

HERON-CRA技术框架
Context Expert:
让机器人记住过去,理解任务如何发生

Context Expert
对于机器人来说,真正复杂的操作往往不是一个动作,而是一段连续发生的任务过程。
拿起一个杯子很简单,但如果任务是整理桌面、制作咖啡,或者叠好一双袜子,机器人需要连续完成几十个步骤。此时,仅仅理解眼前这一刻发生了什么远远不够。
它还需要知道:刚才发生了什么?物体原来在哪里?哪些步骤已经完成?环境又是如何一步步变化到现在的?
这也是当前主流VLA模型面临的一个重要挑战。它们能够很好地理解当前画面和语言指令,却很难仅凭当前观测完整还原一段任务的过程。对于长程任务,机器人需要的不只是“看见”,还需要“记住”。
HERON-CRA所具备的关键能力Context Expert,就是为机器人建立这样一套持续的时空记忆。
与简单堆叠历史图像不同,Context Expert将历史时刻的空间信息与语义信息编码为结构化的Context Token,并沿时间维度形成连续的4D时空上下文。其中,Spatial Token记录环境与物体的三维空间信息,Language Token保留对应场景的语义信息。模型因此能够同时关注“发生了什么”以及“它发生在哪里”。
这段时空上下文会与机器人当前看到的画面和任务指令共同参与动作决策。于是,机器人的每一步行动不再只是对当前画面的瞬时反应,而是建立在对整个任务过程的理解之上。
更重要的是,这种Context不仅让机器人能够记住过去,也让历史信息真正参与对当前任务的理解。面对新的任务或新的场景,机器人可以利用已有的上下文快速建立对当前情境的理解,而不必每一次都从零开始。
从“看到现在”,到“理解发生过什么”,Context Expert让机器人开始拥有了一段属于自己的任务记忆。
RL Engine:
让机器人从错误中学习,持续修正行动
对于真实世界中的机器人来说,“会做”并不意味着“每次都能做好”。
在理想环境中,机器人可以按照示范完成一项任务。但进入真实世界后,物体的位置可能发生变化,动作可能出现偏差,甚至一次细微的误差,都可能让后续步骤逐渐偏离目标。
传统的模仿学习更擅长回答应该怎么做,却很难回答另一个同样重要的问题:如果刚才做错了,下一步应该怎么修正?
HERON-CRA的RL Engine,就是为了让机器人具备这样的自我修正能力。
它首先需要让机器人知道:自己现在做得怎么样,距离任务成功还有多远。为此,HERON-CRA引入Value Model,不再只判断一个动作成功还是失败,而是结合任务最终结果与连续的时序变化,为每一个时刻提供稳定、连续的任务进度判断。
有了这样的判断,RL Engine并不需要推翻原有的动作能力、重新学习一遍,而是在原有VLA能力之上,学习如何纠正偏差。
RL Engine采用继承基础模型KV值、轻量化Residual RL的方式,让RL Engine专门学习那些原有策略不擅长处理的纠错动作:当动作出现偏差时,应该如何调整;当环境发生变化时,应该如何重新对齐;当任务即将失败时,又应该如何把它拉回正确轨迹。
更进一步,HERON-CRA将真实世界与HERON-World Model结合起来:机器人在真实环境中不断产生成功与失败的经验,这些真实状态又可以作为起点,让HERON-World Model生成“想象轨迹”,帮助机器人在不增加真实硬件风险的情况下反复尝试和学习。
于是,一个持续运转的学习闭环被建立起来:机器人执行→获得结果→判断偏差→学习修正→再次执行。
从“做对一次”,到“能够持续修正”,RL Engine让机器人的行动能力开始具备持续进化的可能。

HERON-CRA和HERON-World Model互动
Cross-Embodiment Pretraining:
让机器人学到的能力,跨越不同身体与任务
如果机器人只能在固定的身体和固定的任务中学习,那么即使它能够不断纠错,也很难真正走向通用。
现实世界中的机器人拥有不同的身体形态和动作能力,不同本体具有不同的运动方式、动作空间与操作边界;与此同时,它们面对的物体、环境和任务也各不相同。
这也是HERON-CRA在预训练阶段关注的问题:机器人究竟应该先学会什么?
HERON-CRA并没有把预训练的目标简单设定为学习如何控制某一台机器人,而是让模型首先从更加广泛、异构的数据中学习真实世界的规律——理解物体、空间、身体与环境之间如何发生交互。
为此,HERON-CRA融合了真实机器人遥操作、仿真数据、UMI以及第一视角人类视频等不同来源的数据,并覆盖人形机器人、轮式机器人、机械臂、夹爪、灵巧手等不同本体形态。
这些数据看似来自不同的机器人和不同的任务,但背后共享着一些更底层的规律:物体如何运动,空间如何变化,以及身体与环境之间如何发生交互。
因此,模型学习的并不只是“这台机器人应该怎样移动”,而是逐渐建立起对真实物理世界的理解。当面对新的机器人身体或新的任务时,它可以将已经形成的世界知识和任务经验迁移到新的场景中。
从“在一个身体上学会”,到“让能力跨越不同身体与任务”,Cross-Embodiment Pretraining让机器人真正开始走向通用。
结语
一周前,我们发布了HERON-World Model,让机器人学习世界,预演未来。
今天,HERON-CRA进一步让机器人记住过去,从错误中学习,将经验转化为能力。
HERON正在从“让机器人完成任务”,走向“让机器人持续获得能力”。
让智能,在真实世界生长。
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
直击2026中国算力大会,查看三大运营商的算力成绩单
随着人工智能等新一代信息技术快速发展,算力已成为推动科技创新、产业升级和社会进步的重要驱动力。根据最新发布的《2026综合算力全景分析》显示,我国综合算力基础持续夯实,正从“建得多..[详细]
一阖一辟谓之变!读懂中国联通“四大图谱”
人工智能大潮涌动,越来越多的行业开始从技术进步中受益,继而更加坚决、深入地引入人工智能技术和服务。作为全球领先的电信运营商,中国联通将如何应对这场全新的科技革命?[详细]
专题报道丨2026中国算力大会
9月11日至13日,2026中国算力大会在河北省廊坊市举行。大会以“共织算力网 智启新未来”为主题,紧扣全国一体化算力网新部署,汇聚政产学研用金等各方资源,搭建国家级产业交流、创新赋能、..[详细]
专题报道丨第27届中国国际光电博览会
9月的深圳国际会展中心,人比光密。9月9日,第27届中国国际光电博览会(CIOE)开幕首日,超4000家光电企业,吸引进场观众101741人,同比增加38%,热门展台前要"插空"才看得清展品。..[详细]
突破物理瓶颈,在深圳光博会寻找AI算力持续增长的答案
根据相关机构预估,包括AI工厂、词元经济在内,市场对于AI的需求已呈现出爆发式增长,基本上每两年就会有100倍以上的增长。然而,受限于半导体工艺和物理规律的硬性限制,单体 GPU 本身的能..[详细]
msup刘付强:别再比Token消耗量了,AI不是成本,是利润变量
当AI从技术工具演变为核心生产方式,企业如何跨越有模型、无利润的落地鸿沟?又怎样将零散的Agent应用,升维为可沉淀、可复制的组织级智能资产?在9月4日召开的第十一届A2M人工智能创新峰会..[详细]













