
新成果可将物理任务转化为可复用仿真场景,减少真机实验成本。
编译 | 茄子
编辑 | 程茜
智东西7月29日消息,昨日,AI教母李飞飞的创企 World Labs 推出机器人训练闭环引擎 R2S2R(真实-仿真-真机)的最新成果。World Labs 的这项成果通过构建与现实环境高度对齐的可交互仿真世界,让机器人能够在虚拟环境中完成训练、评估和策略优化,再将优化后的策略迁移至真实机器人执行任务,并试图解决通用机器人研发中长期存在的数据采集困难、真机测试成本高以及模型泛化能力不足等问题。

▲李飞飞(左)与 SceniX 创始人李昀烛(中间)、a16z 的对话视频截图(图源:X)
这一成果通过 R2S2R 分为“真实转仿真(Real-to-Sim)”与“仿真转真机(Sim-to-Real)”两个部分展示。其中,Real-to-Sim 阶段将物理机器人、传感器、环境、物体和交互过程转化为仿真模型,保留任务相关的观察结果和动态特性;Sim-to-Real 阶段则在模拟环境中训练和测试机器人策略,并验证仿真表现是否能够预测真实世界运行效果。
这一最新成果正是由 World Labs 和其7月21日收购的美国机器人仿真创企 SceniX 联合打造。
与大语言模型依靠互联网海量数据快速迭代不同,机器人训练和评估长期面临数据瓶颈。真实环境中的机器人交互数据不仅采集成本高、难以规模化获取,还受到场景、安全和硬件条件限制,导致机器人难以像大模型一样通过数据规模提升能力。
李飞飞认为,要释放机器人领域的 Scaling Law,需要通过环境建模创造可交互的数字世界,用虚拟环境生成的数据补充真实世界中昂贵且难以获取的训练和评估数据。
此次推出的 R2S2R 首批成果正是 World Labs 对这一方向的探索,相比传统机器人仿真系统主要依赖人工搭建虚拟环境,R2S2R 利用世界模型技术,从真实机器人任务出发重建与现实高度一致的数字世界。
这样不仅可以还原机器人感知到的视觉信息,也能模拟机器人与环境交互过程中的物理反馈和动态变化,使仿真环境能够直接用于机器人策略训练、评估和优化。

▲R2S2R 首批成果将单次物理任务生成众多可控、可复用虚拟环境(图源:X)
01.Real-to-Sim:将真实机器人任务重建为虚实对齐的仿真环境
World Labs 展示了机械臂装箱的案例。在案例中,机械臂在仿真环境和现实环境里执行了相同的开环(无实时反馈修正,下发动作后不根据视觉传感实时调整)动作序列,并且在观测结果、物体运动轨迹以及任务结果上实现高度一致。

技术博客指出,想要在不同环境和任务中持续实现这种虚实对齐,仅依靠传统仿真器并不足够。因此,World Labs 开发了一套新的生成式世界建模系统。该系统能够生成高保真视觉效果、精准几何结构以及符合现实规律的物理和动力学表现,从而实现所需的 Real-to-Sim 对齐效果。
系统能够采集机器人本体、传感器、周围环境、操作物体以及任务演示数据。随后,这些数据会被重建为一个可交互的虚拟世界。该虚拟环境不仅保留机器人能够感知到的视觉信息,也还原了决定任务成功或失败的物理交互过程。
真实环境并不会提供完整、干净的测量数据。因为物体的形状、重量、摩擦力等关键参数可能存在不确定性;相机和机器人硬件也可能与设计参数产生偏差;线缆、包装材料等柔性物体在交互过程中产生的形变,也难以通过简单模型完整还原。
为了验证重建环境的准确性,研究团队分别在仿真环境和真实环境中执行匹配的开环交互任务,并直接对比两者的观测结果、物体响应以及最终任务表现。
World Labs 在技术博客中展示了不同类型的交互对象,包括刚性物体、关节结构物体以及可变形物体,同时适配不同机器人、传感器、环境和高接触复杂度任务的多个案例。
下图演示了 YAM 机械臂执行线缆操控任务,通过持续接触完成线缆滑动、布线和插拔操作,仿真与真实环境中的动作过程和任务结果保持高度一致。

该案例演示了 ALOHA 双臂机器人执行柔性线缆插入任务,机器人在线缆发生形变和持续接触的情况下,完成抓取线缆末端并将其插入孔洞的操作,验证了仿真环境对复杂柔性物体交互过程的还原能力。

案例演示了 RB-Y1 双臂机器人执行电源线操控任务,机器人通过双手协同操作,将可形变线缆围绕冰箱完成布线,并实现仿真与真实环境下相匹配的操作效果。

这个案例则演示了 ALOHA 双臂机器人执行立方体交接任务,两个机械臂完成精准抓取、交接和放置操作,仿真与真实环境中的观察结果、物体运动轨迹和任务结果高度匹配。

02.Sim-to-Real:依托仿真训练和评估机器人策略实现真实环境部署
技术博客指出,完成真实任务重建后,与现实环境高度对齐的仿真系统可以进一步成为机器人训练和评估的平台。研发人员可以在仿真环境中训练新的机器人策略,主动发现模型容易失败的场景,并根据这些问题生成针对性训练数据,优化策略后再回到真机环境验证。
相比完全依赖实体机器人反复测试,这种方式能够显著降低训练迭代过程中的时间和硬件成本。
1、训练
World Labs 展示了 ALOHA 双臂装箱任务案例。在案例中,该机器人策略完全基于仿真数据训练,不使用任何真实世界训练数据,训练完成后可直接从虚实对齐的仿真环境迁移至真实 ALOHA 机器人,并完成双臂装箱操作。

此外,World Labs 还测试了光照扰动条件下的策略鲁棒性,在改变视觉环境的情况下,同一机器人策略仍能够保持稳定运行,验证了仿真训练策略对于环境变化的适应能力。

World Labs 认为,真实硬件训练机器人存在明显限制,能够被人为搭建、重复测试并安全执行的场景十分有限。而在仿真环境中,研发人员可以自由调整物体位置、机器人状态、拍摄视角、光照条件、物理参数以及任务难度,让机器人在训练阶段提前接触大量现实中难以复现、测试成本较高的复杂情况。
在这一过程中,机器人可以不断尝试不同操作,从成功和失败结果中学习,而无需每次测试后重新布置真实环境。同时,仿真环境还能提供真实硬件难以直接获取的数据,例如物体精准位置、接触状态、受力变化以及不同动作对应的任务结果,帮助模型进一步优化。
World Labs 称,R2S2R 可以适配不同机器人、传感器和算法需求,同一个任务场景经过一次重建后,还能持续用于后续模型训练和硬件迭代,让仿真环境从一次性的测试工具,变成可重复使用的机器人研发平台。
World Labs 还展示了多个机器人任务案例,覆盖柔性线缆操作、可变形箱体、刚性物体以及复杂环境中的抓取放置任务。
这些案例中的机器人策略均依靠仿真训练完成,不包含任何真实世界训练数据,并能迁移到多种真实机器人平台执行任务。
下方案例演示了 RB-Y1 双臂机器人执行电源线操控任务,机器人通过双手协同完成可形变线缆围绕冰箱布线。

这个案例演示了 YAM 机械臂执行线缆操控任务,机器人通过持续接触完成线缆滑动、布线、插拔操作。

在利用 Flexiv 机械臂执行试管转移任务的案例中,机器人可以在严格几何公差要求下完成试管精准抓取和放置。

在 xArm 机械臂执行标记物分拣任务案例中,机器人能够从杂乱环境中逐一抓取细长且形状相似的物体。

在 xArm 机械臂执行铅笔分拣任务案例中,机器人能够从密集杂物中可靠提取细长物体。

World Labs 称,R2S2R 的价值并非在于展示单个成功案例,而在于通过虚实对齐的仿真环境,让机器人具备适应多任务、多物理交互场景的泛化能力。
2、评估
技术博客指出,机器人研发迭代速度远慢于大语言模型,核心限制是模型效果评估高度依赖实体硬件,这也是机器人基础模型研发的主要瓶颈。具备虚实对齐能力的仿真环境,可以让机器人评估过程实现规模化扩展。
并且,有了仿真环境后,研发团队不必被动等待机器人在真实硬件上暴露故障,而是可以在数千种可控仿真条件下主动搜索模型失效场景,在真实测试前筛掉大量检查点(checkpoint),只把最有潜力的策略投入高成本硬件测试,从而加快迭代、扩大测试覆盖范围、降低研发成本。
World Labs 提出,一个有价值的仿真系统并不需要完全复现真实世界中的成功率,而是需要支持与现实世界一致的决策逻辑。该逻辑能够识别策略成功和失败的位置,判断不同策略之间的优劣,并预测训练阶段的改进是否能够迁移到真实硬件。
World Labs 以 ALOHA 双臂立方体交接任务为例,展示 R2S2R 引擎的规模化评估能力。并且,所有结果均来自仿真环境和真实环境中的闭环策略运行测试。
研究团队称,衡量 R2S2R 引擎是否有效的关键标准之一,是仿真环境能否还原策略在成功与失败边界附近的行为表现。这也是进一步优化机器人策略学习算法的必要条件。
在仿真与真实环境的临界成功测试中,该策略通常会在立方体中心区域完成抓取。当任务接近模型泛化边界时,机械臂会尝试靠近立方体边缘进行抓取,虽然操作过程几乎导致任务失败,但最终仍分别在仿真环境和真实环境中完成任务。更重要的是,两种环境中均复现了相同的接近失败行为,并获得了一致的任务结果。

在仿真与真实环境的失败测试中,系统同样能够还原对应的失败行为和最终任务结果,表明仿真环境不仅能够复现任务流程和成功状态,也能够捕捉影响机器人策略表现的临界条件和失效情况。

对于开发机器人系统和机器人基础模型的团队而言,虚实对齐的仿真环境能够为策略和数据迭代提供系统化评估能力。它可以帮助研发人员发现哪些模型检查点表现最佳,定位策略成功或失败的位置,并指导下一阶段需要生成哪些训练数据。
实验覆盖不同策略架构、训练配置,还包括训练集内物体位置(ID)、训练集外未知位置(OOD)两类场景。
结果显示,在仿真环境中表现更好的策略,在真实硬件测试中同样表现更优。仿真能够保持不同策略之间的相对排名,跟踪模型训练过程中的性能提升和停滞阶段,并呈现与真实环境相似的成功区域和失败区域分布。

借助这套评估体系,机器人团队可以利用 R2S2R 引擎筛选模型检查点、发现性能退化问题、指导策略和数据迭代,并决定哪些模型值得投入高成本硬件测试。虚实对齐仿真由此成为机器人研发流程中的高吞吐评估层。
03.结语:仿真器是世界模型体系的关键环节
World Labs 此前提出,仿真器是世界模型体系中的关键环节,能够让智能体在虚拟世界中完成行动、学习和评估,而 R2S2R 的实验结果进一步验证了这一判断。
技术博客称,仅优化算法、增加真实硬件数据,仍难以解决机器人从实验室演示走向实际应用的泛化难题。R2S2R 通过打通 Real-to-Sim 与 Sim-to-Real 两个环节,将真实任务转化为可控仿真环境,并依托仿真完成机器人策略训练、评估和优化。
未来,高保真仿真有望不再只是机器人研发的辅助工具,而成为支撑机器人规模化训练与落地的重要基础设施。在云栈社区,我们持续关注这类前沿技术动态,不妨一起讨论,这种 “以虚训实” 的路子,会怎样改写机器人落地的成本曲线?
来源:World Labs