找回密码
立即注册
搜索
发回帖 发新帖

6209

积分

0

好友

781

主题
发表于 2 小时前 | 查看: 4| 回复: 0

机器人会抓杯子、摆积木,已经不算稀奇。真正让家庭机器人掉链子的,往往是一件软塌塌、会遮住自己、每次抓起来形状都不同的衣服。复旦大学、美的集团(上海)人工智能研究中心与卡内基梅隆大学合作的 RoboFolDeX 基准,没有再拿一个漂亮演示当终点,而是把 2000 多小时真机数据、20 多项任务、10 多种机器人和一套可审计的实体评测流程放到同一张桌子上。最值得关注的结果是:加入部署中的恢复数据后,平均成功率从 80.75% 提高到 95%。

此前讨论低光机器人操作时,一个核心问题是:实验室里表现不错的策略,为什么换个照明就可能突然失灵?这套新基准把问题再向前推了一步。即使光线不变,衣服本身也会不断改变状态。机器人前一秒抓住袖口,下一秒布料可能翻卷、遮挡、缠绕,早期一个小误差还会沿着后续十几个动作不断放大。

所以,这篇论文真正要问的不是“机器人能不能折一次衣服”,而是三个更难的问题:能否从篮子取出随机摆放的衣物,完成摊平、对齐、多次折叠和堆放;不同团队提交的模型能否在同一实体条件下公平比较;那些失败后由人接管、纠错和恢复的轨迹,能不能变成下一轮训练最值钱的数据。

论文给出的核心判断很朴素:具身智能下一阶段不只缺更多数据,更缺“怎样把昂贵真机经验反复用好”的标准答案。

RoboFolDeX 长时程折衣基准架构与实体评测流程

图1:上半部分展示仿真到真机、刚体到柔性物体两道落差;下半部分把恢复数据、跨任务、跨场景和跨机器人四条研究轴,与可提交模型的实体折衣挑战评测平台连接起来。右侧强调统一协议、视频审计和分项评分。

一、折衣服为什么比抓杯子难得多?

刚体物体的几何关系相对稳定。杯子的把手不会因为机器人碰了一下,就突然跑到杯底;积木被抓住后,也不会在机械臂运动过程中自己折叠。布料不同。它可以拉伸、弯曲、堆叠、自遮挡,还会因为摩擦、重力和接触位置不同产生完全不同的后续形态。

长时程任务又把难度放大。一次完整折衣流程要经历取出、翻面、摊平、识别衣物结构、抓住关键部位、完成多次折叠,最后再摆放或堆叠。前面抓偏两厘米,后面可能就找不到对称折线;早期没有摊平,最后即使“折完”,衣服也可能皱成一团。

这意味着评价不能只看最后有没有碰到目标。机器人或许偶然把衣服折成近似形状,却用了很长时间;也可能完成所有动作,但最终平整度很差。这套基准因此选择衣物折叠作为主任务族,专门测试连续变形、双臂协同、部分可见、阶段依赖和错误累积。

从工程角度看,这比“再收集一批演示视频”麻烦得多。场景重置要一致,衣物初始状态要受控,摄像头、标定、通信延迟和控制频率都可能改变结果。两个模型如果在不同衣服、不同摆放、不同机器人和不同推理设置上测试,得分看起来能比较,实际可能不是同一道题。

二、2000多小时真机数据,到底覆盖了什么?

这套数据基准完全由真实机器人数据构成,累计超过 2000 小时,覆盖 20 多项操作任务和 10 多种机器人形态。平台既有单臂和双臂设备,也有移动与人形配置,因此数据差异不只来自衣物,还来自机械结构、相机布局和控制方式。

每一步推理时,策略接收两个腕部相机和一个外部工作区相机的同步彩色图像,同时读取自然语言指令与机器人自身状态,再预测末端执行器未来一段轨迹。换句话说,模型不是只看一张正面照片猜动作,而是要把多视角视觉、指令、关节与位姿状态结合起来。

任务也不止“把毛巾对折”。论文用衬衫、裙子、裤子、毛巾等不同衣物测试结构差异,并加入其他柔性物体任务和少量刚体任务。刚体数据不是来凑数量,而是用于回答一个很实际的问题:过去训练机器人抓取硬物的经验,能否帮助它学习软物体操作,还是反而造成动作冲突。

更重要的是,数据并没有只按“任务名称”堆在一起。论文围绕四条轴组织数据:失败后的恢复、不同任务之间的迁移、不同场景之间的复用、不同机器人之间的迁移。这样做的好处是,每次实验只改变一种数据来源或测试分布,其余协议保持固定,模型进步究竟来自哪里更容易说清。

每条轨迹还要面对长任务的时间结构。取衣、摊平、定位袖口、第一次折叠、第二次折叠和最终堆放并不是六个互不相关的小任务。后一步能否成功,取决于前一步留下的状态。数据如果只截取某个短动作,模型可能学会局部技巧,却不知道怎样维护整条任务的进度。

因此,数据集保留完整闭环过程,而不是只保存成功终点。对于研究者,这意味着可以分析错误在哪个阶段开始累积;对于产品团队,则可以判断一次失败究竟是感知没看清、抓取位置错误、动作执行偏差,还是前一阶段已经把衣服摆到了不可恢复的位置。

长时程折衣阶段任务类型与多机器人场景总览

图2:从上到下依次展示完整折衣任务的主要阶段、不同衣物类别、其他柔性与刚体任务,以及多种机器人和场景。它说明这里测试的不是单次抓取,而是一条从取衣、摊平、折叠到堆放的连续链路。

三、实体折衣挑战:把“真机成绩”变成可复查的成绩

实体机器人论文常有一个尴尬:每个团队设备不同,复现实验的成本高,读者很难判断成绩差异来自算法,还是来自硬件、调参和现场工程。论文提出的实体折衣挑战试图把这个问题变成一套公共评测服务。外部团队提交策略后,由平台在受控实体环境中运行。

平台统一任务定义、保留测试物体、初始状态、场景重置和执行协议,并保留动作过程视频用于审计。这样至少可以减少“我的基线没调好、你的场景更简单、他的衣服更容易折”这类解释空间。论文还提供经过工程验证的强基线,避免新方法只赢过一个仓促复现的对手。

基线采用 π0 策略,并加入实时分块机制。直观理解,策略不是每次只吐出一个孤立动作,而是预测一小段动作序列;执行过程中又持续接收新观察并更新后续动作。对布料这种不断变化的对象,既要保持动作连贯,也要及时纠正偏差。

统一评测还会迫使研究者报告那些过去容易被藏在附录里的细节。比如每种衣物测试多少次,初始摆放怎样随机,失败后是否允许人工重置,模型看到哪些相机,动作频率和超时时间是多少。缺少这些信息时,同一个“成功率”可能对应完全不同的难度。

视频审计同样重要。数字只能告诉读者结果高低,完整过程才能暴露策略是否频繁停顿、是否靠偶然碰撞完成、是否在某个阶段反复试错。对于长时程机器人,失败模式本身就是研究证据。一个模型总在第二次折叠时偏航,与它随机分散地失败,背后的改进方向完全不同。

这套平台最大的价值,不是给排行榜多加一列,而是让“物理世界里的公平比较”成为研究对象本身。 真机性能高度依赖标定、延迟、初始状态和实现细节。把这些条件固定下来,算法改进才更接近可解释的改进。

四、综合折衣分为什么不只统计成功和失败?

如果只用二元成功率,很多重要差异会被压扁。两台机器人都完成折叠,一台折得平整、动作连贯,另一台耗时更长、最终衣服褶皱明显,最后却都记作一次成功。对真正要进入家庭或工厂的机器人,这种评分显然不够。

综合折衣分因此同时考虑任务是否完成、最终状态的平整程度和完成时间。成功率回答“做没做完”,平整度回答“成品质量如何”,时间则回答“是否具备可用效率”。三个维度合在一起,才能避免模型靠慢吞吞试错拿到看似漂亮的通关率。

可以把它理解成一次真实家务验收。衣服最终没有按要求折好,速度再快也没有意义;衣服折得很平整,却花了十几分钟反复重来,也难以进入产品。只有完成、质量和效率同时过关,分数才会稳定提高。这样的指标虽然仍不能覆盖全部用户体验,但比单一通关率更接近实际价值。

分项评分还有一个好处:新方法即使总分没有大幅上涨,也能看出改进来自哪里。是减少失败,还是让折叠结果更平整?是动作更快,还是只在某一种衣物上更稳?这些差异会直接影响后续研究路线,而不是被一个平均数字全部掩盖。

这也提示读者怎样看机器人论文。只报一个成功率,通常不足以判断真实价值。至少还要问:初始状态是不是随机的?测试物体是否在训练中出现?失败能否恢复?动作需要多久?最终状态是否满足使用要求?如果这些问题没有答案,数字再高也很难外推。

论文的统一评测还强调保留物理对象。测试衣物不直接出现在训练数据中,这比在熟悉衣服上反复练习更接近日常使用。家庭机器人不可能要求用户只买训练集里那几件衣服,它必须面对材质、尺寸、图案和初始褶皱不断变化的物体。

五、最亮眼的结果:失败后的恢复数据,把成功率推到95%

论文先训练一个只使用示范数据的多任务基线,再加入衬衫、裙子、裤子和毛巾任务中的恢复轨迹。所谓恢复轨迹,可以理解为策略执行出错后,人类如何接管、把状态拉回可继续操作的位置,以及机器人随后怎样完成任务。

加入这些数据后,四类任务的平均成功率从 80.75% 提高到 95.00%,平均综合折衣分从 75.59 提高到 82.53。裤子和毛巾任务达到 100% 成功率。提升并不是只体现在“最后做完了”,综合质量与效率分也同步上升。

为什么恢复数据这么有用?标准示范通常展示“正确路线”,但真实部署最常遇到的恰恰是偏离正确路线后的状态:袖子被压在衣身下面、一次抓取只提起一层布、衣服落点偏移、折线没有对齐。模型如果从没见过这些状态,就算会做标准动作,也不知道怎样把任务救回来。

从数据价值看,一段失败并不是废料。它暴露了策略最薄弱的状态分布;紧接着的人工干预,又给出“怎样从危险状态回到可控状态”的高密度监督。相比继续收集大量顺利演示,这类数据更集中地覆盖部署时真正会卡住的地方。

这里还有一个容易忽略的闭环。策略越频繁部署,就越容易遇到训练集中没有覆盖的异常状态;异常状态被记录并由人恢复,又能补进下一轮训练;新策略再次部署时,原来常见的失败会减少,更难的新失败则浮现出来。只要接管标准一致、数据标签可靠,部署就不只是验证模型,也是在持续发现最有信息量的训练样本。

但恢复数据也不是越多越好。人工接管动作如果风格混乱、目标不一致,模型可能学到互相矛盾的纠错方式;如果只保留恢复成功的片段,又会丢失哪些尝试无效的信息。论文的结果证明了方向有效,后续仍需要更细的数据质量控制、接管时机定义和失败类型标注。

80.75%到95%的变化说明,机器人学习的关键不只是模仿高手怎样一次做对,还要学习普通执行中怎样发现偏差、停止恶化并重新接上任务。

六、更多数据混在一起,为什么反而可能更差?

论文另外做了跨任务、跨场景和跨机器人复用的初步实验,结果没有“数据越多越好”那么轻松。把刚体和柔性物体任务直接联合训练,常会产生明显的动作干扰;先在一种任务上训练,再继续训练另一种任务,又容易忘掉原有动作能力。

原因并不难理解。抓杯子时,目标物体形状稳定,动作重点是定位、接近和夹持;折衣服时,接触本身会重塑目标状态,双臂还要持续协调。两类数据表面上都是“机器人轨迹”,内部的控制规律、误差来源和视觉变化却可能冲突。

跨机器人更难。不同平台的关节结构、工作空间、相机位置、控制接口和动作表示差别很大。直接混合训练时,同一个视觉意图可能对应完全不同的底层动作;继续训练到新平台时,模型又可能把旧平台的技能覆盖掉。论文观察到严重的动作空间干扰与灾难性遗忘,完整长任务往往无法可靠完成。

相对而言,照明、背景和适度工作区布局变化的破坏性较小。场景外观变化依然会降低稳定性,但比任务动力学变化和机器人形态变化更容易处理。这个对比很有价值:它告诉研究者,视觉域适应只是问题的一部分,真正难啃的是动作语义怎样跨任务、跨硬件对齐。

一种可能的研究方向,是先学习与硬件无关的高层技能,例如“找到袖口”“把两侧边缘对齐”“检测当前折叠是否偏斜”,再由每种机器人自己的控制器完成具体动作。另一种方向是把机器人形态、相机配置和动作空间显式写进模型条件,让模型知道同一个目标在不同平台上必须用不同方式实现。

无论选择哪条路线,这套基准都提供了一个更清晰的检验办法:在目标任务和实体协议不变时,控制训练数据来自哪种任务、场景或机器人,再观察完整长任务是否真正改善。这样可以避免只在短动作上看到迁移收益,却在最终折衣流程中整体失败。

七、和已有机器人基准相比,它补上了哪一块?

已有开放跨机器人数据集的贡献,是把不同机构、不同机器人的经验汇聚起来,让通用机器人策略第一次拥有大规模跨平台训练素材。但它更像一座数据大陆,任务定义、采集条件和评测协议高度多样,难以专门回答长时程折衣中的公平比较问题。

低成本真机复现基准关注可复现的实体评测,提供标准场景与分布内、分布外测试,能帮助团队在本地搭建相对一致的测试环境。不过,衣物折叠只是通用任务套件中的一个项目,没有像本文这样深入覆盖衣物类别、阶段状态、失败恢复和最终质量。

已有柔性物体仿真平台让相关研究可以大规模试验,适合快速开发和筛选算法。问题是,布料摩擦、褶皱、相机噪声、标定误差和控制延迟很难被完全模拟。仿真成绩可以证明思路值得继续,但不能替代真实机器人上的完整闭环测试。

本文基准的定位因此很明确:它不是取代所有通用数据集,也不是否定仿真,而是把“长时程柔性物体操作”这一条最容易被宽泛基准稀释的能力单独拉出来,用真机数据、实体保留物体、统一执行和多维评分做深。

八、这项工作还缺什么?

第一,长时程真机评测非常耗时间和硬件,论文目前只能覆盖有限模型。平台以后能否持续接收外部策略、保持设备状态一致,并及时公开更多可比结果,会决定它能不能从一次论文实验变成长期基础设施。

第二,四条数据复用轴目前更多是在定义问题、提供数据划分和初步现象。恢复数据已经显示明确收益,但跨任务、跨场景和跨机器人还没有给出完整解决方案。特别是跨机器人动作对齐,仍然存在严重负迁移和遗忘。

第三,当前系统主要依靠视觉和机器人自身状态,没有显式触觉。折衣服时,夹爪是否只抓住一层、布料是否打滑、接触压力是否合适,很多信息仅靠相机很难稳定判断。论文也把触觉反馈列为后续扩展方向。

第四,95%是四类任务在论文协议下的平均结果,不等于机器人已经能处理所有衣物、所有家庭环境和所有异常状态。材质更滑、衣物更大、遮挡更重、空间更拥挤时,表现仍需单独测试。读者可以认可这项进步,但不要把一个受控基准的高分直接翻译成“家务机器人已经成熟”。

第五,公共实体平台还需要长期治理。设备磨损、相机漂移、软件升级和衣物老化都会让多年后的测试条件发生变化。平台需要定期校准、记录版本、保留历史基线并公开异常处理规则,才能避免排行榜悄悄变成“不同年份做了不同题”。这部分工作不如新模型抢眼,却直接决定基准是否可信。

第六,外部策略进入实体设备还涉及安全隔离。提交的控制策略必须限制速度、力和工作空间,异常动作要能立即停止,评测失败也不能损坏设备或伤及操作人员。一个真正可持续的社区评测平台,既要公平,也要让每次执行都可控、可追踪、可恢复。

九、对研究团队和产品团队意味着什么?

第一,数据采集要从“只录成功示范”转向“保留失败、接管与恢复全过程”。 部署中最容易被删除的异常轨迹,可能正是下一轮提升鲁棒性的核心资产。团队需要把失败原因、人工接管点和恢复结果结构化保存,而不是只留下最后成功的视频。

第二,基准要固定真实执行条件,而不只是固定数据集。 机器人型号、相机位置、控制频率、初始状态和重置流程都会改变结论。产品团队如果只在内部“最好的一台设备、最熟的一件衣服”上测试,很容易高估系统成熟度。

第三,跨平台复用不能停在粗暴混合数据。 不同机器人需要更好的动作表示、形态条件化、技能接口或分层控制,才能把“共同意图”与“具体硬件动作”拆开。否则数据规模越大,冲突也可能越多。

第四,家庭机器人真正的产品指标应包含恢复能力。 用户不会因为机器人在标准摆放下成功率高,就接受它遇到一次褶皱便停机。能够识别偏差、主动重试、请求最少人工帮助,并从接管中学习,才是从演示走向产品的关键。

十、龙哥点评

龙哥觉得,这篇论文最值得肯定的,不是又做出一个会折衣服的机器人,而是把三个长期混在一起的问题拆开了:模型能力、数据价值和实体评测工程。过去不少工作给出一段漂亮视频,读者却不知道失败多少次、初始状态是否挑过、基线是否充分调优。实体折衣挑战至少在努力把这些隐变量变成明确协议。

恢复数据的实验也很有启发。机器人走向真实世界后,失败不可避免。最差的做法是把失败当作事故,只修当前问题;更好的做法是把失败变成新的训练分布。80.75%到95%的提升说明,部署本身可以成为数据循环的一部分,但前提是团队愿意记录过程、定义接管方式,并保证数据质量。

这项工作的关键不足也很清楚:跨任务与跨机器人复用仍没有被解决,触觉信息缺失,外部模型覆盖也受真机成本限制。它更像一块扎实的试验场,而不是一套已经通吃家庭操作的最终模型。研究者真正该做的,是在这套统一协议上证明新方法能稳定赢,而不是换一个更有利的场景重新拍视频。

如果把具身智能比作学开车,标准示范教的是“正常道路怎么开”,恢复数据教的是“打滑、偏航和判断失误后怎么救回来”。后者往往更贵、更乱,却更接近真正决定安全与可用性的能力。

龙迷三问

第一问:成功率已经95%,是不是很快就能买到会折衣服的家用机器人?

还不能这样推断。论文证明的是受控真机协议下,恢复数据显著改善四类折衣任务。家庭环境中的衣物、空间、光照、摆放和长期维护更复杂,产品还要解决成本、安全、噪声、速度和异常处置。

第二问:既然跨机器人混合会互相干扰,大规模机器人数据还有意义吗?

有意义,但不能只靠堆量。需要把任务意图、接触策略和硬件动作解耦,建立能感知机器人形态的表示与控制接口。这项结果不是否定跨平台数据,而是在提醒研究者先解决对齐问题。

第三问:下一步最值得关注什么?

一看触觉能否显著改善抓取层数、打滑和局部形变判断;二看外部团队提交的模型能否在统一平台稳定复现优势;三看恢复数据方法能否从折衣扩展到整理床铺、装袋、线缆操作等其他长时程柔性任务。

总结

这项工作用 2000 多小时真机数据、20 多项任务和 10 多种机器人,建立了一套面向长时程柔性物体操作的数据与评测框架。它不只看机器人是否完成任务,还同时评价最终质量和时间,并通过实体保留物体、统一初始化、统一执行协议与视频审计提高可比性。

最明确的实验结论是,加入人类接管与恢复轨迹后,平均成功率从 80.75% 提高到 95%,综合折衣分从 75.59 提高到 82.53。与此同时,直接混合跨任务、跨机器人数据会带来负迁移和遗忘,说明真实机器人经验要想规模化复用,必须先解决动作与形态的对齐。

它离“通用家务机器人”仍有距离,但把一个重要方向讲得很清楚:机器人真正的成熟,不是永远不犯错,而是能在物理世界里识别错误、从错误中恢复,并把这段恢复经验交给下一代模型。这样的闭环,比一次漂亮演示更难,也更有长期价值。

主要参考资料

本文为论文解读与个人学习笔记,不构成论文审核意见,也不对产品能力、安全性或商业可用性作保证。




上一篇:Libra有界序列池:长上下文LLM训练负载均衡吞吐提升2.54倍
下一篇:EJS 原型污染直通 RCE:6.0.0-alpha 以下均受影响
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-9 05:43 , Processed in 0.067148 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表