找回密码
立即注册
搜索
发回帖 发新帖

5055

积分

0

好友

649

主题
发表于 2 小时前 | 查看: 9| 回复: 0

机械臂在 RoboChallenge 真机测试场景中

两项任务成功率达 100%。

VLA 一直是具身智能领域主流的技术路线之一。 它的逻辑是:给模型输入图像、语言指令,再利用大规模机器人示范数据训练模型直接预测动作。随着机器人数据规模的扩大,VLA 可以完成抓取、整理等复杂的真实操作任务。

同时,通用大模型在多模态理解、空间推理和复杂任务规划方面的能力也在持续提升,一个新的问题随之出现:如果利用它这些已有能力,不用 VLA 模型,能不能参与并完成机器人的真实操作?

近日,原力灵机做了一次这样的实验。该团队将 GPT-6 Astra 接入真机评测平台 RoboChallenge Table30 V2,在 Aloha、DOS-W1、ARX5 和 UR5 四种机器人本体上分别测试四项真实操作任务。从最终结果来看,四项任务中,GPT-6 Astra 有两项成功率达到 100%。

在真实执行的过程中,通用大模型不只是单纯地“输出动作”,而是会试探环境、理解操作结果、发现异常并修正。

机器人操作循环流程:观察、执行、检查、调整

01. 从屏幕走向真机,原力灵机搭建真实评测闭环

要验证通用大模型能不能真正参与机器人操作,光看模型在视觉理解、空间推理等 Benchmark 上的成绩还不够。

机器人一旦进入真实环境,面对的不只是“看懂一张图”“规划一个任务”。相机视角会变,目标可能被遮挡,抓取可能失败。所以,模型不仅要知道下一步该如何做,还要根据真实执行结果不断重新判断当前状态。

因此,原力灵机团队选择直接上真机测试。

此次测试使用的是 RoboChallenge 中的 Table30 V2 真机 Benchmark。RoboChallenge 由原力灵机联合 Hugging Face 发起,希望通过统一的真实机器人环境,对不同模型的操作能力进行测试。

Table30 V2 共包含 30 个真实世界操作任务,覆盖双臂 DOS-W1、Aloha 和单臂 ARX5、UR5 四种机型,涉及物体整理、装箱、工具使用和双臂协作等任务。

与仿真环境测试不同,RoboChallenge 让参评模型直接连接真实机器人。测试中,平台通过远程 API 与用户部署的模型推理服务交互,模型持续获取机器人图像和状态,生成动作并下发执行。

一次动作执行结束后,模型还会重新获取机器人图像和状态,并据此决定下一步如何操作。这样,模型面对的不是固定的输入,而是一个会因为自身动作不断变化的真实物理环境。

该团队在四种机器人本体上各选择了一项任务。其中 Aloha 完成“盖章定位”,需要一只机械臂固定纸张,另一只机械臂拿起印章、蘸取印泥并完成盖章;DOS-W1 执行“叠碗”,按顺序将不同颜色的碗套叠起来。

ARX5 完成“寻找绿块”,需要从场景中找到两个绿色方块,并依次放入指定篮子;UR5 则操作“碎纸”,抓取纸张并送入碎纸机完成碎纸。四项任务分别涉及双臂协作、物体关系判断、目标搜索和工具使用等不同操作能力。

RoboChallenge Table30 V2 四项真机任务描述

每项任务进行 10 次真机 Rollout,按照平台记录的状态和步骤分,统计最终成功率与得分。

02. 四项真机测试,两项任务成功率达 100%

四项任务中,GPT-6 Astra 在“叠碗”和“寻找绿块”任务中的成功率均达到 100%,“盖章定位”和“碎纸”任务成功率分别为 80%、70%。

在 RoboChallenge Table30 V2 公开运行记录中,后两个任务的最高成功率均为 50%,而 GPT-6 Astra 在这两项任务上的成功率分别高出 30% 和 20%。

GPT-6 Astra 四项任务成功率与公开记录对比

不过,成功率并不等于执行过程更优。GPT-6 Astra 在“叠碗”“寻找绿块”和“碎纸”上的得分均低于对应公开最高分。例如碎纸任务中,机器人虽然最终完成任务,但部分执行曾误夹起支架并因此被扣分;叠碗过程中也出现过多次重试。

当然,这也反映出 GPT-6 Astra 并不是“一次做对”,而是依靠持续观察和调整,把已经出现偏差的任务继续做完。

03. 不只执行动作,GPT-6 Astra 还会根据结果动态调整

首先,GPT-6 Astra 会通过实际动作不断补全对空间关系的理解。

在 UR5 碎纸任务中,该团队并没有向 GPT-6 Astra 提供显式的相机标定信息。模型一开始并不知道机械臂沿某个方向移动后,在不同相机画面中会产生怎样的变化。

实际执行时,Astra 会先做几个小幅试探动作,再对比动作前后的图像变化,逐步判断机械臂的运动方向,以及夹爪与目标之间的相对位置。也就是说,它不是依赖预先给定的空间映射,而是在操作过程中,通过“动作—观察—再判断”建立局部的视觉与运动对应关系。

UR5 碎纸任务中机械臂沿 -Y 方向试探并确认运动方向

除了补全空间关系,Astra 也会根据场景变化调整原来的操作顺序。

在“寻找绿块”任务中,当绿色目标受到其他方块遮挡时,模型不会持续重复原来的抓取动作,而是先处理遮挡物。测试中,Astra 会先夹走紫方块,等第二个绿色方块暴露后,再调整夹爪位置,重新接近目标。

ARX5 寻找绿块关键帧:先推开紫色方块再抓取绿块

当动作本身出现偏差时,模型还会根据新的结果进行调整。

同样是在“寻找绿块”任务中,Astra 一次抬起夹爪后发现绿色方块仍留在桌面,说明此前抓取并未成功。随后,模型重新张开夹爪、降低抓取位置并再次对准,直到确认方块已经离开桌面,再将其放入篮中。

UR5 碎纸任务中也出现了类似情况。由于缺少侧面视角,机器人有时会把纸张下方的支架一起夹起。Astra 在重新观察画面后识别出这一偏差,随后放下支架、重新调整位置,再次抓取纸张。

UR5 碎纸任务中误夹纸架后的修正过程

在双臂任务中,Astra 还会借助参考信息组织多步骤动作,同时处理示例之外的变化。

原力灵机团队发现,在完全不提供示例的情况下,双臂任务对 Astra 较为困难,因此在“盖章”和“叠碗”任务中加入了 RoboChallenge 提供的参考轨迹作为上下文。

这些参考轨迹主要帮助模型理解两只机械臂如何分工、什么时候交替操作。但真实执行中仍会出现参考轨迹之外的情况。例如盖章过程中,印章可能意外脱离夹爪,Astra 需要重新抓取;叠碗时,模型也需要在保留已有堆叠结果的情况下,重新尝试后续操作。

Aloha 盖章定位任务中双臂协作操作步骤

DOS-W1 叠碗任务中双臂嵌套放置碗的操作步骤

参考轨迹更像是在给模型一个任务组织框架,面对实际执行中的新情况,Astra 仍然需要根据当前状态继续调整。

综合来看,GPT-6 Astra 此次在真机上的特点主要体现在可持续判断当前状态,并根据执行结果调整下一步。

相比 VLA 模型,这次测试中的通用大模型更多承担了任务理解、状态判断和异常处理的角色。不过,在操作效率、稳定性和动作精度上,它仍有明显提升空间。

04. 结语:通用大模型正在降低机器人智能的门槛

过去,机器人要获得复杂任务理解和决策能力,往往需要围绕特定本体、特定任务持续积累数据并训练策略。通用大模型的发展,则提供了另一种路径:部分更高层的理解和决策能力,可以直接从通用模型中获得。

这意味着,具身智能系统不必从零开始构建所有能力。随着通用模型能力继续增强,机器人模型可以把更多精力放在精确控制、稳定执行和效率优化上。

对行业来说,这可能会降低机器人获得更高阶智能能力的门槛,也让更多本体和应用能够站在通用模型提供的基础能力之上继续开发。

原力灵机这次测试提供了一个真机层面的验证:通用大模型正在从“会理解”进一步走向“能参与操作”,具身智能的技术边界也有了新的拓展空间。




上一篇:日本显卡销量榜:RTX 3050登顶,GT 1030凭啥排第二?
下一篇:5种Agent Skill设计模式:让输出稳定可控
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-10 10:45 , Processed in 0.061250 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表