找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4578

积分

0

好友

592

主题
发表于 2 小时前 | 查看: 6| 回复: 0

本文聚焦 NVIDIA GR00T,拆解它作为人形机器人基础模型平台背后的模型、数据、仿真、评测与部署工具链。

这一篇就从 NVIDIA GR00T 讲起。

GR00T 常被归入人形机器人基础模型这一类。它背后其实是一整套开发链路:模型怎么理解视觉、语言和机器人状态;数据怎么从遥操作、仿真和人类视频里来;策略怎么在 Isaac Lab 里训练和评测;最后怎么通过 TensorRT、Isaac ROS、Jetson Thor 进入真实机器人。

GR00T人形机器人开发工具链总览架构图

图 1:GR00T 更像一条人形机器人开发链路,模型、数据、仿真、评测、部署和真机回流需要一起看。

了解 GR00T,关键是看清图 1 里的层次:模型、数据、仿真、评测、部署,最后回到真实机器人。

任务定义
    ↓
仿真环境与遥操作采集
    ↓
真实数据 + 合成数据 + 人类视频
    ↓
GR00T VLA 模型微调
    ↓
Isaac Lab / Isaac Lab-Arena 评测
    ↓
TensorRT / Isaac ROS / Jetson Thor 部署
    ↓
真实机器人执行与数据回流

01 GR00T 首先是一套机器人开发链路

NVIDIA 在 GTC 2024 提出 Project GR00T[2],定位是面向人形机器人的通用基础模型。

到 GR00T N1[3] 发布时,NVIDIA 已经开始同时讲模型、数据、仿真和合成数据。

再看 Isaac-GR00T GitHub[4] 里的 N1.7,开发者拿到的不只有 checkpoint,还有数据格式、训练脚本、评测接口、推理和部署路径。

表 1:GR00T 工具链的主要层级与对应组件。

层级 GR00T 里的对应组件 解决的问题
模型 GR00T N1 / N1.7 从视觉、语言、机器人状态生成动作
数据 真实机器人数据、人类视频、合成数据、LeRobot 格式 让模型获得可训练的具身经验
仿真 Isaac Sim、Isaac Lab、Isaac Lab-Arena 搭任务、采数据、训策略、做评测
合成数据 GR00T-Mimic、GR00T-Gen、Cosmos、Omniverse 用少量示范扩展轨迹和场景
部署 ONNX、TensorRT、Isaac ROS、Jetson Thor 让策略在真实机器人系统里运行

这也是 GR00T 和很多单篇 VLA 论文的差别。论文通常重点回答“模型怎么训”,GR00T 更关注一套人形机器人开发流程怎样落地。

02 GR00T N1 / N1.7:从视觉语言理解到动作生成

GR00T N1 论文[5]的核心思路是:

用视觉语言模型理解任务和环境,再用动作生成模块输出连续机器人动作。

它采用双系统结构

System 2 负责理解图像、语言指令和上下文;System 1 负责把理解结果变成动作。对应到架构上,如图 2 所示,就是 VLM / VLA 主干接上 Diffusion Transformer 动作头。

图像 / 视频观测 + 语言指令 + 机器人状态
        ↓
视觉语言主干:理解场景、目标和任务语义
        ↓
动作生成模块:生成连续动作轨迹
        ↓
机器人执行:末端位姿、关节、夹爪或全身动作

GR00T N1/N1.7双系统模型架构流程图

图 2:GR00T N1 / N1.7 的核心,是用视觉语言主干理解任务,再通过动作生成模块输出连续机器人动作。

GR00T N1.7[4] 是更适合开发者的版本。官方 GitHub 提供 3B base checkpoint,使用 Cosmos-Reason2-2B / Qwen3-VL 相关视觉语言主干,支持 LeRobot 数据格式,也提供训练、推理、评测和 ONNX / TensorRT 导出。

N1.7 的重点不只是更换模型主干,而是让 GR00T 从基础模型进一步变成可微调、可接入、可部署的机器人开发入口。

开发者需要定义自己的机器人本体、输入输出模态、数据格式和动作空间,再通过后训练把模型调到具体任务上。

这也意味着,GR00T 不是“拿来就能包打天下”的通用机器人。换机器人、换任务、换传感器,仍然要做数据适配、微调和安全验证

03 数据:真实、合成、人类视频为什么要一起用?

机器人基础模型真正稀缺的是动作经验。

一条可训练的机器人数据,通常要同时包含图像、机器人状态、动作轨迹、语言指令和任务结果。采一条这样的数据,比采一段文本或一张图片贵得多。

GR00T 的数据路线可以分成三类,如表 2 所示:

表 2:GR00T 三类数据来源的价值与限制。

数据来源 主要价值 主要限制
真实机器人数据 动作和物理反馈最可靠 采集慢、成本高、覆盖任务有限
合成数据 / 仿真数据 规模容易扩展,场景可控 需要处理 Sim-to-Real 差距
人类视频 规模大,包含丰富物体交互 没有直接机器人动作标签

真实数据用来校准物理动作,合成数据用来扩大任务和场景分布,人类视频提供大规模操作先验。图 3 可以把这三类来源看成三条汇入训练的数据流。

GR00T三类训练数据体系架构图

图 3:真实机器人数据、仿真合成数据和人类视频分别补足物理动作、场景分布和操作先验。

人类视频不能直接告诉机器人每个关节该转多少度,但它能提供“人在操作物体时怎么组织动作”的线索,比如靠近、抓起、放下、打开、推开、避让。

模型先从视频里学操作模式,再用机器人数据把这些模式映射到具体身体上。

04 合成数据:用少量示范扩展动作和场景

合成数据不是简单地在仿真里多跑几遍。

NVIDIA 的 Synthetic Manipulation Motion Generation for Robotics Blueprint[6] 把流程拆得更细:先从少量示范出发,生成更多机器人运动轨迹,再扩展场景、物体、材质、视角和背景,让训练数据覆盖更宽的分布。

少量人类示范 / 遥操作轨迹
        ↓
GR00T-Mimic:扩展动作轨迹
        ↓
GR00T-Gen:扩展场景和视觉变化
        ↓
Omniverse / Isaac Sim:提供物理和数字孪生环境
        ↓
Cosmos:提供世界生成和视觉多样化能力
        ↓
更多可用于训练的机器人数据

GR00T合成数据生成流程图

图 4:合成数据的作用,是从少量示范出发,扩展动作轨迹、场景变化和视觉分布。

这对人形机器人尤其重要。双臂操作、移动操作、全身平衡的采集成本都高,单靠真机很难覆盖足够多物体、桌面、光照、姿态和失败情况。

合成数据不能替代真实数据,但可以把稀缺的真机时间留给校准、验证和失败回流。

05 Isaac Lab:训练、评测和部署前验证

在 GR00T 链路里,Isaac 不只是画面很真实的仿真器。

Isaac Lab训练评测与部署前验证流程图

图 5:Isaac Lab 的价值不只是仿真画面,而是让策略在部署前经历训练、评测和验证。

如图 5 所示,Isaac Lab[7] 基于 Isaac Sim,面向机器人学习任务。它可以搭环境、定义观测和动作、做模仿学习或强化学习训练,也可以并行跑大量仿真任务。

Isaac Lab-Arena 更偏评测,让策略进入任务场景运行,看它能不能稳定完成任务。表 3 列出了 Isaac 在几个关键环节里的作用。

表 3:Isaac 在数据采集、策略训练和部署前评测中的作用。

环节 Isaac 相关能力
数据采集 通过遥操作或脚本生成任务轨迹
策略训练 为 imitation learning / post-training 提供环境
部署前评测 在真机前暴露失败模式和安全问题

机器人策略不能只看离线预测。open-loop 结果再像,也不等于策略真的能在环境里连续跑起来。仿真评测的价值,就是让策略先在可控环境中经历状态变化、遮挡、误差积累和失败恢复。

06 从遥操作到微调:机器人数据怎样变成训练样本?

机器人数据不能只是一段视频。

一条可训练的示范,通常要包含图像、状态、动作、语言指令、相机信息和 episode 元信息。否则模型很难知道“这一步动作对应哪个状态”。

从遥操作到LeRobot风格数据转换流程图

图 6:遥操作数据要变成可训练样本,需要同时记录图像、状态、动作、指令和 episode 元信息。

如图 6 所示,End-to-End Physical AI with Unitree G1[8] 这份官方工作流展示了比较完整的路径:在 Isaac Sim 中搭场景,用遥操作采集数据,把数据转成 LeRobot 风格格式,再进行 GR00T 微调、评测和部署。

仿真 / 真机遥操作
        ↓
记录图像、状态、动作、任务信息
        ↓
转换为 LeRobot 风格数据格式
        ↓
配置 modality.json
        ↓
GR00T fine-tuning / evaluation

数据标准化 很关键。机器人领域有很多数据集,但传感器、动作空间、控制频率、机器人本体都不同。没有统一格式,训练、评测和部署就会变成一堆临时脚本。

GR00T 支持 LeRobot 风格数据,是为了让数据处理、模型训练和评测部署尽量沿用同一套接口与工作流。

07 部署:从 checkpoint 到真实机器人

checkpoint 只是开始。

真实部署要处理推理延迟、动作频率、控制接口、通信中间件、安全约束、硬件算力和故障恢复。

GR00T checkpoint到真实机器人部署链路图

图 7:从 checkpoint 到真实机器人,中间还要经过推理加速、控制接口、边缘计算和安全约束。

Isaac-GR00T GitHub[4] 给出 ONNX / TensorRT 支持。沿着 NVIDIA 的平台路线看,对应到图 7,部署链路大致是:

GR00T policy
        ↓
ONNX / TensorRT 推理加速
        ↓
Isaac ROS / 控制接口
        ↓
Jetson Thor / 机器人计算平台
        ↓
机器人控制器与执行器

VLA 输出动作,不代表动作可以直接发给机器人。真实系统里还会有控制器、安全边界、速度限制、碰撞检测和急停机制。

这也是 NVIDIA 路线的特点:模型只是入口,后面接的是 GPU、Jetson、Isaac ROS、Isaac Sim、Omniverse 和 Cosmos 组成的平台。

08 GR00T 和 OpenVLA、Octo、LeRobot 的差异

对照 GR00T 和几条开源路线,定位会更清楚,具体可以看表 4。

表 4:GR00T 与 OpenVLA、Octo、LeRobot 的定位对比。

路线 定位 重点
OpenVLA[9] 开源 VLA 基座 视觉语言模型如何输出机器人动作
Octo[10] 通用机器人策略模型 多机器人、多任务策略泛化
LeRobot[11] 开源机器人学习工具链 数据集、训练、硬件接入和复现
GR00T[4] 人形机器人基础模型平台 模型、数据、仿真、合成数据、部署一起打通

GR00T 的特殊之处,在于它天然绑定 NVIDIA 的平台能力。模型是入口,后面接着数据生成、Isaac 仿真、Cosmos 世界模型、TensorRT 推理和 Jetson 部署。

研究者可能更关心它的 VLA 架构、训练数据和跨本体泛化。开发者更关心有没有一条能复现、能微调、能评测、能部署的完整路径

09 GR00T 指向的是一条完整开发路线

拆开 GR00T,会看到一条很清楚的链路:

基础模型理解视觉、语言和状态
           ↓
真实数据与合成数据一起补足动作经验
           ↓
Isaac 负责训练、评测和部署前验证
           ↓
TensorRT / Isaac ROS / Jetson 把策略送进真机
           ↓
真实失败数据再回到下一轮训练

这条路线不是唯一答案。真实机器人落地仍然要面对硬件差异、长任务鲁棒性、接触控制、安全边界和数据质量。

但它说明了一件事:人形机器人基础模型的竞争,已经不只发生在模型参数和 demo 视频里,也发生在数据、仿真、评测、部署和硬件平台的连接方式里。


参考链接

  1. 从零走向AGI 项目: https://ai-mzq.github.io/From-Zero-to-AGI/
  2. Project GR00T: https://nvidianews.nvidia.com/news/foundation-model-isaac-robotics-platform
  3. GR00T N1: https://developer.nvidia.com/blog/accelerate-generalist-humanoid-robot-development-with-nvidia-isaac-gr00t-n1/
  4. Isaac-GR00T GitHub: https://github.com/NVIDIA/Isaac-GR00T
  5. GR00T N1 论文: https://huggingface.co/papers/2503.14734
  6. Synthetic Manipulation Motion Generation for Robotics Blueprint: https://build.nvidia.com/nvidia/isaac-gr00t-synthetic-manipulation/blueprintcard
  7. Isaac Lab: https://docs.isaacsim.omniverse.nvidia.com/latest/isaac_lab_tutorials/index.html
  8. End-to-End Physical AI with Unitree G1: https://docs.nvidia.com/learning/physical-ai/gr00t-e2e-workflow/latest/index.html
  9. OpenVLA: https://github.com/openvla/openvla
  10. Octo: https://octo-models.github.io/
  11. LeRobot: https://huggingface.co/docs/lerobot/main/index
  12. NVIDIA Isaac GR00T 官方页面: https://developer.nvidia.com/isaac/gr00t
  13. Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T: https://developer.nvidia.com/blog/develop-humanoid-robot-policies-end-to-end-with-nvidia-isaac-gr00t/

这条从模型、数据、仿真到部署的完整路径,也是云栈社区读者在探讨具身智能落地时最常碰到的技术主线。




上一篇:具身智能核心概念拆解:VLM、VLA、世界模型怎么串起机器人进化链
下一篇:27B本地Agent模型后训练拆解:如何在Qwen3.6上练出MCP第二?
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-12 04:57 , Processed in 0.441974 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表