本文聚焦 NVIDIA GR00T,拆解它作为人形机器人基础模型平台背后的模型、数据、仿真、评测与部署工具链。
这一篇就从 NVIDIA GR00T 讲起。
GR00T 常被归入人形机器人基础模型这一类。它背后其实是一整套开发链路:模型怎么理解视觉、语言和机器人状态;数据怎么从遥操作、仿真和人类视频里来;策略怎么在 Isaac Lab 里训练和评测;最后怎么通过 TensorRT、Isaac ROS、Jetson Thor 进入真实机器人。

图 1:GR00T 更像一条人形机器人开发链路,模型、数据、仿真、评测、部署和真机回流需要一起看。
了解 GR00T,关键是看清图 1 里的层次:模型、数据、仿真、评测、部署,最后回到真实机器人。
任务定义
↓
仿真环境与遥操作采集
↓
真实数据 + 合成数据 + 人类视频
↓
GR00T VLA 模型微调
↓
Isaac Lab / Isaac Lab-Arena 评测
↓
TensorRT / Isaac ROS / Jetson Thor 部署
↓
真实机器人执行与数据回流
01 GR00T 首先是一套机器人开发链路
NVIDIA 在 GTC 2024 提出 Project GR00T[2],定位是面向人形机器人的通用基础模型。
到 GR00T N1[3] 发布时,NVIDIA 已经开始同时讲模型、数据、仿真和合成数据。
再看 Isaac-GR00T GitHub[4] 里的 N1.7,开发者拿到的不只有 checkpoint,还有数据格式、训练脚本、评测接口、推理和部署路径。
表 1:GR00T 工具链的主要层级与对应组件。
| 层级 |
GR00T 里的对应组件 |
解决的问题 |
| 模型 |
GR00T N1 / N1.7 |
从视觉、语言、机器人状态生成动作 |
| 数据 |
真实机器人数据、人类视频、合成数据、LeRobot 格式 |
让模型获得可训练的具身经验 |
| 仿真 |
Isaac Sim、Isaac Lab、Isaac Lab-Arena |
搭任务、采数据、训策略、做评测 |
| 合成数据 |
GR00T-Mimic、GR00T-Gen、Cosmos、Omniverse |
用少量示范扩展轨迹和场景 |
| 部署 |
ONNX、TensorRT、Isaac ROS、Jetson Thor |
让策略在真实机器人系统里运行 |
这也是 GR00T 和很多单篇 VLA 论文的差别。论文通常重点回答“模型怎么训”,GR00T 更关注一套人形机器人开发流程怎样落地。
02 GR00T N1 / N1.7:从视觉语言理解到动作生成
GR00T N1 论文[5]的核心思路是:
用视觉语言模型理解任务和环境,再用动作生成模块输出连续机器人动作。
它采用双系统结构。
System 2 负责理解图像、语言指令和上下文;System 1 负责把理解结果变成动作。对应到架构上,如图 2 所示,就是 VLM / VLA 主干接上 Diffusion Transformer 动作头。
图像 / 视频观测 + 语言指令 + 机器人状态
↓
视觉语言主干:理解场景、目标和任务语义
↓
动作生成模块:生成连续动作轨迹
↓
机器人执行:末端位姿、关节、夹爪或全身动作

图 2:GR00T N1 / N1.7 的核心,是用视觉语言主干理解任务,再通过动作生成模块输出连续机器人动作。
GR00T N1.7[4] 是更适合开发者的版本。官方 GitHub 提供 3B base checkpoint,使用 Cosmos-Reason2-2B / Qwen3-VL 相关视觉语言主干,支持 LeRobot 数据格式,也提供训练、推理、评测和 ONNX / TensorRT 导出。
N1.7 的重点不只是更换模型主干,而是让 GR00T 从基础模型进一步变成可微调、可接入、可部署的机器人开发入口。
开发者需要定义自己的机器人本体、输入输出模态、数据格式和动作空间,再通过后训练把模型调到具体任务上。
这也意味着,GR00T 不是“拿来就能包打天下”的通用机器人。换机器人、换任务、换传感器,仍然要做数据适配、微调和安全验证。
03 数据:真实、合成、人类视频为什么要一起用?
机器人基础模型真正稀缺的是动作经验。
一条可训练的机器人数据,通常要同时包含图像、机器人状态、动作轨迹、语言指令和任务结果。采一条这样的数据,比采一段文本或一张图片贵得多。
GR00T 的数据路线可以分成三类,如表 2 所示:
表 2:GR00T 三类数据来源的价值与限制。
| 数据来源 |
主要价值 |
主要限制 |
| 真实机器人数据 |
动作和物理反馈最可靠 |
采集慢、成本高、覆盖任务有限 |
| 合成数据 / 仿真数据 |
规模容易扩展,场景可控 |
需要处理 Sim-to-Real 差距 |
| 人类视频 |
规模大,包含丰富物体交互 |
没有直接机器人动作标签 |
真实数据用来校准物理动作,合成数据用来扩大任务和场景分布,人类视频提供大规模操作先验。图 3 可以把这三类来源看成三条汇入训练的数据流。

图 3:真实机器人数据、仿真合成数据和人类视频分别补足物理动作、场景分布和操作先验。
人类视频不能直接告诉机器人每个关节该转多少度,但它能提供“人在操作物体时怎么组织动作”的线索,比如靠近、抓起、放下、打开、推开、避让。
模型先从视频里学操作模式,再用机器人数据把这些模式映射到具体身体上。
04 合成数据:用少量示范扩展动作和场景
合成数据不是简单地在仿真里多跑几遍。
NVIDIA 的 Synthetic Manipulation Motion Generation for Robotics Blueprint[6] 把流程拆得更细:先从少量示范出发,生成更多机器人运动轨迹,再扩展场景、物体、材质、视角和背景,让训练数据覆盖更宽的分布。
少量人类示范 / 遥操作轨迹
↓
GR00T-Mimic:扩展动作轨迹
↓
GR00T-Gen:扩展场景和视觉变化
↓
Omniverse / Isaac Sim:提供物理和数字孪生环境
↓
Cosmos:提供世界生成和视觉多样化能力
↓
更多可用于训练的机器人数据

图 4:合成数据的作用,是从少量示范出发,扩展动作轨迹、场景变化和视觉分布。
这对人形机器人尤其重要。双臂操作、移动操作、全身平衡的采集成本都高,单靠真机很难覆盖足够多物体、桌面、光照、姿态和失败情况。
合成数据不能替代真实数据,但可以把稀缺的真机时间留给校准、验证和失败回流。
05 Isaac Lab:训练、评测和部署前验证
在 GR00T 链路里,Isaac 不只是画面很真实的仿真器。

图 5:Isaac Lab 的价值不只是仿真画面,而是让策略在部署前经历训练、评测和验证。
如图 5 所示,Isaac Lab[7] 基于 Isaac Sim,面向机器人学习任务。它可以搭环境、定义观测和动作、做模仿学习或强化学习训练,也可以并行跑大量仿真任务。
Isaac Lab-Arena 更偏评测,让策略进入任务场景运行,看它能不能稳定完成任务。表 3 列出了 Isaac 在几个关键环节里的作用。
表 3:Isaac 在数据采集、策略训练和部署前评测中的作用。
| 环节 |
Isaac 相关能力 |
| 数据采集 |
通过遥操作或脚本生成任务轨迹 |
| 策略训练 |
为 imitation learning / post-training 提供环境 |
| 部署前评测 |
在真机前暴露失败模式和安全问题 |
机器人策略不能只看离线预测。open-loop 结果再像,也不等于策略真的能在环境里连续跑起来。仿真评测的价值,就是让策略先在可控环境中经历状态变化、遮挡、误差积累和失败恢复。
06 从遥操作到微调:机器人数据怎样变成训练样本?
机器人数据不能只是一段视频。
一条可训练的示范,通常要包含图像、状态、动作、语言指令、相机信息和 episode 元信息。否则模型很难知道“这一步动作对应哪个状态”。

图 6:遥操作数据要变成可训练样本,需要同时记录图像、状态、动作、指令和 episode 元信息。
如图 6 所示,End-to-End Physical AI with Unitree G1[8] 这份官方工作流展示了比较完整的路径:在 Isaac Sim 中搭场景,用遥操作采集数据,把数据转成 LeRobot 风格格式,再进行 GR00T 微调、评测和部署。
仿真 / 真机遥操作
↓
记录图像、状态、动作、任务信息
↓
转换为 LeRobot 风格数据格式
↓
配置 modality.json
↓
GR00T fine-tuning / evaluation
数据标准化 很关键。机器人领域有很多数据集,但传感器、动作空间、控制频率、机器人本体都不同。没有统一格式,训练、评测和部署就会变成一堆临时脚本。
GR00T 支持 LeRobot 风格数据,是为了让数据处理、模型训练和评测部署尽量沿用同一套接口与工作流。
07 部署:从 checkpoint 到真实机器人
checkpoint 只是开始。
真实部署要处理推理延迟、动作频率、控制接口、通信中间件、安全约束、硬件算力和故障恢复。

图 7:从 checkpoint 到真实机器人,中间还要经过推理加速、控制接口、边缘计算和安全约束。
Isaac-GR00T GitHub[4] 给出 ONNX / TensorRT 支持。沿着 NVIDIA 的平台路线看,对应到图 7,部署链路大致是:
GR00T policy
↓
ONNX / TensorRT 推理加速
↓
Isaac ROS / 控制接口
↓
Jetson Thor / 机器人计算平台
↓
机器人控制器与执行器
VLA 输出动作,不代表动作可以直接发给机器人。真实系统里还会有控制器、安全边界、速度限制、碰撞检测和急停机制。
这也是 NVIDIA 路线的特点:模型只是入口,后面接的是 GPU、Jetson、Isaac ROS、Isaac Sim、Omniverse 和 Cosmos 组成的平台。
08 GR00T 和 OpenVLA、Octo、LeRobot 的差异
对照 GR00T 和几条开源路线,定位会更清楚,具体可以看表 4。
表 4:GR00T 与 OpenVLA、Octo、LeRobot 的定位对比。
| 路线 |
定位 |
重点 |
| OpenVLA[9] |
开源 VLA 基座 |
视觉语言模型如何输出机器人动作 |
| Octo[10] |
通用机器人策略模型 |
多机器人、多任务策略泛化 |
| LeRobot[11] |
开源机器人学习工具链 |
数据集、训练、硬件接入和复现 |
| GR00T[4] |
人形机器人基础模型平台 |
模型、数据、仿真、合成数据、部署一起打通 |
GR00T 的特殊之处,在于它天然绑定 NVIDIA 的平台能力。模型是入口,后面接着数据生成、Isaac 仿真、Cosmos 世界模型、TensorRT 推理和 Jetson 部署。
研究者可能更关心它的 VLA 架构、训练数据和跨本体泛化。开发者更关心有没有一条能复现、能微调、能评测、能部署的完整路径。
09 GR00T 指向的是一条完整开发路线
拆开 GR00T,会看到一条很清楚的链路:
基础模型理解视觉、语言和状态
↓
真实数据与合成数据一起补足动作经验
↓
Isaac 负责训练、评测和部署前验证
↓
TensorRT / Isaac ROS / Jetson 把策略送进真机
↓
真实失败数据再回到下一轮训练
这条路线不是唯一答案。真实机器人落地仍然要面对硬件差异、长任务鲁棒性、接触控制、安全边界和数据质量。
但它说明了一件事:人形机器人基础模型的竞争,已经不只发生在模型参数和 demo 视频里,也发生在数据、仿真、评测、部署和硬件平台的连接方式里。
参考链接
- 从零走向AGI 项目: https://ai-mzq.github.io/From-Zero-to-AGI/
- Project GR00T: https://nvidianews.nvidia.com/news/foundation-model-isaac-robotics-platform
- GR00T N1: https://developer.nvidia.com/blog/accelerate-generalist-humanoid-robot-development-with-nvidia-isaac-gr00t-n1/
- Isaac-GR00T GitHub: https://github.com/NVIDIA/Isaac-GR00T
- GR00T N1 论文: https://huggingface.co/papers/2503.14734
- Synthetic Manipulation Motion Generation for Robotics Blueprint: https://build.nvidia.com/nvidia/isaac-gr00t-synthetic-manipulation/blueprintcard
- Isaac Lab: https://docs.isaacsim.omniverse.nvidia.com/latest/isaac_lab_tutorials/index.html
- End-to-End Physical AI with Unitree G1: https://docs.nvidia.com/learning/physical-ai/gr00t-e2e-workflow/latest/index.html
- OpenVLA: https://github.com/openvla/openvla
- Octo: https://octo-models.github.io/
- LeRobot: https://huggingface.co/docs/lerobot/main/index
- NVIDIA Isaac GR00T 官方页面: https://developer.nvidia.com/isaac/gr00t
- Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T: https://developer.nvidia.com/blog/develop-humanoid-robot-policies-end-to-end-with-nvidia-isaac-gr00t/
这条从模型、数据、仿真到部署的完整路径,也是云栈社区读者在探讨具身智能落地时最常碰到的技术主线。