找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4617

积分

0

好友

605

主题
发表于 昨天 14:07 | 查看: 14| 回复: 0

本文聚焦于具身智能方向 6 篇值得精读的综述论文,从 VLA、VLN、具身导航、世界模型到 World Action Model,帮助读者快速看清具身智能的几条核心技术线。

具身智能6篇综述阅读地图:总框架、VLA、VLN、具身导航、世界模型、WAM

图 1:具身智能 6 篇综述阅读地图

——注:本文部分配图由 AI 制作,仅供参考

猫先生这次汇总的 6 篇综述,将放到同一张技术地图里,重点回答以下几个问题:

· 什么是大模型驱动的具身智能?

· VLA 为什么变成机器人基础模型的中心词?

· 机器人如何根据语言在空间里走?

· 具身导航为什么不只是传统路径规划?

· 世界模型为什么不只是生成未来视频?

· WAM 为什么开始把"未来"和"动作"放在一起建模?

01 大模型赋能具身智能:先看清总框架

论文标题:Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning[2]

发布时间:2025 年

核心问题:大模型进入具身智能后,到底改变了哪些环节?

一句话理解:大模型进入具身智能,不只是让机器人听懂语言,而是把感知、决策、行动和学习重新放进同一套系统里。

大模型赋能具身智能的总体框架:人类学习与机器人学习范式对比

图 2:大模型赋能具身智能的总体框架。它把具身智能放到决策、行动和学习的系统视角里,而不是只看某一个模型模块。

这篇综述没有直接从某个 VLA 架构切入,也没有只讨论机器人控制,而是先回答一个更大的问题:大模型到底怎样进入物理世界?

它的总体脉络可以分成三层。

第一层是具身智能系统本身

智能体不是只回答问题,而是要在环境中感知、交互、决策、行动,并通过经验继续学习。大模型的作用,也不只是让机器人"听懂人话",而是进入任务理解、规划、执行反馈和学习过程。

第二层是决策范式

这里可以重点看层级式和端到端两条路线。

层级式路线里,大模型负责高层理解和任务拆解,低层策略或控制器负责真实执行。它更容易解释,也更方便插入安全约束,但系统接口更复杂。

端到端路线里,模型直接从视觉、语言和机器人状态映射到动作。VLA 就是这条路线的代表方向。它形式上更统一,但对数据、实时性和真实环境稳定性的要求也更高。

第三层是具身学习

机器人不是读网页长大的,它需要通过示范、交互、失败和纠正来学习。模仿学习、强化学习、反馈增强、真实数据回流、世界模型,都可以放到这条线里理解。

这篇综述最大的价值,是先帮读者建立一个判断:

具身智能不是一个模型,而是感知、决策、行动、学习和反馈组合出来的一套系统。

02 VLA:把视觉、语言和动作接到一起

论文标题:A Survey on Vision-Language-Action Models for Embodied AI[3]

发布时间:2024 年

核心问题:VLA 如何从视觉、语言和机器人状态中生成可执行动作?

一句话理解:这篇综述把 VLA 拆成模型组件、动作表示、训练数据、仿真评测和真实部署几个层面,解释机器人基础模型为什么会围绕"动作输出"展开。

VLA模型整体框架:视觉编码器、语言编码器与动作解码器协同流程

图 3:VLA 模型的整体框架。重点看视觉、语言和机器人状态如何进入策略模型,并最终转成动作输出。

大模型进入具身智能,最终还是要给机器人一串动作。这里的动作可以是离散动作 token,也可以是连续控制量、末端执行器轨迹,或者一小段 action chunk。

VLA 的基本流程大致如下:

视觉观测 + 语言指令 + 机器人状态 / 历史轨迹
        ↓
多模态主干 / 策略模型
        ↓
动作表示与动作头
        ↓
机器人执行与环境反馈

这篇综述的第一层,是模型组件

一个典型 VLA 系统通常会包含视觉编码器、语言或多模态主干、机器人状态输入、动作表示模块和策略输出头。RT-2[4]、OpenVLA[5]、π0[6] 这些工作看起来名字很多,本质上都绕不开这几个位置:图像怎么进来,语言怎么对齐,状态怎么注入,动作怎么输出。

第二层,是动作表示

RT-2[4] 这类路线会把动作离散化成 token,让机器人动作进入语言模型的生成框架;OpenVLA[5] 更强调开源 VLA 策略模型,把视觉语言能力接到机器人控制上;π0[6] 这类模型则更强调连续动作生成,常和 diffusion、flow matching、action chunk 等机制放在一起讨论。

动作 token 的好处是容易和语言模型统一,问题是量化精度、控制频率和真实执行稳定性会变成瓶颈。连续动作更贴近控制,但训练数据、时序建模和跨机器人泛化更难。

第三层,是数据和评测

VLA 不只依赖互联网图文数据,还需要机器人轨迹、遥操作数据、仿真数据、失败样本和真实环境回流。模型能不能泛化,也不能只看离线指标,还要看跨任务、跨场景、跨机器人本体时能否稳定执行。

这篇综述把 VLA 路线里的几个关键变量整理得比较清楚:

变量 需要关注什么
输入 图像、语言、机器人状态、历史观测
主干 VLM / LLM / 多模态策略模型
输出 动作 token、连续控制、轨迹、action chunk
数据 机器人轨迹、互联网视觉语言数据、仿真数据、真实回流
评测 任务成功率、实时性、跨本体泛化、安全性、长任务稳定性

VLA 讨论的正是这个转换过程:

把看见的场景、听到的指令和机器人的身体状态,转成下一步可以执行的动作。

03 VLN:听懂路线,也要走对路

论文标题:Vision-and-Language Navigation Today and Tomorrow[7]

发布时间:2024 年

核心问题:智能体如何根据自然语言路线指令,在陌生环境里持续定位、选择路径,并最终到达目标位置?

一句话理解:VLN 把语言指令、视觉地标、空间记忆和导航决策放在同一个任务里,考验的是智能体能不能一边看环境,一边按路线行动。

视觉语言导航方法分类框架与指令执行流程

图 4:视觉语言导航任务流程。VLN 的关键,是把自然语言路线、第一视角观测、空间记忆和导航决策持续对齐。

VLA 讨论的是动作输出。到了 VLN,动作被放进更长的空间过程里:

现在该往哪里走,走到哪里转弯,什么时候停下来。

VLN 的经典设定是:智能体拿到一段自然语言指令,比如"上楼,穿过正前方的拱门,经过钢琴。当走廊尽头是画作和桌子时,向右转。在挂在墙上的麋鹿鹿角旁等待。"然后在第一视角环境中移动,最终到达正确位置。

这类任务的难点主要有四类。

第一类是语言和视觉地标对齐

指令里的"拱门""钢琴""画作""桌子""麋鹿鹿角",需要对应到当前视野或历史视野里的具体物体。很多时候,目标物体不会一直出现在画面里,模型要靠上下文判断下一步该找什么。

第二类是空间记忆

智能体不能只看当前画面。它要记住刚才经过了哪里,哪些岔路已经走过,当前位置和目标之间大概是什么关系。没有记忆,路线指令会被拆成一堆孤立动作。

第三类是指令执行顺序

"上楼""穿过""经过""右转""等待"不是同一种动作。VLN 要把这些语言片段转成一段连续导航过程,并且保持先后顺序不乱。

第四类是中途纠错

陌生环境里经常会遇到遮挡、视角变化、地标缺失或路径选择错误。模型需要根据新的观测重新判断,而不是沿着一开始的路线机械执行。

这篇综述主要梳理四个层面。

第一层是任务定义和数据集。VLN 通常和语言路线指令绑定,经典工作 Room-to-Room[8] 是这个方向的重要起点。

第二层是语言 grounding。模型要把自然语言里的地标、方向和动作短语,落到环境中的视觉对象和空间位置上。

第三层是空间记忆与规划推理。智能体需要把当前观测、历史轨迹、已探索区域和目标位置放到一起判断。

第四层是基础模型带来的变化。过去 VLN 更多依赖专门训练的导航模型,现在 VLM、LLM、VLA 都开始进入这个任务,高层语言推理和低层导航策略之间的边界也在变模糊。

VLN 最核心的一点,是把语言路线、视觉观察、历史轨迹和空间行动接起来。

04 具身导航:基础模型如何进入导航系统

论文标题:Foundation Models for Embodied Navigation: A Survey[9]

发布时间:2026 年(项目页持续维护)

核心问题:基础模型如何改变具身导航里的感知、记忆、决策、控制、部署和评测?

一句话理解:这篇综述把具身导航从单一语言路线任务扩展到更完整的导航系统,重点看基础模型如何进入不同任务、不同机器人本体和不同环境。

具身导航基础模型分类框架:多模态感知、基础模型与通用部署评估

图 5:具身导航基础模型的分类框架。它把导航问题拆到任务类型、机器人本体、观察方式、记忆机制、决策方式、部署效率和评测标准等维度。

VLN 是语言导航的一条典型任务线。具身导航的范围更宽:去某个坐标点、找到某个物体、按照语言路线移动、在人群中保持合适距离、边移动边完成交互任务,都可以放进这个问题里。

这篇综述最值得看的,是它给出的几个系统维度。

维度 重点问题
任务类型 点目标导航、对象导航、语言导航、社交导航、交互式导航
机器人本体 轮式机器人、四足机器人、无人机、人形机器人
观察方式 RGB、深度、语义地图、历史轨迹、多传感器融合
记忆机制 短期历史、长期地图、语义记忆
决策方式 高层规划、低层控制、端到端策略、双系统架构
部署效率 实时性、端侧运行、能耗、延迟
评测方式 成功率、路径效率、碰撞、泛化、真实迁移

同样是"去厨房找杯子",不同机器人面对的导航问题并不一样。

轮式机器人地面约束强,路径规划稳定,但上下楼和复杂地形受限;四足机器人能适应更多地形,但步态和稳定性更复杂;无人机空间自由度高,但避障、定位和能耗压力更大;人形机器人可以进入人类空间,但平衡、全身控制和安全要求更高。

基础模型进入导航系统后,变化主要发生在几个位置。

在感知层,VLM 可以把第一视角图像、语义对象、场景关系组织成更可用的环境理解。

在记忆层,模型需要维护短期历史、长期地图和语义记忆,避免每一步都像第一次进入这个环境。

在决策层,LLM / VLM 可以参与高层规划,低层控制器或专门策略负责可执行动作。这样做的好处是任务理解更灵活,代价是系统接口、实时性和错误传递会更复杂。

导航不只是根据语言路线走到终点,还要面对跨任务、跨本体、跨场景和真实部署的问题。

05 世界模型:在行动前预测后果

论文标题:A Comprehensive Survey on World Models for Embodied AI[10]

发布时间:2025 年

核心问题:世界模型如何帮助具身智能体预测环境变化,并把预测结果用于规划和控制?

一句话理解:这篇综述把世界模型放回具身智能系统里,重点讨论模型如何从当前状态和候选动作出发,推演未来状态、风险和可执行路径。

具身智能世界模型分类框架:核心概念、决策耦合与空间表示

图 6:具身智能世界模型的综述框架。世界模型的重点不是只生成未来画面,而是预测动作之后的状态变化,并服务规划和控制。

看完 VLA 和 VLN,你大概能理解机器人如何把语言和视觉变成行动。但真实世界里,光会行动还不够。

机器人还要提前判断:

· 这个动作做下去,会不会撞;

· 杯子会不会滑;

· 推箱子会不会卡住;

· 绕开一个人后,会不会走进另一个风险区域。

世界模型处理的就是这类"行动之后会发生什么"的问题。

它的基本输入通常包括当前观测、环境状态、历史轨迹和候选动作;输出则可能是未来图像、未来状态、空间变化、风险估计,或者给规划器使用的中间表示。

放到具身智能系统里,世界模型更像一个内部模拟器:

当前状态 + 候选动作
        ↓
世界模型预测
        ↓
未来状态 / 风险 / 任务进展
        ↓
规划器选择更合适的动作

这篇综述主要从几个维度整理相关工作。

第一类是和决策的关系

Decision-coupled world model 直接服务决策和控制,模型预测的结果会影响下一步动作。General-purpose world model 更偏通用环境建模,可以用于生成、仿真、数据扩展和下游任务。

第二类是时间建模方式

Sequential rollout 会一步一步预测未来状态,适合表达连续演化,但误差容易随时间累积。Global difference prediction 更关注当前状态到未来状态的整体变化,形式更紧凑,但对细粒度过程的刻画可能不够充分。

第三类是空间表示方式

常见表示包括 latent vector、token sequence、spatial latent grid、rendering representation。它们决定了模型更适合做抽象规划、可视化生成,还是支持机器人在空间中执行动作。

世界模型容易被理解成"未来视频生成"。但在具身智能里,画面是否逼真只是其中一部分。

更关键的问题是:预测是否符合物理约束,误差会不会随时间放大,候选动作的风险能不能被识别,最终是否真的提升下游策略表现。

因此,这篇综述给出的核心判断很清楚:

世界模型的重点,是让机器人在行动前先估计后果。

06 WAM:把动作生成和未来预测合在一起

论文标题:World Action Models: The Next Frontier in Embodied AI[11]

发布时间:2026 年 5 月

核心问题:能不能把 VLA 的动作生成能力和世界模型的未来预测能力放进同一套建模框架?

一句话理解:WAM 关注的是未来状态和动作之间的联合建模,让模型既能预测动作之后世界会怎样,也能反推出为了达到某个未来应该怎么做。

World Action Model发展演进时间线:Joint WAM与Cascaded WAM技术路线

图 7:World Action Model 的总体框架。Cascaded WAM 和 Joint WAM 分别代表两种思路:先预测再生成动作,或者把未来状态和动作放在同一个模型里联合建模。

前面两条线分别讲了 VLA 和世界模型。

VLA 更关心:

当前观测 + 语言指令 → 下一步动作

世界模型更关心:

当前状态 + 候选动作 → 未来状态

WAM 想进一步处理二者的连接关系。用更技术一点的说法,它讨论的是从只建模动作分布,走向同时建模未来状态和动作:

p(a | o, l)  →  p(o', a | o, l)

其中,o 是当前观测,l 是语言指令,a 是动作,o' 是动作之后可能出现的未来观测或状态。

这篇综述把 WAM 的架构路线分成两类。

第一类是 Cascaded WAM

这类方法把世界预测和动作生成拆成前后两个阶段:先预测未来状态、未来视频、目标表示或可规划的中间结果,再通过动作解码器、逆动力学模型或策略搜索得到动作。

它的好处是模块边界清楚,容易复用已有世界模型和策略模型。问题也很明显:前一阶段的预测误差会传到后一阶段,系统延迟和接口设计也会更复杂。

第二类是 Joint WAM

这类方法把未来状态和动作放到同一个模型里联合生成。它可以采用自回归建模,也可以采用扩散或 flow-based 生成;主干结构上,又可以分成统一流和多流结构。

它的优势在于,模型可以在同一表示空间里同时学习"世界会怎样变化"和"动作应该怎样产生"。代价是训练更难,对数据对齐、时序建模和评测方式的要求也更高。

这篇综述还把 WAM 的数据来源和评测标准放在一起讨论。

数据来源主要包括机器人遥操作、人类示范、仿真交互、第一视角视频、互联网视频,以及自动驾驶和机器人轨迹数据。

评测则不能只看生成结果是否好看,还要看以下三方面:

· visual fidelity:未来观测是否足够清晰;

· physical commonsense:物理关系是否合理;

· action plausibility:动作是否真的可执行。

它关心的不是单独预测未来,也不是单独输出动作,而是让动作和未来状态在同一个模型框架里互相约束。

07 最后,用 6 篇综述看清技术地图

这 6 篇综述覆盖了具身智能从系统框架到动作、导航、预测和评测的几条主线。

核心问题可以归到一句话:

机器人如何从"看懂世界",走向"在真实世界里稳定行动"?

具身智能能力层与6篇综述对应关系:总框架、动作、导航、预测、动作与预测

图 8: 具身智能能力层与 6 篇综述对应关系, 总框架 → VLA → VLN / 导航基础模型 → 世界模型 → WAM → 数据仿真评测

如果只想先建立全局框架,先看 Large Model Empowered Embodied AI;如果想进入机器人基础模型,重点看 A Survey on VLA Models;如果关注导航和空间智能,把 VLN Today and TomorrowFoundation Models for Embodied Navigation 连起来看;如果想看下一阶段趋势,World Models for Embodied AIWorld Action Models 更值得放在一起。

读综述的意义,是先知道问题在哪里。

具身智能至少包含几层问题:模型要看懂环境,要根据目标做决策,要在空间里移动,要把语言和视觉变成动作,要预测动作的后果,还要靠数据、仿真和评测不断改进。

再看 RT-2[4]、OpenVLA[5]、π0[6]、GR00T、Gemini Robotics、Motus、Qwen-RobotWorld 这些具体工作时,就可以直接判断:它解决的是哪一层问题,离真实机器人落地还差数据、控制、评测,还是系统工程。


参考链接

  1. https://ai-mzq.github.io/From-Zero-to-AGI/https://ai-mzq.github.io/From-Zero-to-AGI/

  2. Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning:https://arxiv.org/abs/2508.10399

  3. A Survey on Vision-Language-Action Models for Embodied AI:https://arxiv.org/abs/2405.14093

  4. RT-2:https://arxiv.org/abs/2307.15818

  5. OpenVLA:https://arxiv.org/abs/2406.09246

  6. π0:https://arxiv.org/abs/2410.24164

  7. Vision-and-Language Navigation Today and Tomorrow:https://arxiv.org/abs/2407.07035

  8. Room-to-Room:https://arxiv.org/abs/1711.07280

  9. Foundation Models for Embodied Navigation: A Survey:https://github.com/MEmbodied/awesome-embodied-navigation-paper-list

  10. A Comprehensive Survey on World Models for Embodied AI:https://arxiv.org/abs/2510.16732

  11. World Action Models: The Next Frontier in Embodied AI:https://arxiv.org/abs/2605.12090




上一篇:特斯拉 Cybercab 无人出租车提速,Uber 推动 85/15 混合运营踩刹车
下一篇:具身智能怎么落地:VLM、VLA、VLN与世界模型闭环拆解
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-10 16:01 , Processed in 1.235190 second(s), 40 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表