【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址:https://ai-mzq.github.io/From-Zero-to-AGI/[1]
本文将系统梳理具身智能和智能驾驶中常见的 7 个核心概念,从"看懂世界"的 VLM,到"预测未来并生成动作"的 WAM,帮助读者快速建立一张从感知、导航、行动到世界建模的概念地图。
如果你最近关注机器人、具身智能或者智能驾驶,应该经常会看到一些核心概念的缩写,比如:
VLM、VLN、VA、VLA、WM、WAM、VLX。
这些概念背后,其实指向同一条技术主线:具身智能要做的事,是让模型从"看懂世界",走向"能在世界里行动",再走向"行动前能预判后果"。

图 1:具身智能 7 个核心概念的关系图,从视觉理解延伸到导航、动作与世界建模。
——注:本文部分配图由 AI 制作,仅供参考
01 七个核心概念速览
理解这些概念,关键不是先记住缩写,而是看清它们分别处理什么输入、产生什么输出。
| 概念 |
全称 |
主要解决什么问题 |
典型输入 |
典型输出 |
| VLM |
Vision-Language Model |
看懂图像/视频,并用语言表达 |
图像/视频 + 文本 |
描述、问答、检测结果、空间关系 |
| VLN |
Vision-Language Navigation |
根据语言指令在空间里走到目标 |
第一视角图像 + 路线指令 |
路径、航点、导航动作 |
| VA |
Vision-Action |
从视觉直接到动作 |
图像/视频 + 状态 |
轨迹、控制量、动作 |
| VLA |
Vision-Language-Action |
按语言指令完成动作 |
图像/视频 + 语言 + 机器人状态 |
动作 token、连续轨迹、action chunk |
| WM |
World Model |
预测世界会怎样变化 |
当前状态 + 候选动作 |
未来状态、未来视频、奖励/风险 |
| WAM |
World Action Model |
把动作和未来结果一起建模 |
视频/状态 + 目标/动作条件 |
未来变化 + 对应动作 |
| VLX |
Vision-Language-X |
视觉语言模型向更多任务扩展 |
图像/视频 + 文本 + X 模态 |
导航、动作、定位、视频理解、控制等 |
这七个概念并不处在同一层。VLM 偏感知理解,VLN 把视觉语言理解放进导航任务,VA 和 VLA 开始输出动作,WM 和 WAM 则进一步关注动作发生后世界会怎样变化。
其中,VLM、VLN、VLA、WM 的使用相对稳定;VA 更像本文对"视觉到动作"路线的归纳;VLX 则用来指向视觉语言模型向更多具身任务扩展。如果你想进一步了解这些技术背后的人工智能技术栈和相关研究,可以在社区里找到更多讨论。
02 VLM:机器如何理解图像和语言?
VLM,全称:Vision-Language Model,也就是视觉语言模型。它负责把图像、视频和语言放到同一个语义空间里理解。
它的输入通常是图像或视频,再加上一段文本提示;输出可以是图像描述、视觉问答答案、目标位置、空间关系,或者更结构化的检测结果。
比如给机器人一张厨房图,再问它:
桌上有什么?
红色杯子在哪里?
哪个位置可能是空气炸锅的把手?
前方有没有障碍物?
VLM 的价值就在这里:它不只是给图像贴标签,还能理解物体、位置、关系和场景含义。

图 2:VLM 将图像或视频与语言提示结合,输出描述、问答、检测与空间关系等语义结果。
VLM 的边界也很清楚:它负责理解,不直接负责控制。
所以,VLM 是视觉语义入口。导航和动作,要交给后面的 VLN、VA、VLA 继续处理。
参考工作可以看 CLIP[2]、PaLM-E[3]、Gemini Robotics[4]。
03 VLN:按语言指令在空间里导航
VLN,视觉语言导航。它关注的是:智能体能不能一边看环境,一边按自然语言路线走到目标位置。
和 VLM 相比,VLN 多了"移动"和"停下"。
VLM 可能回答"门在前方"。VLN 要进一步判断:现在该往哪里走,走到哪里转弯,什么时候停下来。
经典 VLN 任务里,智能体会拿到一条路线指令,然后在陌生环境中通过第一视角观察一步步移动。比如 Room-to-Room[5] 这类任务中,经常会出现类似指令:
上楼,穿过正前方的拱门,经过钢琴。
当走廊尽头是画作和桌子时,向右转。
在挂在墙上的麋鹿鹿角旁等待。
这类指令难在:语言里的"上楼""拱门""钢琴""右转""等待",都要和第一视角画面、当前位置、历史路径对上。模型还要记住自己走到了哪一步。

图 3:Room-to-Room 任务中的视觉语言导航示例。智能体依据路线指令和第一视角观察,逐步选择移动方向。图源:Room-to-Room 项目页。
VLN 的核心难点主要有四个:
· 语言和视觉要对齐;
· 局部视野下判断方向;
· 长路线中的进度记忆;
· 环境变化后的重新规划。
可以把 VLN 理解成:VLM 让机器知道"眼前有什么",VLN 让机器知道"该往哪里走"。
参考资料:Room-to-Room[5]、Foundation Models for Embodied Navigation[6]。
04 VA:不靠语言,直接从视觉到动作
VA,也就是 Vision-Action,可以理解为"视觉直接到动作"。
VA 不一定需要语言。模型看到图像、视频和当前状态后,直接预测动作、轨迹或控制量。
自动驾驶里的端到端驾驶策略(driving policy)就接近这条路线:摄像头看到道路、车辆、行人和车道线,模型直接输出未来轨迹、转向、加速度或刹车。

图 4:VA 路线直接将视觉与状态映射为动作或轨迹;传统方案则通常经过感知、预测、规划与控制等多个模块。
VA 的特点是链路短、延迟低,适合任务边界清楚、数据覆盖充分的实时控制问题。
它的局限也很直接:模型能输出动作,但不一定能解释依据;遇到训练里没覆盖的长尾场景,泛化和安全性都会变成问题。
所以在这篇文章里,VA 主要作为"视觉到动作路线"的通俗归纳。不同论文可能会写成 Vision-Action、end-to-end policy、behavior cloning、diffusion policy 或 driving policy,不一定统一叫 VA。
参考资料可以看 Diffusion Policy[7] 这类机器人动作策略,以及端到端自动驾驶里的 driving policy 相关工作。
05 VLA:把视觉、语言和动作接起来
VLA,也就是 Vision-Language-Action,是机器人基础模型里很常见的一类。
它的基本形式是:
图像 / 视频 + 语言指令 + 机器人状态
↓
机器人动作
相比 VA,VLA 多了语言条件。语言让 VLA 可以处理更开放的任务。真实机器人任务往往不是固定控制问题,而是用户用自然语言说一句话:
把红色杯子放到水槽旁边。
打开抽屉,把勺子拿出来。
把红薯放进空气炸锅。
这些任务里,模型既要看懂场景,也要理解语言目标,还要输出动作。这实际上已经涉及深度学习与具身智能的结合——模型必须在理解语义的同时完成物理世界的控制输出。

图 5:OpenVLA 的模型架构示意。图像和语言指令进入模型后,最终输出机器人动作。图源:OpenVLA 项目页。
几项代表工作,刚好能看出 VLA 的技术路线。
RT-2[8] 的核心思路,是把机器人动作离散成 token,让视觉语言模型直接学习输出动作。它把互联网图文知识和机器人控制接了起来。
一句话概括 RT-2:把动作当成另一种 token,让 VLM 不只会回答,还能输出机器人动作。
OpenVLA[9] 则提供了更完整的开源 VLA 基线。它使用视觉编码器接收图像,再用语言模型主干融合视觉和语言上下文,最后输出动作 token。
一句话概括 OpenVLA:把 VLA 的训练、微调和部署链路开放出来,让研究者有了更清楚的开源基线。 对这个方向感兴趣的,也可以去开源实战板块看看相关项目的源码分析。
π0[10] 和 π0.7[11] 更强调连续动作和通用机器人策略。π0 使用预训练 VLM 负责理解,用 action expert 负责动作生成,并通过 flow matching 输出连续控制。π0.7 进一步把语言、视觉子目标、元数据和控制方式放进提示,让策略更可控。
一句话概括 π0 / π0.7:VLA 不只要听懂任务,还要输出高频、连续、可控的机器人动作。
VLA 的主要难点有几类:
· 动作怎么表示:token、连续轨迹、扩散策略、flow matching 都在被尝试;
· 数据从哪里来:机器人动作轨迹要真实设备、遥操作和安全场地;
· 跨本体怎么做:机械臂、夹爪、移动底盘、人形机器人动作空间差别很大;
· 实时性和安全怎么保证:机器人不能慢慢"想"每一步,也不能只靠语言推理保证安全。
所以,VLA 现在很受关注,但还远没有到"一个模型解决所有机器人任务"的程度。
参考资料:A Survey on Vision-Language-Action Models for Embodied AI[12]、RT-2[8]、OpenVLA[9]、π0[10]、π0.7[11]。
06 WM:世界模型,让机器先预演未来
WM,也就是 World Model,世界模型。它要回答的问题是:如果现在这样做,接下来会发生什么。
它的核心形式可以写成:
当前状态 + 候选动作
↓
未来状态 / 未来视频 / 奖励 / 风险
VLA 更关心"下一步动作是什么"。世界模型更关心"如果做这个动作,世界会怎么变"。
比如机器人要拿起杯子,世界模型需要预测杯子会不会滑、手会不会碰到旁边的盘子;智能车要变道,世界模型需要预测旁边车辆会不会减速,后车会不会快速接近。这种预测能力的本质,是在神经网络中构建一个可推演的虚拟世界。

图 6:世界模型根据当前状态和候选动作预测多种未来结果,为规划或风险规避提供依据。
参考资料:A Comprehensive Survey on World Models for Embodied AI[13]、V-JEPA 2[14]、NVIDIA Cosmos[15]。
07 WAM:把世界模型和动作模型合起来
WAM,也就是 World Action Model,世界动作模型。它想把"动作生成"和"未来预测"放进同一个模型里。
把三个概念放到一起:
VLA:看见什么 + 想做什么 → 下一步动作
WM:当前世界 + 一个动作 → 未来会怎样
WAM:目标 + 当前状态 → 未来世界变化 + 对应动作
VLA 偏动作生成,WM 偏未来预测。WAM 想把两件事合起来:模型生成动作时,也预测这个动作会把世界推向什么状态。
这也是 World Action Models: The Next Frontier in Embodied AI[16] 这类工作开始讨论的问题。
一句话概括 WAM:它不只学习"动作是什么",还学习"动作如何改变世界"。
图 7:VLA、WM 与 WAM 的关系示意:VLA 生成动作,WM 预测动作后果,WAM 尝试把两者联合建模。图源:World Action Models 项目页。
比如机器人要把杯子放进洗碗机。VLA 更像直接输出动作序列,WM 更像评估某个动作会不会让杯子倾斜,WAM 则希望在生成动作时,就带着对未来结果的判断。
参考资料:World Action Models: The Next Frontier in Embodied AI[16]、NVIDIA World Action Model[17]。
08 VLX:X 代表扩展,也代表边界还没完全定型
VLX 可以理解为 Vision-Language-X,重点在最后这个 X。
这里的 X 不是固定答案。它可以是 action、navigation、grounding、detection,也可以是 video、control、tool use,甚至是更复杂的具身任务输出。
如果说 VLM 是视觉语言模型,VLA 是视觉语言动作模型,那么 VLX 更像一个扩展视角:视觉语言模型正在从"看图问答",向更多任务接口扩展。

图 8:VLX 表示视觉语言能力可继续连接动作、导航、定位、世界建模、视频理解、控制与工具调用等任务接口。
在一些行业语境里,VLX 会被用来表达更通用的接口:视觉语言模型不再只输出文本,而是接上不同任务头,输出导航目标、动作轨迹、定位结果或视频理解结果。
这里要留一个边界:VLX 还不是一个完全统一的学术类别。它更适合用来理解趋势:视觉语言能力正在继续外接到更多任务。这类跨模态能力的讨论,在 云栈社区 的具身智能与多模态板块里也不少见。
09 结语:从看懂世界到进入世界
这些概念,其实是在回答同一个问题:模型如何从看懂图像和语言,走向在真实世界里移动、操作,并预判行动后的结果。
这也是 VLA、世界模型和 WAM 经常被放在一起讨论的原因。它们讨论的重心,已经从聊天能力转向物理世界里的感知、动作和后果预测。从纯软件的逻辑推演,到物理世界的实时反馈闭环,这条能力链正是具身智能最核心的技术压力所在。
参考链接
- https://ai-mzq.github.io/From-Zero-to-AGI/ :https://ai-mzq.github.io/From-Zero-to-AGI/
- CLIP:https://arxiv.org/abs/2103.00020
- PaLM-E:https://arxiv.org/abs/2303.03378
- Gemini Robotics:https://deepmind.google/blog/gemini-robotics-brings-ai-into-the-physical-world/
- Room-to-Room:https://arxiv.org/abs/1711.07280
- Foundation Models for Embodied Navigation:https://membodied.github.io/embodied-navigation-survey/
- Diffusion Policy:https://arxiv.org/abs/2303.04137
- RT-2:https://robotics-transformer2.github.io/
- OpenVLA:https://openvla.github.io/
- π0:https://www.physicalintelligence.company/blog/pi0
- π0.7:https://arxiv.org/abs/2604.15483
- A Survey on Vision-Language-Action Models for Embodied AI:https://arxiv.org/abs/2405.14093
- A Comprehensive Survey on World Models for Embodied AI:https://github.com/Li-Zn-H/AwesomeWorldModels
- V-JEPA 2:https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/
- NVIDIA Cosmos:https://www.nvidia.com/en-us/ai/cosmos/
- World Action Models: The Next Frontier in Embodied AI:https://arxiv.org/abs/2605.12090
- NVIDIA World Action Model:https://www.nvidia.com/en-us/glossary/world-action-model/
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications:https://vla-survey.github.io/
- NVIDIA Alpamayo:https://www.nvidia.com/en-us/solutions/autonomous-vehicles/alpamayo/
- Wayve LINGO-2:https://wayve.ai/press/introducing-lingo-2/
- VLX-Seek 1.5:https://om-ai-lab.github.io/2026_07_06_vlx_seek_1_5_en.html