找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4727

积分

0

好友

617

主题
发表于 3 小时前 | 查看: 7| 回复: 0

【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。

项目地址:https://ai-mzq.github.io/From-Zero-to-AGI/[1]

本文将系统梳理具身智能和智能驾驶中常见的 7 个核心概念,从"看懂世界"的 VLM,到"预测未来并生成动作"的 WAM,帮助读者快速建立一张从感知、导航、行动到世界建模的概念地图。

如果你最近关注机器人、具身智能或者智能驾驶,应该经常会看到一些核心概念的缩写,比如:

VLM、VLN、VA、VLA、WM、WAM、VLX。

这些概念背后,其实指向同一条技术主线:具身智能要做的事,是让模型从"看懂世界",走向"能在世界里行动",再走向"行动前能预判后果"。

具身智能7个概念关系图:从感知识别到通用任务扩展的能力演进链

图 1:具身智能 7 个核心概念的关系图,从视觉理解延伸到导航、动作与世界建模。

——注:本文部分配图由 AI 制作,仅供参考

01 七个核心概念速览

理解这些概念,关键不是先记住缩写,而是看清它们分别处理什么输入、产生什么输出。

概念 全称 主要解决什么问题 典型输入 典型输出
VLM Vision-Language Model 看懂图像/视频,并用语言表达 图像/视频 + 文本 描述、问答、检测结果、空间关系
VLN Vision-Language Navigation 根据语言指令在空间里走到目标 第一视角图像 + 路线指令 路径、航点、导航动作
VA Vision-Action 从视觉直接到动作 图像/视频 + 状态 轨迹、控制量、动作
VLA Vision-Language-Action 按语言指令完成动作 图像/视频 + 语言 + 机器人状态 动作 token、连续轨迹、action chunk
WM World Model 预测世界会怎样变化 当前状态 + 候选动作 未来状态、未来视频、奖励/风险
WAM World Action Model 把动作和未来结果一起建模 视频/状态 + 目标/动作条件 未来变化 + 对应动作
VLX Vision-Language-X 视觉语言模型向更多任务扩展 图像/视频 + 文本 + X 模态 导航、动作、定位、视频理解、控制等

这七个概念并不处在同一层。VLM 偏感知理解,VLN 把视觉语言理解放进导航任务,VA 和 VLA 开始输出动作,WM 和 WAM 则进一步关注动作发生后世界会怎样变化。

其中,VLM、VLN、VLA、WM 的使用相对稳定;VA 更像本文对"视觉到动作"路线的归纳;VLX 则用来指向视觉语言模型向更多具身任务扩展。如果你想进一步了解这些技术背后的人工智能技术栈和相关研究,可以在社区里找到更多讨论。

02 VLM:机器如何理解图像和语言?

VLM,全称:Vision-Language Model,也就是视觉语言模型。它负责把图像、视频和语言放到同一个语义空间里理解。

它的输入通常是图像或视频,再加上一段文本提示;输出可以是图像描述、视觉问答答案、目标位置、空间关系,或者更结构化的检测结果。

比如给机器人一张厨房图,再问它:

桌上有什么?
红色杯子在哪里?
哪个位置可能是空气炸锅的把手?
前方有没有障碍物?

VLM 的价值就在这里:它不只是给图像贴标签,还能理解物体、位置、关系和场景含义。

VLM视觉语言理解工作原理示意图:从视觉输入到语言与结构化理解

图 2:VLM 将图像或视频与语言提示结合,输出描述、问答、检测与空间关系等语义结果。

VLM 的边界也很清楚:它负责理解,不直接负责控制。

所以,VLM 是视觉语义入口。导航和动作,要交给后面的 VLN、VA、VLA 继续处理。

参考工作可以看 CLIP[2]、PaLM-E[3]、Gemini Robotics[4]。

03 VLN:按语言指令在空间里导航

VLN,视觉语言导航。它关注的是:智能体能不能一边看环境,一边按自然语言路线走到目标位置。

和 VLM 相比,VLN 多了"移动"和"停下"。

VLM 可能回答"门在前方"。VLN 要进一步判断:现在该往哪里走,走到哪里转弯,什么时候停下来。

经典 VLN 任务里,智能体会拿到一条路线指令,然后在陌生环境中通过第一视角观察一步步移动。比如 Room-to-Room[5] 这类任务中,经常会出现类似指令:

上楼,穿过正前方的拱门,经过钢琴。
当走廊尽头是画作和桌子时,向右转。
在挂在墙上的麋鹿鹿角旁等待。

这类指令难在:语言里的"上楼""拱门""钢琴""右转""等待",都要和第一视角画面、当前位置、历史路径对上。模型还要记住自己走到了哪一步。

Room-to-Room视觉语言导航示例:智能体依据路线指令逐步选择移动方向

图 3:Room-to-Room 任务中的视觉语言导航示例。智能体依据路线指令和第一视角观察,逐步选择移动方向。图源:Room-to-Room 项目页。

VLN 的核心难点主要有四个:

· 语言和视觉要对齐;
· 局部视野下判断方向;
· 长路线中的进度记忆;
· 环境变化后的重新规划。

可以把 VLN 理解成:VLM 让机器知道"眼前有什么",VLN 让机器知道"该往哪里走"。

参考资料:Room-to-Room[5]、Foundation Models for Embodied Navigation[6]。

04 VA:不靠语言,直接从视觉到动作

VA,也就是 Vision-Action,可以理解为"视觉直接到动作"。

VA 不一定需要语言。模型看到图像、视频和当前状态后,直接预测动作、轨迹或控制量。

自动驾驶里的端到端驾驶策略(driving policy)就接近这条路线:摄像头看到道路、车辆、行人和车道线,模型直接输出未来轨迹、转向、加速度或刹车。

VA与传统模块化系统的对比:视觉到动作的技术路线

图 4:VA 路线直接将视觉与状态映射为动作或轨迹;传统方案则通常经过感知、预测、规划与控制等多个模块。

VA 的特点是链路短、延迟低,适合任务边界清楚、数据覆盖充分的实时控制问题。

它的局限也很直接:模型能输出动作,但不一定能解释依据;遇到训练里没覆盖的长尾场景,泛化和安全性都会变成问题。

所以在这篇文章里,VA 主要作为"视觉到动作路线"的通俗归纳。不同论文可能会写成 Vision-Action、end-to-end policy、behavior cloning、diffusion policy 或 driving policy,不一定统一叫 VA。

参考资料可以看 Diffusion Policy[7] 这类机器人动作策略,以及端到端自动驾驶里的 driving policy 相关工作。

05 VLA:把视觉、语言和动作接起来

VLA,也就是 Vision-Language-Action,是机器人基础模型里很常见的一类。

它的基本形式是:

图像 / 视频 + 语言指令 + 机器人状态
        ↓
机器人动作

相比 VA,VLA 多了语言条件。语言让 VLA 可以处理更开放的任务。真实机器人任务往往不是固定控制问题,而是用户用自然语言说一句话:

把红色杯子放到水槽旁边。
打开抽屉,把勺子拿出来。
把红薯放进空气炸锅。

这些任务里,模型既要看懂场景,也要理解语言目标,还要输出动作。这实际上已经涉及深度学习与具身智能的结合——模型必须在理解语义的同时完成物理世界的控制输出。

OpenVLA系统架构示意图:从图像和语言指令到7D机器人动作

图 5:OpenVLA 的模型架构示意。图像和语言指令进入模型后,最终输出机器人动作。图源:OpenVLA 项目页。

几项代表工作,刚好能看出 VLA 的技术路线。

RT-2[8] 的核心思路,是把机器人动作离散成 token,让视觉语言模型直接学习输出动作。它把互联网图文知识和机器人控制接了起来。

一句话概括 RT-2:把动作当成另一种 token,让 VLM 不只会回答,还能输出机器人动作。

OpenVLA[9] 则提供了更完整的开源 VLA 基线。它使用视觉编码器接收图像,再用语言模型主干融合视觉和语言上下文,最后输出动作 token。

一句话概括 OpenVLA:把 VLA 的训练、微调和部署链路开放出来,让研究者有了更清楚的开源基线。 对这个方向感兴趣的,也可以去开源实战板块看看相关项目的源码分析。

π0[10] 和 π0.7[11] 更强调连续动作和通用机器人策略。π0 使用预训练 VLM 负责理解,用 action expert 负责动作生成,并通过 flow matching 输出连续控制。π0.7 进一步把语言、视觉子目标、元数据和控制方式放进提示,让策略更可控。

一句话概括 π0 / π0.7:VLA 不只要听懂任务,还要输出高频、连续、可控的机器人动作。

VLA 的主要难点有几类:

· 动作怎么表示:token、连续轨迹、扩散策略、flow matching 都在被尝试;
· 数据从哪里来:机器人动作轨迹要真实设备、遥操作和安全场地;
· 跨本体怎么做:机械臂、夹爪、移动底盘、人形机器人动作空间差别很大;
· 实时性和安全怎么保证:机器人不能慢慢"想"每一步,也不能只靠语言推理保证安全。

所以,VLA 现在很受关注,但还远没有到"一个模型解决所有机器人任务"的程度。

参考资料:A Survey on Vision-Language-Action Models for Embodied AI[12]、RT-2[8]、OpenVLA[9]、π0[10]、π0.7[11]。

06 WM:世界模型,让机器先预演未来

WM,也就是 World Model,世界模型。它要回答的问题是:如果现在这样做,接下来会发生什么。

它的核心形式可以写成:

当前状态 + 候选动作
        ↓
未来状态 / 未来视频 / 奖励 / 风险

VLA 更关心"下一步动作是什么"。世界模型更关心"如果做这个动作,世界会怎么变"。

比如机器人要拿起杯子,世界模型需要预测杯子会不会滑、手会不会碰到旁边的盘子;智能车要变道,世界模型需要预测旁边车辆会不会减速,后车会不会快速接近。这种预测能力的本质,是在神经网络中构建一个可推演的虚拟世界。

世界模型对候选动作进行未来预演:从当前状态到多种未来结果

图 6:世界模型根据当前状态和候选动作预测多种未来结果,为规划或风险规避提供依据。

参考资料:A Comprehensive Survey on World Models for Embodied AI[13]、V-JEPA 2[14]、NVIDIA Cosmos[15]。

07 WAM:把世界模型和动作模型合起来

WAM,也就是 World Action Model,世界动作模型。它想把"动作生成"和"未来预测"放进同一个模型里。

把三个概念放到一起:

VLA:看见什么 + 想做什么 → 下一步动作

WM:当前世界 + 一个动作 → 未来会怎样

WAM:目标 + 当前状态 → 未来世界变化 + 对应动作

VLA 偏动作生成,WM 偏未来预测。WAM 想把两件事合起来:模型生成动作时,也预测这个动作会把世界推向什么状态。

这也是 World Action Models: The Next Frontier in Embodied AI[16] 这类工作开始讨论的问题。

一句话概括 WAM:它不只学习"动作是什么",还学习"动作如何改变世界"。

图 7:VLA、WM 与 WAM 的关系示意:VLA 生成动作,WM 预测动作后果,WAM 尝试把两者联合建模。图源:World Action Models 项目页。

比如机器人要把杯子放进洗碗机。VLA 更像直接输出动作序列,WM 更像评估某个动作会不会让杯子倾斜,WAM 则希望在生成动作时,就带着对未来结果的判断。

参考资料:World Action Models: The Next Frontier in Embodied AI[16]、NVIDIA World Action Model[17]。

08 VLX:X 代表扩展,也代表边界还没完全定型

VLX 可以理解为 Vision-Language-X,重点在最后这个 X

这里的 X 不是固定答案。它可以是 action、navigation、grounding、detection,也可以是 video、control、tool use,甚至是更复杂的具身任务输出。

如果说 VLM 是视觉语言模型,VLA 是视觉语言动作模型,那么 VLX 更像一个扩展视角:视觉语言模型正在从"看图问答",向更多任务接口扩展。

VLX视觉语言能力向多任务接口扩展:从视觉语言理解走向通用具身能力

图 8:VLX 表示视觉语言能力可继续连接动作、导航、定位、世界建模、视频理解、控制与工具调用等任务接口。

在一些行业语境里,VLX 会被用来表达更通用的接口:视觉语言模型不再只输出文本,而是接上不同任务头,输出导航目标、动作轨迹、定位结果或视频理解结果。

这里要留一个边界:VLX 还不是一个完全统一的学术类别。它更适合用来理解趋势:视觉语言能力正在继续外接到更多任务。这类跨模态能力的讨论,在 云栈社区 的具身智能与多模态板块里也不少见。

09 结语:从看懂世界到进入世界

这些概念,其实是在回答同一个问题:模型如何从看懂图像和语言,走向在真实世界里移动、操作,并预判行动后的结果。

这也是 VLA、世界模型和 WAM 经常被放在一起讨论的原因。它们讨论的重心,已经从聊天能力转向物理世界里的感知、动作和后果预测。从纯软件的逻辑推演,到物理世界的实时反馈闭环,这条能力链正是具身智能最核心的技术压力所在。

参考链接

  1. https://ai-mzq.github.io/From-Zero-to-AGI/https://ai-mzq.github.io/From-Zero-to-AGI/
  2. CLIP:https://arxiv.org/abs/2103.00020
  3. PaLM-E:https://arxiv.org/abs/2303.03378
  4. Gemini Robotics:https://deepmind.google/blog/gemini-robotics-brings-ai-into-the-physical-world/
  5. Room-to-Room:https://arxiv.org/abs/1711.07280
  6. Foundation Models for Embodied Navigation:https://membodied.github.io/embodied-navigation-survey/
  7. Diffusion Policy:https://arxiv.org/abs/2303.04137
  8. RT-2:https://robotics-transformer2.github.io/
  9. OpenVLA:https://openvla.github.io/
  10. π0:https://www.physicalintelligence.company/blog/pi0
  11. π0.7:https://arxiv.org/abs/2604.15483
  12. A Survey on Vision-Language-Action Models for Embodied AI:https://arxiv.org/abs/2405.14093
  13. A Comprehensive Survey on World Models for Embodied AI:https://github.com/Li-Zn-H/AwesomeWorldModels
  14. V-JEPA 2:https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/
  15. NVIDIA Cosmos:https://www.nvidia.com/en-us/ai/cosmos/
  16. World Action Models: The Next Frontier in Embodied AI:https://arxiv.org/abs/2605.12090
  17. NVIDIA World Action Model:https://www.nvidia.com/en-us/glossary/world-action-model/
  18. Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications:https://vla-survey.github.io/
  19. NVIDIA Alpamayo:https://www.nvidia.com/en-us/solutions/autonomous-vehicles/alpamayo/
  20. Wayve LINGO-2:https://wayve.ai/press/introducing-lingo-2/
  21. VLX-Seek 1.5:https://om-ai-lab.github.io/2026_07_06_vlx_seek_1_5_en.html



上一篇:QoS 没搞懂?K8s Pod 驱逐顺序与保命配置详解
下一篇:NVIDIA GR00T全链路拆解:人形机器人基础模型的数据、仿真与部署工具链
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-12 04:57 , Processed in 0.320479 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表