World Action Models: The Next Frontier in Embodied AI
VLA在具身领域展示了强大的语义泛化, 但他们学习到的是从观察到动作的反应式映射, 没有明确地建模物理世界在干预下的演变方式. 越来越多的工作通过将世界模型整合进动作生成来解决这一限制. 这篇论文定义了WAN, 历史, 发展范式, 数据生态, 评估方法.
VLA在具身领域展示了强大的语义泛化, 但他们学习到的是从观察到动作的反应式映射, 没有明确地建模物理世界在干预下的演变方式. 越来越多的工作通过将世界模型整合进动作生成来解决这一限制. 这篇论文定义了WAN, 历史, 发展范式, 数据生态, 评估方法.
传统的视觉-语言-动作 (VLA) 模型通常只学习从"当前观察"到"机器人动作"的直接映射, 但缺乏对物理世界在动作干预下如何演变的建模.
WAM 则将"预测性的状态建模"与"动作生成"统一起来的基础模型. 它不仅生成动作, 还预测执行这些动作后未来环境的状态变化(即针对未来状态和动作的联合分布进行建模). 通过引入物理世界的预测能力, 模型能获得更强的物理理解和泛化能力.
原定义涉及到很多公式定义, 让notebook结合一个具体的场景来讲. 用户上传了一张"虚拟角色站在房间里"的图片, 并输入指令"镜头向右平移, 同时角色向前走".
然后讲了为什么这在音视频领域有意义, 在复杂的音视频生成工作中, 有时我们不仅需要生成像素画面, 还需要模型在潜在空间中输出能被下游软件直接执行的控制参数. WAM 能够确保"生成的视频画面"和"输出的控制参数"在数学和因果逻辑上是完全一致的.
提问
在读到VAM和WAM的区别时, 为了大模型这样一个问题, Sora, Kling优化的目标也只是视频, 为什么它们可以称为世界模型, 大模型的解释是
- 它们内化了物理世界的运行规律 (Rich Physical Priors) 虽然它们的直接目标是生成像素,但在学习海量互联网“视频-文本”对的过程中,这些模型实际上获取了关于物体、场景、物理交互、相机运动以及时间动态的丰富先验知识。也就是说,它们不仅学会了“画画”,还掌握了“重力如何作用”、“物体碰撞后如何运动”等底层物理常识。
- 它们具备预测环境未来演变的能力 (Predictive Capabilities) 论文对“世界模型”的本质定义是:能够内化物理环境的因果动态,并预测未来状态演变的函数。Sora 和 Kling 能够基于一段高级的语义描述(如Prompt),生成一段符合物理直觉的视觉未来画面。论文指出,这种能力提供了一种在语言指令下对世界演变进行建模的自然接口。由于它们展现出了丰富的世界知识和强大的预测能力,因此实际上已经有效地充当了强大的多模态世界模型。
简单来说: 它们虽然只输出视频,但它们输出的视频是“讲物理因果逻辑”的。在具身智能领域,研究人员把它们看作是一个“拥有世界物理常识的虚拟引擎”,而不仅仅是一个视频生成器。
额, 所以VAM和WAM里面的video 和 World的区别, 我觉得是一个很虚的东西, 我的数据量大, 模型参数多, 我认为他学到了物理知识就是世界模型, 如果你参数少只能完成某个特定任务, 你就叫做视频模型, 我觉得他们就是这样区分了.
局限: VLA仍然是一种反应式的映射机制, 它并没有理解物理世界是怎么运作和演变的. 由于缺乏预测未来环境动态的能力(缺乏世界建模), VLA 在需要深度物理理解和面对未见过的复杂操作时, 泛化能力会大打折扣. (做题机器, 不懂原理)
定义存在争议, 但是共识是世界模型是一种内部表示, 它模拟环境动态和行动的影响. 基于这种表示, 它可以预测行动的后果, 从而实现模拟, 决策和规划.
这类模型专门用来描述物理环境如何响应智能体底层的控制信号而发生演变. 给定当前的观测状态 o 和执行的动作 a, 模型会预测环境未来的状态 o′, 即对 P(o′∣o,a) 进行建模. 它捕获了动作对环境动态的因果影响.
显式世界模型在像素层面预测未来的视频帧, 它最终可以输出人类可见的 RGB 像素画面. 早期探索通过预测像素移动, 密集光流, 然后视频生成技术爆发, 走向了端到端的方法, 但是最终都是输出视频.
为了克服生成高清像素带来的巨大计算开销, 隐式世界模型完全放弃了在像素层面预测未来, 将当前预测的画面压缩到一个紧凑的潜在空间, 在这个空间内学习和预测演变. 我的目标是要最终视频的, 这里就不细看了.
这类模型使用自然语言作为更高级, 更抽象的引导条件. 它们不需要输入精确的电机转动角度, 而是通过学习海量的"视频-文本"对, 获取了关于物体, 场景, 物理交互, 相机运动以及时间动态的丰富先验知识.
GAN -> UNet -> DiT -> Latent Space(VAE).
讲了世界模型应用到具身领域做得一些工作.
探讨了世界模型是如何在外部系统中给VLA"打辅助"的.
用于辅助学习. 在训练VLA策略时, 真实机器人数据的收集成本极高且存在物理试错风险, 世界模型: 1) 辅助模仿学习. 模仿学习及其依赖有限的专家演示数据, 世界模型可以作为一个强大的数据合成器, 扩充VLA数据集; 2) RL的替代环境. 真实世界做强化学习昂贵且危险, 世界模型可以充当虚拟物理沙盒; 3) 自动化奖励建模. 直接评估VLA的操作轨迹与预测成功画面之间的潜在对齐度, 免去人工设计的麻烦.
用于辅助评估. 感觉和辅助学习的内容有重叠, VLA在物理机器人上表现耗时昂贵不安全, 物理模拟器存在严重的仿真到现实的差距, 通过世界模型构建虚拟测试场, 还能故意合成一些系统没见过的极端场景或安全临界问题.
类比music to dance任务中的两步式.
把"直接让人眼能看懂的像素级视频帧(即预测的未来画面)"作为连接"世界模型"和"动作模型"的中间桥梁.
基于学习的动作提取. 通常会训练一个独立的动作解码器, 让它看着生成的未来视频, 推导出"要实现这个画面, 机器人该怎么动". 发展的方向是解决长视频累计误差, 丰富规划的信息维度(不再只生成RGB彩色视频, 还加入深度图和表面法线等集合线索), 还与其他大模型深度结合, 比如用预训练VLA替换IDM, Veo-Act设计了门控机制, 在靠近物体时把控制权交给VLA, 弥补世界模型精度不足的问题.
几何式动作提取. 从视频提取出optical flow或者pose tracking(3D坐标, 6D位姿), 直接去把物理运动轨迹算出来.
核心动机是觉得像素级的视频生成的计算开销太大, 研究人员发现扩散模型在生成过程中产生的中间"潜在特征", 其实已经包含了用于规划的物理动态信息, 因此根本没有必要把这些特征解码成人类肉眼可见的 RGB 画面.
(追求极致推理速度)VPP在潜在空间中预测未来的单步特征序列, 用一个轻量的策略网络从中提取动作; S-VAM引入自蒸馏技术, 实现一步前向传播; (提取中间半成品)Video Policy专门训练了一个额外的动作网络, 直接读取视频模型中间层的隐式特征来输出动作; mimic-video使用不完全去噪策略, 在扩散的中间阶段截取特征, 绕过完整的视频生成路径;(过滤视觉噪音拓展多模态)MWM不预测RGB像素, 而是预测未来的语义掩码; OmniVTA扩展到视觉-触觉领域, LAPA和villa-X利用无标注的纯视频数据进行无监督的"latent action"预训练.
提问
问了一个问题, world action model不是要同时生成视频和动作吗, 那么像mimic-video, VPP, S-VAM还能叫world action model吗, AI的回答是
答案是:它们依然是百分之百的世界动作模型(WAM),因为 WAM 的核心要求是预测“未来的状态(States)”,而不是非要生成“肉眼可见的视频(Video/Pixels)”。
- WAM 对“预测未来”的宽泛定义 在论文第 2.1 节对 WAM 的正式定义中,明确指出模型必须具备“前向预测建模”的能力,即生成未来状态 o′。但论文紧接着强调,这种建模可以表现为显式的视觉预测(如像素级的视频帧),也可以表现为“隐式的物理表示(例如基于物理的潜在空间/Latent Spaces)”。
- 回顾 VAM 与 WAM 的“一字之差” 正如我们之前讨论的,如果一个模型被死死绑定在必须生成 RGB 像素画面上,那它叫视频动作模型(VAM)。而 WAM 里的“世界(World)”代表的是内化物理规律,它独立于具体的模态(modality-independent)。生成视频仅仅是呈现世界运转的其中一种“代理方式”,而不是唯一方式。
在这类架构中, 未来的世界状态和动作在一个统一的模型中进行预测, 世界建模和动作生成在训练过程中作为联合监督目标. 核心设计问题是世界状态和动作生成如何在这个共享的预测系统中耦合.
阅读重点!!!

文中画了一个图, 也列举了代表论文, 后续会细读的.
单流架构把世界特征和动作特征塞进了同一个网络主干里进行联合去噪, 它们共享同一个潜在空间和注意力机制. 分成显式和隐式. 显式在输出动作的同时, 必须显式生成未来的视觉画面, 如DreamZero和Cosmos Policy直接在Wan2.1上把动作和视频特征放在一条序列里联合训练. 隐式为了提高效率, 不再强制要求画出未来画面, 比如FLARW和FRAPP, 不强迫重建未来的像素画面, 在抽象的潜在特征层面学习未来的浓缩表示, 有future token的概念, 就是未来画面的浓缩信息.
双流结构分为cross attention coupling, hidden-state coupling 和 shared representation.
从早期的单一实验室环境发展到现在聚合了数百万条轨迹, 覆盖几十种不同形态机器人的海量数据集, 并加入了高保真的触觉反馈数据.
以UMI为代表, 允许普通人带着带有可穿戴相机的 3D 打印夹爪在真实的日常环境中快速采集数据. 这类数据达到百万规模, 而且包含多视角, 触觉甚至全身移动协调的数据, 既有互联网视频那样极高的查理改进多样化, 又带有机器人亟需的厘米级精确控制指令.
能够获得真实世界很难获取的特权信息, 比如完美的深度, 精确的6D姿态和绝对无遮挡的多视角. 可以通过自动化脚本无限生成海量的场景, 物体的超长任务轨迹, 能针对3D空间+时间的4D动态建模, 还能模拟极其微小的软体形变和触觉反馈.
规模最庞大, 获取成本最低. 先通过看海量的无动作视频, 学习物理先验, 然后通过3D手部姿态估计或运动追踪技术将人类视频转换为带有空间几何轨迹的数据(先有视频, 再提取action). 这类数据有一部分还是可穿戴设备标注, 还有一部分是3D手部关键点, flow和点追踪, 还有一部分是无监督的潜在动作(引用论文都很老24年的不建议碰)
由于 WAM 既要预测未来的环境状态, 又要输出物理控制指令, 因此必须对这两部分进行综合考量.
感受
首先是在写作手法上, 影响很深在给WAM下定义的时候, 它并不是简单的声明几个变量, 然后堆几个公式告诉我们这就是WAM的形式了, 它在与VLA, WM的比较中凸显VAM的价值, 又单独开了一个小节去辨析一些容易混淆的概念, 读起来很清楚.
在method上, 我觉得这篇论文站在了一个更高的视野上, 借助预训练模型的能力, 多种条件注入的方式, 这些在以前的调研中常见的名词, 都出现了, 在一个更大的世界观语境下.
music to dance这篇的故事在这里面找就好了, 然后这篇感觉他的落脚点还是在具身上面, 为机器人/机械臂服务, 但是我的落脚点是视频生成, 明天再读一下AVI的综述好了. 更多的感受写在了内部飞书文档, 后续会在组会上讨论.