在设计世界动作模型(World Action Model)时,有一个问题始终绕不开:视频和动作到底应该共享同一个主干网络,还是分开建模?以及推理时真的需要生成未来预测吗?本文基于 EasyWAM 在 LIBERO / LIBERO-Plus 上对三种代表性架构的完整实验结果,把训练方式(全参数 / LoRA)与泛化能力(LIBERO-Plus)并排放在一起,梳理数字背后说明了什么,以及其中的架构原因。下文所有数据均来自基于 Wan2.2-TI2V-5B 主干的实验。
实验设置
- EasyWAM-Unified(类 DreamZero):单 DiT 架构,将视频、动作和机器人状态 token 放入同一个 Video DiT 中联合去噪,动作与视频在同一个自注意力中双向耦合。
- EasyWAM-Hidden(类 DiT4DiT):双 DiT 架构,用一个独立的 Action DiT 单向地以 Video DiT 的中间特征为条件;推理时仍需预测未来视频。
- EasyWAM-MoT(类 FastWAM):双 DiT 架构,Video DiT 与 Action DiT 相互独立,通过共享的混合自注意力交互;推理时只预测动作,不生成或预测未来视频。
RQ1:全参数训练与 LoRA 训练下,各架构表现如何?
设置:我们把全参数训练与 LoRA(Rank 128)训练的结果放到同一张表里,看看切换训练方式是否会改变架构之间的相对排名。
结果(LIBERO,平均值)
| 模型 | 结构 | 训练 | Spatial | Object | Goal | Long | 平均 |
|---|---|---|---|---|---|---|---|
| EasyWAM-Unified | 单 DiT | 全参数 | 99.0 | 99.4 | 99.2 | 98.2 | 99.0 |
| EasyWAM-Hidden | 双 DiT | 全参数 | 99.4 | 100.0 | 97.0 | 97.8 | 98.6 |
| EasyWAM-MoT | 双 DiT | 全参数 | 97.8 | 98.4 | 97.6 | 95.6 | 97.4 |
| EasyWAM-Unified | 单 DiT | LoRA | 84.0 | 97.8 | 92.0 | 81.2 | 88.8 |
| EasyWAM-Hidden | 双 DiT | LoRA | 96.8 | 99.4 | 92.6 | 86.8 | 93.9 |
| EasyWAM-MoT | 双 DiT | LoRA | 96.8 | 98.8 | 94.4 | 90.4 | 95.1 |
发现
- 全参数训练下:Unified(99.0)> Hidden(98.6)> MoT(97.4)。单 DiT 设计把视频和动作 token 放在同一个自注意力里双向耦合——动作预测可以直接利用完整的视觉表征,视频生成反过来又被动作信号约束。要把这种紧耦合学好,需要对整个网络联合调参,而这正是全参数训练所提供的,因此在这一设置下 Unified 拔得头筹。
- LoRA 微调下:MoT(95.1)> Hidden(93.9)> Unified(88.8)。MoT 和 Hidden 都是双 DiT 架构,在很大程度上保留了预训练 Video DiT 的先验;LoRA 只需微调一个相对独立的 Action DiT(外加少量交互层)来适配动作侧,代价很低。相比之下,Unified 在全参数训练下的优势依赖于对整个主干的联合调整——一旦只能做低秩更新,联合视频-动作建模所需的"耦合能力"就无法再被 LoRA 捕捉,这一点最明显地体现在性能从 99.0 掉到 88.8。
RQ2:不同架构的泛化能力如何?
设置:LIBERO-Plus 把在 LIBERO 上训练好的 checkpoint 拿来,系统性地扰动背景、相机视角、语言指令、物体布局、光照、噪声和机器人本体,测试模型是否真的学到了可泛化的视觉-动作映射。三种架构遵循不同的推理范式:MoT 在推理时不生成或预测未来视频,而 Hidden 和 Unified 都会。
结果(LIBERO-Plus,平均值)
| 模型 | 推理时预测视频? | Background | Camera | Language | Layout | Light | Noise | Robot | 平均 |
|---|---|---|---|---|---|---|---|---|---|
| EasyWAM-Unified | Y | 55.8 | 33.7 | 93.7 | 80.6 | 92.2 | 50.2 | 71.4 | 67.5 |
| EasyWAM-Hidden | Y | 56.8 | 49.2 | 95.3 | 81.0 | 90.4 | 58.2 | 77.4 | 72.4 |
| EasyWAM-MoT | N | 52.8 | 20.6 | 80.4 | 65.2 | 85.1 | 51.5 | 49.7 | 56.8 |
发现
- 推理时预测未来视频能显著提升泛化能力。Hidden(72.4)和 Unified(67.5)在推理时都预测未来视频,它们的平均分远超不预测的 MoT(56.8)。它们几乎在每个扰动维度上都领先,其中 Camera(49.2/33.7 对 20.6)和 Robot(77.4/71.4 对 49.7)上的差距尤其大。这表明"预测未来"本身提供了比纯动作模仿更强的监督信号——模型必须建模物体和视角如何随时间演化,才能生成一帧合理的未来画面,而这个过程会把它推向更接近底层物理、对扰动更鲁棒的视觉表征,而不是简单记住训练分布中的动作-观测映射。
- Hidden 比 Unified 泛化得更好,代价是一笔"视频-动作对齐税"。两者都在推理时预测视频,但 Hidden(72.4)明显优于 Unified(67.5)。原因在于 Hidden 的双 DiT 结构在很大程度上保留了预训练 Video DiT 的先验——视频分支基本按预训练的方式运行,只把中间特征喂给一个独立的 Action DiT。而 Unified 必须把动作 token 拉进同一个主干里联合训练,视频分支的表征因此持续被动作梯度扰动——实际上,它把自己原有的一部分纯视觉泛化能力,作为对齐两个模态的税付了出去。这笔税在分布外扰动下最为明显,尤其是 Camera(33.7 对 49.2)。
EasyWAM 是一套与社区共建、持续演进的 WAM 训练基础设施,我们欢迎任何形式的贡献——也希望有更多人成为 contributor。
如果你对 WAM 的训练设置还有其他疑问,欢迎提 Issue——我们会做针对性实验并分享可复现的分析。也欢迎给已有的 issue +1,关注度更高的问题会被优先处理。如果你在自己的场景里跑过类似的对比实验,也非常欢迎在 Issue 里分享你的发现——我们会持续把更多模型和 benchmark 加入这套系统性评测。
如何引用
@misc{easywam2026,
title = {EasyWAM: A Unified and Efficient Framework for Training and Evaluating World Action Models},
author = {EasyWAM-Team},
year = {2026},
url = {https://github.com/OpenMOSS/EasyWAM}
}