在设计世界动作模型(World Action Model)时,有一个问题始终绕不开:视频和动作到底应该共享同一个主干网络,还是分开建模?以及推理时真的需要生成未来预测吗?本文基于 EasyWAM 在 LIBERO / LIBERO-Plus 上对三种代表性架构的完整实验结果,把训练方式(全参数 / LoRA)与泛化能力(LIBERO-Plus)并排放在一起,梳理数字背后说明了什么,以及其中的架构原因。下文所有数据均来自基于 Wan2.2-TI2V-5B 主干的实验。

实验设置


RQ1:全参数训练与 LoRA 训练下,各架构表现如何?

设置:我们把全参数训练与 LoRA(Rank 128)训练的结果放到同一张表里,看看切换训练方式是否会改变架构之间的相对排名。

结果(LIBERO,平均值)

模型结构训练SpatialObjectGoalLong平均
EasyWAM-Unified单 DiT全参数99.099.499.298.299.0
EasyWAM-Hidden双 DiT全参数99.4100.097.097.898.6
EasyWAM-MoT双 DiT全参数97.898.497.695.697.4
EasyWAM-Unified单 DiTLoRA84.097.892.081.288.8
EasyWAM-Hidden双 DiTLoRA96.899.492.686.893.9
EasyWAM-MoT双 DiTLoRA96.898.894.490.495.1

发现


RQ2:不同架构的泛化能力如何?

设置LIBERO-Plus 把在 LIBERO 上训练好的 checkpoint 拿来,系统性地扰动背景、相机视角、语言指令、物体布局、光照、噪声和机器人本体,测试模型是否真的学到了可泛化的视觉-动作映射。三种架构遵循不同的推理范式:MoT 在推理时不生成或预测未来视频,而 Hidden 和 Unified 都会。

结果(LIBERO-Plus,平均值)

模型推理时预测视频?BackgroundCameraLanguageLayoutLightNoiseRobot平均
EasyWAM-UnifiedY55.833.793.780.692.250.271.467.5
EasyWAM-HiddenY56.849.295.381.090.458.277.472.4
EasyWAM-MoTN52.820.680.465.285.151.549.756.8

发现


EasyWAM 是一套与社区共建、持续演进的 WAM 训练基础设施,我们欢迎任何形式的贡献——也希望有更多人成为 contributor。

如果你对 WAM 的训练设置还有其他疑问,欢迎提 Issue——我们会做针对性实验并分享可复现的分析。也欢迎给已有的 issue +1,关注度更高的问题会被优先处理。如果你在自己的场景里跑过类似的对比实验,也非常欢迎在 Issue 里分享你的发现——我们会持续把更多模型和 benchmark 加入这套系统性评测。


如何引用

@misc{easywam2026,
  title  = {EasyWAM: A Unified and Efficient Framework for Training and Evaluating World Action Models},
  author = {EasyWAM-Team},
  year   = {2026},
  url    = {https://github.com/OpenMOSS/EasyWAM}
}