RESEARCH PAPER

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

Yuran Wang; Siqiao Huang; Mingleyang Li; Chenhao Zhang; Jiaqi Liang; Weiyang Jin; Yue Chen; Xuemin Chi; Donghao Zhou; Qize Yu; Yu-Kai Wang; Yuhan Rui; Shenzhe Yao; Zhen Yuan; Zhenhao Shen; Kefei Zhu; Zijie Zhu; Ning Gao; Xiaowei Chi; Guanqi He; Shanghang Zhang; Hao Dong; Lin Shao; Hang Zhao

Classification

View four quadrants
Major category
WAMs
Architecture
Dual-system
Prediction paradigm
Joint prediction
Source review status
Not assigned

Category review. OpenWAM-alpha couples a video DiT and an ActionDiT through mutual attention and joint denoising to output robot action chunks. The modular pretraining framework instantiates a complete WAM rather than a generic backbone. OpenWAM-alpha uses distinct Wan and ActionDiT backbones joined by mutual attention and synchronous denoising. Reading evidence

AT A GLANCE

Contribution

OpenWAM turns world–action modeling into a modular design study, then instantiates OpenWAM-α: a video DiT coupled to a dedicated ActionDiT through mutual attention and joint denoising. Its strongest lesson is conditional: embodied pretraining improves scene transfer, but strong manipulation scores coexist with substantial visual-robustness failures. The evidence below separates controlled ablations, final-model benchmarks and physical execution.

Abstract

An abstract has not been added yet.

Affiliations

National University of Singapore; Tsinghua University; Peking University; The University of Hong Kong; Zhejiang University; The Chinese University of Hong Kong; Shanghai Jiao Tong University