OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
Classification
View four quadrants- Major category
- WAMs
- Architecture
- Dual-system
- Prediction paradigm
- Joint prediction
- Subcategories
- Joint video-action modeling
- Source review status
- Not assigned
Category review. OpenWAM-alpha couples a video DiT and an ActionDiT through mutual attention and joint denoising to output robot action chunks. The modular pretraining framework instantiates a complete WAM rather than a generic backbone. OpenWAM-alpha uses distinct Wan and ActionDiT backbones joined by mutual attention and synchronous denoising. Reading evidence
Contribution
OpenWAM turns world–action modeling into a modular design study, then instantiates OpenWAM-α: a video DiT coupled to a dedicated ActionDiT through mutual attention and joint denoising. Its strongest lesson is conditional: embodied pretraining improves scene transfer, but strong manipulation scores coexist with substantial visual-robustness failures. The evidence below separates controlled ablations, final-model benchmarks and physical execution.
Abstract
An abstract has not been added yet.
Affiliations
National University of Singapore; Tsinghua University; Peking University; The University of Hong Kong; Zhejiang University; The Chinese University of Hong Kong; Shanghai Jiao Tong University