RESEARCH PAPER

RoboDreamer: Learning Compositional World Models for Robot Imagination

Siyuan Zhou; Yilun Du; Jiaben Chen; Yandong Li; Dit-Yan Yeung; Chuang Gan

Classification

View four quadrants
Major category
WAMs
Architecture
Dual-system
Prediction paradigm
IDM
Source review status
Not assigned

Category review. A compositional instruction-conditioned video world model produces robot plans, and a separate IDM converts adjacent predicted frames into actions with periodic replanning. A separate video world model and IDM compose planning with action decoding. Reading evidence

AT A GLANCE

Contribution

RoboDreamer composes phrase-conditioned video diffusion predictions to imagine robot plans for unfamiliar instruction combinations. Optional goal images or sketches sharpen spatial specifications; a separate inverse-dynamics model converts imagined frames into actions. The strongest language-only evidence concerns human-rated video alignment, while executed success is measured separately in RLBench simulation (E03, E10–E13).

Abstract

An abstract has not been added yet.

Affiliations

Hong Kong University of Science and Technology; Massachusetts Institute of Technology; University of California, San Diego; Google Research; University of Massachusetts Amherst; MIT-IBM Watson AI Lab