RoboDreamer: Learning Compositional World Models for Robot Imagination
Classification
View four quadrants- Major category
- WAMs
- Quadrant
- Q4 · Dual-system × IDM
- Architecture
- Dual-system
- Prediction paradigm
- IDM
- Subcategories
- Visual planning & IDM
- Source review status
- Not assigned
Category review. A compositional instruction-conditioned video world model produces robot plans, and a separate IDM converts adjacent predicted frames into actions with periodic replanning. A separate video world model and IDM compose planning with action decoding. Reading evidence
Contribution
RoboDreamer composes phrase-conditioned video diffusion predictions to imagine robot plans for unfamiliar instruction combinations. Optional goal images or sketches sharpen spatial specifications; a separate inverse-dynamics model converts imagined frames into actions. The strongest language-only evidence concerns human-rated video alignment, while executed success is measured separately in RLBench simulation (E03, E10–E13).
Abstract
An abstract has not been added yet.
Affiliations
Hong Kong University of Science and Technology; Massachusetts Institute of Technology; University of California, San Diego; Google Research; University of Massachusetts Amherst; MIT-IBM Watson AI Lab