RynnVLA-002: A Unified Vision-Language-Action and World Model
Classification
View four quadrants- Major category
- WAMs
- Quadrant
- Not assigned
- Architecture
- Not assigned
- Prediction paradigm
- Not assigned
- Subcategories
- Joint video-action modeling
- Source review status
- Not assigned
Category review. A shared multimodal backbone learns direct action prediction and action-conditioned future-image prediction through separate query modes; world supervision transfers through shared parameters to executable actions. Reading evidence
Contribution
RynnVLA-002 finetunes a shared Chameleon backbone for action prediction and action-conditioned image prediction, then adds a parallel continuous-action head. Its strongest evidence is mutual training benefit: better executed policies and better held-out visual predictions. Policy inference uses no imagined-image rollout. The reported 97.4% LIBERO average is competitive, while physical evidence is limited to SO100 pick-and-place.
Abstract
An abstract has not been added yet.
Affiliations
DAMO Academy, Alibaba Group; Hupan Lab; Zhejiang University