RESEARCH PAPER

RynnVLA-002: A Unified Vision-Language-Action and World Model

Jun Cen; Siteng Huang; Yuqian Yuan; Kehan Li; Hangjie Yuan; Chaohui Yu; Bohan Hou; Yuming Jiang; Jiayan Guo; Xin Li; Hao Luo; Fan Wang; Deli Zhao; Hao Chen

Classification

View four quadrants
Major category
WAMs
Quadrant
Not assigned
Architecture
Not assigned
Prediction paradigm
Not assigned
Source review status
Not assigned

Category review. A shared multimodal backbone learns direct action prediction and action-conditioned future-image prediction through separate query modes; world supervision transfers through shared parameters to executable actions. Reading evidence

AT A GLANCE

Contribution

RynnVLA-002 finetunes a shared Chameleon backbone for action prediction and action-conditioned image prediction, then adds a parallel continuous-action head. Its strongest evidence is mutual training benefit: better executed policies and better held-out visual predictions. Policy inference uses no imagined-image rollout. The reported 97.4% LIBERO average is competitive, while physical evidence is limited to SO100 pick-and-place.

Abstract

An abstract has not been added yet.

Affiliations

DAMO Academy, Alibaba Group; Hupan Lab; Zhejiang University