RESEARCH PAPER

WorldEval: World Model as Real-World Robot Policies Evaluator

Yaxuan Li; Yichen Zhu; Junjie Wen; Chaomin Shen; Yi Xu

Classification

View four quadrants
Architecture
Not applicable
Prediction paradigm
Not applicable
Source review status
Not assigned

Category review. Policy embeddings condition a separately adapted video simulator, and a verifier judges generated outcomes to estimate policy rankings against real trials. The system evaluates policies rather than producing their executable actions. The cataloged contribution is a dataset/data-generation method or evaluation/simulation resource, not the architecture of an evaluated or external policy. Reading evidence

AT A GLANCE

Contribution

WorldEval estimates robot-policy rankings by turning internal policy embeddings into generated manipulation videos and judging their outcomes. Policy2Vec conditions a separately adapted WAN 2.1 simulator; Gemini-2.0 supplies success labels. Paired experiments support relative-ranking usefulness on the tested tabletop setup, while imperfect action fidelity, checkpoint-distribution dependence and inconsistent source reporting limit stronger conclusions.

Abstract

An abstract has not been added yet.

Affiliations

Midea Group; East China Normal University