Skip to content
arXiv Robotics — research abstracts· Yu Liu, Hetian Guo, Tianlv Huang, Ziyi Cai, Wudi Chen, Hantang Wang, Qiutong Liu, Yingzhi Peng, Wei Han, Peijun Tang, Jianan Wang, Zipei Fan, Zhiyuan Zha, Xuan Song·· 1 days agoEditorial score58

PLaW-VLA: Predictive Latent World Modeling for Vision-Language-Action Policies

PLaW-VLA: Predictive Latent World Modeling for Vision-Language-Action Policies

Summary

This paper presents PLaW-VLA, a method for vision-language-action (VLA) policies that models task-relevant future states in a pretrained prediction-oriented representation space. By focusing on predictive context rather than detailed visual reconstruction, PLaW-VLA achieves improved long-horizon control and generalization on benchmarks like RoboTwin Hard Horizon III and LIBERO-Plus, with lower inference latency compared to generative world-action modeling approaches.

Source: arXiv Robotics — research abstracts · Read original article ↗

Loading article text…

Source:arXiv Robotics — research abstracts · arxiv.org

Timezone · UTC

Article dates follow your selected timezone. Briefing editions use Hong Kong time (UTC+8).