MAPLE trains vision-language-action driving models via latent multi-agent rollout and reinforcement learning, achieving state-of-the-art closed-loop performance without external simulators.
GeRo enables vision-language-action models to generate language-grounded future traffic scenes via autoregressive rollouts, improving Bench2Drive driving scores by 15.7 and success rates by 26.2.