ChainFlow-VLA unifies causal trajectory generation and global diffusion refinement via vision-language-conditioned residual distributions, scoring 94.85 on NAVSIM v1.
CoWorld-VLA embeds multi-expert world tokens into vision-language-action models and couples diffusion planning with scene context to generate continuous ego trajectories, improving autonomous driving performance.