A Euclidean-Wasserstein-2 gradient-flow framework unifies posterior sampling and prompt optimization for low-NFE inverse problem solving using vision-language diffusion priors without backpropagating through autoencoders.
R2PO uses trajectory-level behavioral evidence rather than scalar rewards to guide LLM policy search, achieving faster and more stable optimization across ten environments despite a critic salience bias.