RCRL conditions agents on reward parameterizations via replay counterfactual rewards, improving sample efficiency and enabling zero-shot behavioral adaptation without extra interaction.
CFGRL links diffusion guidance to policy improvement, training via supervised learning to exceed dataset performance on offline RL without value functions.