GCPO replaces individual rollout scoring with team-level credit assignment based on valid solution coverage, significantly improving reasoning accuracy and diversity over competitive RLVR methods.
DiagEval uses trajectory-conditioned diagnostic probes to disambiguate evaluator errors from software defects in GUI-agent evaluations, recovering over 45% of misattributed failures and improving accuracy substantially.
AutoREM is a tuning-free memory-augmented framework that automates robust optimization reformulation via experience memory and improves accuracy across models.
SR-MCR aligns multimodal reasoning via intrinsic process rewards and a critic-free GRPO objective, achieving 81.4% average accuracy across visual benchmarks.
RePO-VLA improves vision-language-action robustness by assigning roles to success, recovery, and failure trajectories, raising adversarial success from 20% to 75%.