DeScore decouples chain-of-thought reasoning from scoring in video reward models to improve generalization and training stability. Its think-then-score design uses explicit reasoning followed by a dedicated regression head, optimized via cold-start and dual-objective reinforcement learning.
AnchorWorld improves egocentric world simulation via full-body interaction supervision and anchor-view customization with consistent spatio-temporal dynamics.
Edit-R2 uses reinforcement learning to reconstruct session intent and jointly optimize reasoning and generation for multi-turn image editing. It improves instruction following and consistency over accumulated constraints on the MICE-Bench benchmark.
cIPO aligns text-to-video diffusion by deriving implicit preferences from reconstruction errors and concentrating optimization on high-error temporal segments to fix sparse artifacts.
UniCustom fuses visual-semantic and appearance features before VLM encoding to eliminate cross-reference confusion in multi-reference image generation. Experiments show improved subject consistency, instruction following, and compositional fidelity over baselines.