VideoRLVR applies reinforcement learning with verifiable rewards to video diffusion models, improving rule-consistent visual reasoning and cutting training latency 40% via early-step optimization.
Multimodal LLMs suffer spurious cross-modality interference that distorts decisions, and a unified finetuning framework with perturbation augmentation and consistency regularization improves robustness and generalization.
Linear self-attention transformers provably implement in-context policy-improvement via explicit constructions, with gradient flow converging exponentially to optimal RL update parameters under distribution richness conditions.
ModelLens learns a latent space over model-dataset-metric tuples from noisy leaderboard data to rank unseen models on unseen datasets without target evaluation, improving routing by up to 81%.