Equilibrium Matching learns implicit energy landscapes for optimization-based sampling, surpassing diffusion models with 1.90 FID on ImageNet 256x256 while supporting denoising, OOD detection, and composition.
Equilibrium Forcing removes noise conditioning from video diffusion to enable adaptive closed-loop inference that improves generation quality and consistency.
Masked Visual Actions expresses robot and object motion as revealed pixel trajectories to unify forward dynamics, planning, and inverse modeling in video world models with minimal finetuning.
Temporal Backtracking Search improves video reasoning by searching over the temporal axis and restarting from verified prefixes rather than resampling from scratch, achieving 22.7% versus 0.7% best-of-N out-of-distribution.
SyncWorld learns action-visual mappings via visual calibration episodes to serve as zero-shot simulators across unseen robot settings without retraining.
Action Images formulates robot policy learning as multiview video generation using interpretable pixel-grounded action images, enabling zero-shot control without separate policy heads and improving video-action joint generation.
MoSE3 predicts dense per-pixel world-space SE(3) motion from monocular video via point tracks and rigidity embeddings, achieving state-of-the-art 6-DoF estimation and 3D tracking.