MoSE3 predicts dense per-pixel world-space SE(3) motion from monocular video via point tracks and rigidity embeddings, achieving state-of-the-art 6-DoF estimation and 3D tracking.
SceneAligner localizes images in large-scale floorplans by aligning 3D-reconstructed density proxies via adapted 2D foundation model correspondences, improving accuracy with sparse inputs.