PermaVid disentangles video memory into RGB appearance and depth structure with edit-aware updates to maintain long-term consistency across modifications.
Visual-ERM is a multimodal generative reward model that evaluates vision-to-code outputs in rendered visual space, improving Qwen3-VL-8B-Instruct by up to 8.4 points and outperforming larger models on fine-grained visual discrepancy benchmarks.