World models are formalized as group actions to enforce compositional dynamics via identity, inverse, and composition consistency, improving structural metrics without harming visual quality.
NAVA proposes native audio-visual alignment with an Align-then-Fuse MMDiT architecture for joint audio-video generation, achieving superior synchronization, video quality, and timbre control with 6.3B parameters.
ONE-SHOT factorizes compositional video generation via spatial-decoupled motion injection and hybrid context integration, achieving fine-grained human-environment control and minute-level consistency without 3D alignment.