Under lossy context compression, larger compressors reduce reconstruction error but increase unfaithfulness via knowledge overwriting and semantic drift, violating scaling laws for faithful preservation.
OASES co-trains a search policy and adaptive evaluator to provide outcome-aligned process rewards, outperforming RL baselines on multi-hop QA benchmarks.
Flow matching for generative segmentation suffers gradient vanishing and trajectory traversing, causing slow convergence and poor class separation; reshaping the velocity field with distance-aware corrections and Kronecker-based category encoding narrows the gap with discriminative specialists.
World models are formalized as group actions to enforce compositional dynamics via identity, inverse, and composition consistency, improving structural metrics without harming visual quality.
MedHorizon benchmarks long medical video understanding via sparse evidence retrieval and multi-hop reasoning, with top models reaching only 41.1% accuracy.
NAVA proposes native audio-visual alignment with an Align-then-Fuse MMDiT architecture for joint audio-video generation, achieving superior synchronization, video quality, and timbre control with 6.3B parameters.
ONE-SHOT factorizes compositional video generation via spatial-decoupled motion injection and hybrid context integration, achieving fine-grained human-environment control and minute-level consistency without 3D alignment.
Knowledge-graph paths provide intermediate supervision for self-evolving search agents, improving question validity via relational context and solver rewards via waypoint coverage, boosting multi-hop QA across benchmarks.