Component-Based OOD Detection decomposes inputs into functional components via Component Shift Score and Compositional Consistency Score, improving coarse- and fine-grained out-of-distribution detection without training.
AnyMo introduces OmniHuMo dataset with 5,000 hours of multimodal motion data and proposes a masked modeling framework for scalable any-modality conditional motion synthesis with flexible spatial and stylistic control.
CaC advances video reward models via hierarchical spatiotemporal concentrating, improving fine-grained anomaly accuracy by 25.7% and reducing generated-video anomalies by 11.7%.
GraDE uses a graph diffusion estimator to score subgraph typicality and discovers large-scale neural architecture motifs with up to 30x higher median frequency than sampling methods.
Realtime-VLA FLASH uses a draft model and parallel verification to replace most full diffusion-based VLA inference rounds with faster speculative ones, cutting average latency 3.04x to 19.1 ms.
Dynamical Adapter Fusion derives optimal coefficients via PAC-Bayes and Taylor expansion to fuse task-specific adapters into one global adapter, achieving state-of-the-art class-incremental learning results.
Multi-token Residual Prediction predicts next-step residuals via hidden states to denoise more tokens per pass, accelerating diffusion language models up to 1.4x or recovering up to 22.6 accuracy points on HumanEval.
Knowledge-graph paths provide intermediate supervision for self-evolving search agents, improving question validity via relational context and solver rewards via waypoint coverage, boosting multi-hop QA across benchmarks.