LINC explicitly computes local routing consequences to score actions via shared linear comparison and context modulation, improving neural routing baselines especially at larger scales.
NS-VLA introduces neuro-symbolic encoding and hierarchical optimization to improve robotic manipulation generalization and exploration over prior VLA methods.
HDR integrates hierarchical tree-structured latents into causal video generation to enable coarse-to-fine multi-step visual reasoning with sparse attention, boosting reasoning success by 76% over streaming diffusion while running 54x faster than bidirectional diffusion.
SwiftVLM introduces cross-layer token bypass to preserve visual tokens across pruning stages, enabling training-free vision-language model acceleration with superior accuracy-efficiency trade-offs.