COLLAR progressively optimizes object-level diffusion features via field-of-view expansion to improve conditional generation quality and spatial control without training.
FASTER accelerates real-time flow vision-language-action models via horizon-aware sampling that compresses immediate-action denoising into one step, slashing reaction latency on dynamic robot tasks.