StayFair decomposes diffusion bias into model and guidance components, deriving a guidance-scale-invariant fairness condition and algorithms that maintain group fairness across all guidance scales without quality loss.
ExAUL provides online conformal abstention under adversarial bandit feedback with O(sqrt(T)) FDR control via feedback unlocking and a regret-to-FDR conversion lemma.
A reasoning-prefix masking framework distills think-answer visual reasoning into compact VLMs by masking salient reasoning cues to force visual anchoring, improving multimodal benchmarks over prior distillation methods.
Hi-Q hierarchically refines multi-hop queries via evidence-guided resolution and expansion, outperforming iterative and graph-based retrieval baselines on full-corpus benchmarks.
Online RLHF with generalized bilinear preferences achieves polylogarithmic regret via generic strong convexity and skew-symmetry, proving fast rates are not KL-specific.
CAFT learns local text-region alignments before global image-text matching via hierarchical encoders, achieving state-of-the-art long-caption retrieval without region supervision.