Selective layer looping improves masked diffusion model training efficiency and reasoning performance via depth scaling without added parameters and flexible inference compute scaling.
AMUSE integrates Muon's rapid bulk progress with Schedule-Free averaging via time-varying interpolation to suppress oscillations, requiring no learning rate schedules and improving training efficiency across vision and LLM tasks.