Looped reasoning models converge to cyclic fixed points that stabilize attention and repeat feedforward inference stages iteratively, with recurrence size and normalization affecting stability.
KV-compressibility is a learnable property, so KV-CAT trains transformers via masked KV slots to yield representations more amenable to post-hoc compression without sacrificing quality.
MUX compresses reasoning into continuous multiplexed tokens via lossless superposition, accelerating reasoning and outperforming latent baselines across 32 settings.