Latent visual reasoning enhances multimodal training despite being largely unused at inference; attention-based reinforcement learning preserves its benefits by promoting latent-text interaction during training.
Under misspecified preference oracles, online LLM alignment minimizes a worst-case objective that decomposes into loss plus a sensitivity penalty, with projected updates achieving near-optimal complexity.