ROVER pretrains exploration policies via occupancy coverage maximization using a resolvent world model and virtual sink state, yielding stronger initializations for sparse-reward downstream tasks.
Tabular Monte Carlo Exploring Starts can converge to suboptimal policies, but state-specific inverse-frequency learning-rate scaling restores convergence to optimality.
CIG derives a tractable trajectory-level information-gain reward via ensemble disagreement that conditions on replay buffers and rollout prefixes, outperforming prior methods across discrete and continuous exploration tasks.
Controllable Information Production grounds intrinsic motivation in dynamics and control, unifying them to measure controllable information production and outperforming prior methods on robot tasks.