PRPO incorporates column-permutation invariance into LLM post-training via label-preserving permutations and two-level advantage estimation, enabling an 8B model to match specialized tabular baselines and outperform 685B reasoning LLMs by up to 53%.
Direct forecasting ignores cross-variable future dependencies, so adding CvLoss regularizes forecast residuals on cross-variable graphs to improve multivariate time series forecasting accuracy.
HumanoidArena benchmarks egocentric hierarchical whole-body learning via seven leg-critical tasks, finding policies solve diverse interactions but cross-tracker transfer remains fragile.