LLM research agents find high-performance models via compressed prompts and feedback, supporting a description-length explanation for limited overfitting.
MURPHY extends GRPO to multi-turn code generation via feedback-conditioned rollout trees with retrospective credit assignment, achieving up to 6% absolute pass@1 gains over prior methods.
Confidence-based verifier-free test-time scaling fails on complex tasks because high initial confidence signals no exploration; consilience selects rollouts by requiring low early but high final confidence, improving reasoning and coding.
Synthetic pre-pre-training improves language model robustness to noisy pre-training data by inhibiting noise self-modeling and reducing required natural-text tokens by up to 49%.