SGRPO directly rewards set-level diversity via leave-one-out contributions in a flexible GRPO framework, expanding the utility-diversity Pareto frontier across biomolecular design tasks.
VSearcher uses reinforcement learning to turn static multimodal models into long-horizon web search agents that surpass proprietary models on multimodal search benchmarks.
EcoGym benchmarks long-horizon LLM economic planning across open-source environments, revealing no single model dominates and exposing strategic and execution suboptimalities.
MineEvolve converts Minecraft execution feedback into structured skills and remedies via Monitor, Inducer, Curator, and Adaptor, improving long-horizon agent performance across planners.