Tailor-Bench evaluates visual world models on rare physical interactions via regular, unconventional, and impossible scenarios, revealing long-tail performance gaps and superficial visual-pattern reliance.
MemReward propagates rewards through a heterogeneous rollout graph to enable LLM reinforcement learning using only 20% ground-truth labels and achieves over 96% of oracle performance.
MemSkill learns and evolves reusable memory skills for extracting and revising agent memories via selection, execution, and design loops, improving long-context task performance.