Gen-Searcher trains a search-augmented image generation agent via supervised and reinforcement learning, yielding about 16-point gains on knowledge-intensive benchmarks.
SnapMLA improves long-context MLA decoding throughput up to 1.91x via hardware-aware FP8 quantization and pipeline optimization while preserving benchmark quality.
TGRL turns temperature-induced rollout diversity into an explicit RLVR training signal via reward contrast and Jensen-Shannon divergence, accelerating convergence up to 36% while improving math, code, and agent benchmarks.
Structured Defect Grounding models text-to-image failures as structured tuples for diagnosis and alignment, outperforming proprietary vision-language models and improving generation via importance-weighted rewards.
StableVQ decouples encoder-decoder and codebook training via Dynamic STE, Region VQ Loss, and independent schedules to stabilize VQ tokenizers and boost utilization and reconstruction.