SWE Atlas benchmarks coding agents on codebase Q&A, test writing, and refactoring, finding frontier models lead but all struggle with edge cases and engineering quality.
SDBPG adaptively perturbs dual formulations to stabilize multipliers near lower-level stationary points, yielding first explicit sample-complexity guarantees for stochastic nonconvex simple bilevel optimization.