Tailor-Bench evaluates visual world models on rare physical interactions via regular, unconventional, and impossible scenarios, revealing long-tail performance gaps and superficial visual-pattern reliance.
Large reasoning models use hidden critique abilities to recover from uncorrected reasoning errors, and steering with critique vectors improves error detection and test-time scaling without training.