A systematic comparison of general agent architectures finds backbone choice dominates performance while architecture shifts results up to 12pp, and open models suffer generality sinks.
SyncWorld learns action-visual mappings via visual calibration episodes to serve as zero-shot simulators across unseen robot settings without retraining.