MultiTalk introduces 57.6k hours of synthetic multi-party bilingual dialogue data and MultiTalkBench for long-form full-duplex evaluation, training a model that sustains coherent extended multi-party English-Chinese conversation and outperforms open-source baselines.
TELEVAL benchmarks Chinese spoken language models on interactional audio-conditioned dialogue, finding competitive semantic accuracy but degraded interactional performance under acoustic variability and a recurring caption trap failure.