OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
QUESTION — Comment entraîner et évaluer des modèles de dialogue audio-visuel natif lorsque les données du monde réel sont rares ?
La recherche définit la tâche OmniVChat pour le dialogue audio-visuel direct et présente OmniVChat-Studio, un moteur de données multi-agents pour synthétiser des dialogues à un ou plusieurs tours. Ils construisent OmniVChat-Bench pour évaluer les capacités de base et conçoivent la récompense d'apprentissage par renforcement OmniVChat-RL ciblant l'exactitude, l'efficacité et le style des réponses. L'entraînement de Qwen3-Omni-Instruct avec ce cadre améliore les performances sur les benchmarks synthétisés et les ensembles de données enregistrés par l'homme.
OmniVChat-Studio synthétise des dialogues audio-visuels à un ou plusieurs tours pour l'entraînement et l'évaluation.
Harland · 18 sept. 2026
lire l'original ↗