CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 95 votes

OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

QUESTION — Comment entraîner et évaluer des modèles de dialogue audio-visuel natif lorsque les données du monde réel sont rares ?

La recherche définit la tâche OmniVChat pour le dialogue audio-visuel direct et présente OmniVChat-Studio, un moteur de données multi-agents pour synthétiser des dialogues à un ou plusieurs tours. Ils construisent OmniVChat-Bench pour évaluer les capacités de base et conçoivent la récompense d'apprentissage par renforcement OmniVChat-RL ciblant l'exactitude, l'efficacité et le style des réponses. L'entraînement de Qwen3-Omni-Instruct avec ce cadre améliore les performances sur les benchmarks synthétisés et les ensembles de données enregistrés par l'homme.

OmniVChat-Studio synthétise des dialogues audio-visuels à un ou plusieurs tours pour l'entraînement et l'évaluation.

Harland · 18 sept. 2026 lire l'original ↗
↑