CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 95 upvote

OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

CÂU HỎI — Làm thế nào để huấn luyện và đánh giá các mô hình hội thoại âm thanh-hình ảnh bản địa khi dữ liệu thực tế khan hiếm?

Nghiên cứu định nghĩa tác vụ OmniVChat cho đối thoại âm thanh-hình ảnh trực tiếp và giới thiệu OmniVChat-Studio, một công cụ dữ liệu đa tác nhân nhằm tổng hợp các đoạn hội thoại một và nhiều lượt. Họ xây dựng OmniVChat-Bench để đánh giá các khả năng cơ bản và thiết kế phần thưởng học tăng cường OmniVChat-RL để tối ưu hóa độ chính xác, hiệu suất và phong cách phản hồi. Việc huấn luyện mô hình Qwen3-Omni-Instruct bằng khung này cải thiện hiệu suất trên cả benchmark tổng hợp và tập dữ liệu ghi hình thực tế.

OmniVChat-Studio tổng hợp các hội thoại âm thanh-hình ảnh một và nhiều lượt cho việc huấn luyện và đánh giá.

Harland · 18 thg 9, 2026 đọc bản gốc ↗
↑