Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models
CÂU HỎI — Làm thế nào để giảm thiểu hiện tượng ảo giác do xung đột đa phương thức tại tầng truyền tin câu hỏi trong các mô hình AVLLM?
Nhóm nghiên cứu phát hiện cơ chế truyền câu hỏi (question-relay) trong các mô hình ngôn ngữ lớn audio-visual (AVLLM), nơi các trạng thái câu hỏi mang theo tín hiệu nhiễu từ các modality không dùng đến. Họ đề xuất phương pháp không cần huấn luyện SECRET để điều hướng trạng thái câu hỏi về phía bằng chứng nguồn cần thiết. Thử nghiệm trên CMM và AVHBench cho thấy SECRET vượt trội hơn các phương pháp cũ với mức giảm ảo giác cao tới +18.0 và +7.1 điểm phần trăm.
SECRET consistently outperforms prior training-free methods, substantially mitigating source-confused grounding hallucinations (e.g., up to +18.0 and +7.1 percentage points over base models).
271754echo · 29 thg 9, 2026
đọc bản gốc ↗