Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models
QUESTION — Comment atténuer les hallucinations de mise en correspondance confondues par la source dans les grands modèles de langage audio-visuels ?
Les auteurs identifient un mécanisme de relais de questions dans les grands modèles de langage audio-visuels où les états de questions portent des indices interférents provenant de modalités inutilisées. Pour y remédier, ils proposent SECRET, une méthode sans entraînement qui réoriente les représentations des questions vers les preuves de la source requise. Les expériences sur CMM et AVHBench montrent que SECRET réduit les hallucinations de +18.0 et +7.1 percentage points.
SECRET consistently outperforms prior training-free methods, substantially mitigating source-confused grounding hallucinations (e.g., up to +18.0 and +7.1 percentage points over base models).
271754echo · 29 sept. 2026
lire l'original ↗