CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 208 votes

Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

QUESTION — Comment améliorer la supervision des trajectoires de raisonnement latent dans les MLLM ?

L'article étudie le comportement des tokens latents dans les MLLM et identifie un écart de crédit de preuve latente, où les tokens latents réagissent faiblement aux perturbations d'images. Pour combler cet écart, les auteurs proposent ReaLVR, qui introduit une supervision par preuve visuelle dans les trajectoires latentes libres du modèle en contrastant les réponses correctes et erronées générées par le modèle. Cette approche atteint les meilleures performances sur Qwen2.5-VL-7B et s'adapte aux modèles de pointe jusqu'à 235B paramètres.

Atteignant la moyenne la plus élevée sur cinq tâches de 63,7 % sur Qwen2.5-VL-7B.

Mettant à l'échelle le raisonnement visuel dans l'espace latent jusqu'à des échelles de modèles de pointe de 235B.

MarkShaw99 · 28 sept. 2026 lire l'original ↗
↑