CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 80 votes

UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

QUESTION — Comment améliorer les modèles multimodaux grâce à des retours d'auto-correction lors de l'inférence sans nécessiter de teacher externe ?

Cet article présente UniEvo-VL, un cadre auto-évolutif permettant aux modèles multimodaux d'apprendre à partir de retours d'auto-correction constructifs lors du calcul à l'inférence. Au lieu de s'appuyer sur un teacher externe plus grand, UniEvo-VL utilise les propres critiques du modèle comme information privilégiée, un seul modèle multimodal jouant à la fois le rôle de teacher et de student selon le contexte. L'entraînement minimise la divergence par état entre leurs distributions de diffusion de débruitage. Les expériences sur Qwen-image-2512 montrent des gains de performance significatifs, passant de 0,747 à 0,808 sur GenEval et de 32,97 à 35,53 sur GenEval2 Soft-TIFA.

UniEvo-VL améliore les capacités de génération d'images des modèles multimodaux sans s'appuyer sur un teacher externe.

Les performances sur GenEval passent de 0,747 à 0,808.

Les performances sur GenEval2 Soft-TIFA passent de 32,97 à 35,53.

fangwu97 · 30 sept. 2026 lire l'original ↗
↑