CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 9 votes

Program-Verified Self-Evolution for Vision-Language Models

QUESTION — Comment éliminer les étiquettes erronées produites par vote majoritaire ou par modèle juge lors de l'auto-évolution des modèles vision-langage ?

Les auteurs proposent Verifiable QA Generation for Self-Evolving Models (VQS) pour résoudre le problème des étiquettes erronées dans l'auto-évolution des modèles vision-langage. Au lieu de voter sur les réponses, VQS analyse les images pour en faire des enregistrements structurés et utilise des programmes fixes pour générer des questions et calculer les réponses. Le modèle sert uniquement de vérificateur visuel localisé. Testé sur dix benchmarks, VQS améliore considérablement la précision des modèles Qwen3-VL au fil des cycles d'entraînement.

24% des étiquettes par vote majoritaire et 18% des étiquettes par modèle juge produites lors de l'auto-évolution sont erronées.

Les évaluateurs humains trouvent 94% des réponses VQS correctes, contre 76% pour le vote majoritaire.

Sur dix benchmarks, VQS améliore Qwen3-VL jusqu'à 3.18 points aux échelles 2B, 4B et 8B.

ahmedheakl · 27 sept. 2026 lire l'original ↗
↑