Program-Verified Self-Evolution for Vision-Language Models
Les auteurs proposent Verifiable QA Generation for Self-Evolving Models (VQS) pour résoudre le problème des étiquettes erronées dans l'auto-évolution des modèles vision-langage. Au lieu de voter sur les réponses, VQS analyse les images pour en faire des enregistrements structurés et utilise des programmes fixes pour générer des questions et calculer les réponses. Le modèle sert uniquement de vérificateur visuel localisé. Testé sur dix benchmarks, VQS améliore considérablement la précision des modèles Qwen3-VL au fil des cycles d'entraînement.
24% des étiquettes par vote majoritaire et 18% des étiquettes par modèle juge produites lors de l'auto-évolution sont erronées.
Les évaluateurs humains trouvent 94% des réponses VQS correctes, contre 76% pour le vote majoritaire.
Sur dix benchmarks, VQS améliore Qwen3-VL jusqu'à 3.18 points aux échelles 2B, 4B et 8B.