CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 18 votes

Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

QUESTION — Comment entraîner conjointement la capacité de réflexion native et la génération d'images dans un modèle multimodal unifié par apprentissage par renforcement ?

Les auteurs présentent UMM-Reflection, qui applique l'apprentissage par renforcement (RL) à des boucles de réflexion et de correction d'images complètes au sein d'un modèle multimodal unifié. Les trajectoires apparentées partagent une image initiale pour comparer les stratégies via un avantage relatif au groupe, mettant à jour les jetons de réflexion et les révisions basées sur le flux. Sur BAGEL, UMM-Reflection améliore GenEval de 12,05 points par rapport au SFT, avec des gains de transfert sur WISE (+10,97), OneIG-Bench (+3,48) et T2I-CompBench++ (+4,63).

Sur BAGEL, UMM-Reflection améliore GenEval de 12,05 points par rapport au SFT, et les gains se transfèrent à WISE (+10,97), OneIG-Bench (+3,48) et T2I-CompBench++ (+4,63).

Ziqi · 28 sept. 2026 lire l'original ↗
↑