CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 156 votes

MaLiang-Harness: A Programmable Path to Image and Video Generation

QUESTION — Comment combler l'écart entre le programme et le rendu visuel dans la génération guidée par MLLM grâce à un processus persistant de construction, d'inspection et de révision ?

L'article définit la divergence entre programme et visuel (P2V) et présente MaLiang-Harness, un cadre unifié organisant la génération visuelle pilotée par MLLM en un processus persistant de construction, d'inspection et de révision. Il préserve les programmes via la génération exécutable persistante (PEG), relie les modifications au rendu via le processus de génération traçable (TGP) et vérifie les révisions. L'évaluation sur des benchmarks met en évidence les taux de réussite et les limites des scores généraux des modèles.

MaLiang-Harness résout la divergence entre programme et visuel grâce aux mécanismes PEG, TGP et REV.

GPT-6-Astra atteint 100 % de réussite de génération sur les deux benchmarks évalués.

96,0 % des tâches d'image et 76,9 % des tâches vidéo de GPT-6-Astra satisfont à tous les seuils de qualité.

ZhaoHaoyuu · 28 sept. 2026 lire l'original ↗
↑