Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents
Les agents omnimodaux ont du mal à planifier en plusieurs étapes en raison de l'accumulation d'observations bruyantes dans l'historique de conversation. Les auteurs proposent Omni-Decision, un agent basé sur la planification par registre de preuves qui remplace l'historique de dialogue croissant par un registre explicite suivant les preuves confirmées et les conflits. Un critique filtre les observations brutes, ne transmettant que le contenu utilisable afin que le planificateur opère sur un contexte compact. Grâce à un fine-tuning supervisé et à un apprentissage par renforcement au niveau de la décision, Omni-Decision atteint une précision de 81,4 % sur OmniGAIA pour environ 43 % du coût par question de Gemini-3.1-Pro, et égale les meilleurs modèles de bout en bout sur WorldSense.
Atteint une précision de pointe de 81,4 % sur OmniGAIA pour environ 43 % du coût par question de Gemini-3.1-Pro.
Obtient 65,0 % sur la compréhension de vidéos longues WorldSense, à égalité avec le modèle de bout en bout le plus puissant.