CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 15 votes

OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

QUESTION — Comment OmniSeek transforme-t-il un Omni-LLM en agent de raisonnement audio-visuel multi-tour ?

L'article présente OmniSeek, un framework agentic qui transforme un Omni Large Language Model en un agent de raisonnement multi-tour actif doté d'une utilisation d'outils native. Plutôt que de traiter passivement une séquence audio-visuelle entière en une seule passe avant, OmniSeek intègre l'acquisition de preuves dans le processus de raisonnement en décidant dynamiquement de regarder ou d'écouter sur des fenêtres temporelles. Ils construisent un moteur de données synthétisant OmniTraj-170K contenant des trajectoires Chain-of-Thought multi-sauts, supervisent le modèle sur celles-ci et optimisent la politique via un apprentissage par renforcement en deux étapes avec des récompenses vérifiables. Les expériences montrent qu'OmniSeek améliore les performances de raisonnement audio-visuel.

OmniSeek transforme un Omni-LLM en agent de raisonnement multi-tour avec une utilisation d'outils native.

Un moteur de données synthétise OmniTraj-170K, un corpus de trajectoires Chain-of-Thought multi-sauts avec des preuves audio et visuelles entrelacées.

Un apprentissage par renforcement en deux étapes avec des récompenses vérifiables et un objectif Audio-Visual Necessity optimise la politique.

WHB139426 · 01 oct. 2026 lire l'original ↗
↑