OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning
Bài báo giới thiệu OmniSeek, một framework agentic giúp chuyển đổi Omni Large Language Model thành một agent suy luận đa lượt chủ động với khả năng sử dụng tool bản địa. Thay vì xử lý thụ động toàn bộ chuỗi audio-visual trong một forward pass đơn lẻ, OmniSeek biến việc thu thập bằng chứng thành một phần của quá trình suy luận bằng cách quyết định động thời điểm nhìn hoặc nghe qua các cửa sổ thời gian khác nhau. Họ xây dựng một data engine tổng hợp tập dữ liệu OmniTraj-170K chứa các chuỗi Chain-of-Thought đa bước, huấn luyện giám sát mô hình và tối ưu hóa policy thông qua reinforcement learning hai giai đoạn với phần thưởng có thể kiểm chứng. Các thí nghiệm cho thấy OmniSeek cải thiện hiệu suất suy luận audio-visual.
OmniSeek chuyển đổi Omni-LLM thành agent suy luận đa lượt với native tool use.
Data engine tổng hợp OmniTraj-170K bao gồm các quỹ đạo Chain-of-Thought đa bước với bằng chứng audio và visual xen kẽ.
Sử dụng reinforcement learning hai giai đoạn với verifiable rewards kết hợp Audio-Visual Necessity objective.