CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 15 upvote

OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

CÂU HỎI — OmniSeek biến đổi Omni-LLM thành một agent suy luận audio-visual đa lượt bằng cách nào?

Bài báo giới thiệu OmniSeek, một framework agentic giúp chuyển đổi Omni Large Language Model thành một agent suy luận đa lượt chủ động với khả năng sử dụng tool bản địa. Thay vì xử lý thụ động toàn bộ chuỗi audio-visual trong một forward pass đơn lẻ, OmniSeek biến việc thu thập bằng chứng thành một phần của quá trình suy luận bằng cách quyết định động thời điểm nhìn hoặc nghe qua các cửa sổ thời gian khác nhau. Họ xây dựng một data engine tổng hợp tập dữ liệu OmniTraj-170K chứa các chuỗi Chain-of-Thought đa bước, huấn luyện giám sát mô hình và tối ưu hóa policy thông qua reinforcement learning hai giai đoạn với phần thưởng có thể kiểm chứng. Các thí nghiệm cho thấy OmniSeek cải thiện hiệu suất suy luận audio-visual.

OmniSeek chuyển đổi Omni-LLM thành agent suy luận đa lượt với native tool use.

Data engine tổng hợp OmniTraj-170K bao gồm các quỹ đạo Chain-of-Thought đa bước với bằng chứng audio và visual xen kẽ.

Sử dụng reinforcement learning hai giai đoạn với verifiable rewards kết hợp Audio-Visual Necessity objective.

WHB139426 · 01 thg 10, 2026 đọc bản gốc ↗
↑