OmniHarness: Harnessing Generalizable Visual Generation via Symbolic Policy Learning
Nhóm tác giả giới thiệu OmniHarness, một framework khai thác symbolic policy learning để nâng cao khả năng sinh hình ảnh tổng quát trong các multimodal large language models và multi-agent systems. Hệ thống này trừu tượng hóa các quá trình thực thi thành symbolic policies, đồng thời sử dụng cơ chế kiểm tra trung gian và tự học hỏi qua việc thực thi các tác vụ mô phỏng cận giới hạn năng lực. Các chính sách này có thể tái sử dụng theo dạng plug-and-play để cải thiện các visual agent hiện có mà không cần chạm vào model parameters. Kết quả cho thấy OmniHarness đạt 95.0% resolve rate trên ComfyBench's Creative tasks, vượt qua baseline mạnh nhất 27.5 percentage points.
OmniHarness đạt 95.0% resolve rate trên ComfyBench's Creative tasks, vượt baseline mạnh nhất 27.5 percentage points.
Khung làm việc được kiểm thử qua sáu benchmarks, ba MLLM backbones và ba visual agent frameworks.
Quá trình tinh chỉnh chính sách diễn ra liên tục trong khi model parameters được giữ nguyên.