IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis
CÂU HỎI — Làm thế nào để khắc phục hiện tượng ghép cặp vai trò và nhiễu ngữ cảnh trong các tác vụ deep search agent bằng phương pháp tổng hợp lặp?
Nghiên cứu đề xuất IterSynth, một hệ thống tác nhân tìm kiếm sâu tách rời vai trò lập kế hoạch và tổng hợp thông tin, sử dụng bộ nhớ tóm tắt tiến hóa để giảm thiểu nhiễu ngữ cảnh. Để huấn luyện hệ thống, nhóm tác giả phát triển thuật toán Role-Decooupled Policy Optimization (RDPO) kết hợp phần thưởng kết quả với đánh giá tiêu chí theo từng lượt tương tác. Thử nghiệm trên năm benchmark tìm kiếm dài hạn cho thấy mô hình IterSynth-8B đạt điểm trung bình 50.7, vượt qua mô hình tác nhân <=8B mạnh nhất trước đó +4.2%.
IterSynth-8B achieves an average score of 50.7, surpassing the strongest prior leq8B agent by +4.2%.
wuxingyu · 24 thg 9, 2026
đọc bản gốc ↗