CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 8 upvote

SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

CÂU HỎI — Làm thế nào để loại bỏ hiện tượng gán nhầm tín hiệu phần thưởng chéo phân đoạn trong quá trình học tăng cường gọi công cụ của LLM?

Các tác giả đề xuất SLCA-GRPO, một khung huấn luyện giải quyết hiện tượng gán nhầm tín hiệu phần thưởng chéo phân đoạn do việc phát tán đồng nhất điểm lợi thế (advantage) trên toàn bộ chuỗi token trong các thuật toán như GRPO. Khung này tích hợp phân công tín hiệu theo phân đoạn khóa (SLCA) cùng với Trình mô phỏng LLM hướng dẫn bằng lược đồ (SGLS) và Phần thưởng phân cấp (HierR). Nhờ định tuyến lợi thế thực thi đến token công cụ và lợi thế ưu tiên đến token tóm tắt, phương pháp này loại bỏ ô nhiễm lợi thế mà không cần thêm các lượt sinh (rollouts) từ trạng thái trung gian. Trên nền tảng 7B, SLCA-GRPO cải thiện đáng kể độ chính xác và tốc độ hội tụ so với GRPO chuẩn.

Trên nền tảng 7B, SLCA-GRPO vượt trội hơn chuẩn GRPO, ToolPO và RLTR với mức tăng +2,53 pp trên tập đánh giá trong miền.

Phương pháp đạt +1,36 pp trên Berkeley Function-Calling Leaderboard (BFCL).

Mô hình đạt +9,15 pp trên τ^2-Bench dưới cùng ngân sách huấn luyện.

YanZhanPKU · 24 thg 9, 2026 đọc bản gốc ↗
↑