CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 42 upvote

Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

CÂU HỎI — Liệu việc áp dụng giám sát lên các token quan sát trong quá trình tinh chỉnh có cải thiện cách các agent khám phá dưới học tăng cường không?

Bài báo xem xét quy chuẩn chỉ áp dụng hàm mất mát cho các token hành động do agent tạo ra trong quá trình tinh chỉnh có giám sát (SFT), và đề xuất ActObs để giám sát cả các token quan sát. Bằng cách huấn luyện mô hình dự đoán hệ quả của hành động mà không cần thêm dữ liệu hay tham số, phương pháp này ngăn chặn việc gradient hành động và quan sát trở nên trực giao. Trên Qwen3-4B, GRPO từ ActObs đạt điểm pass@k cao hơn trên Terminal-Bench 2.0 so với phương pháp chỉ dựa vào hành động. Trên Qwen3-8B, nó tăng pass@16 thêm +3.4 pp và mang lại lợi thế mở rộng sang nhiệm vụ chỉnh sửa mã nguồn đa miền trên aider-polyglot với +4.2 pp ở pass@1 tại cấu hình 4B. Giám sát chung giúp duy trì entropy tốt hơn trong suốt quá trình RL.

Trên Qwen3-8B, phương pháp này cải thiện pass@16 thêm +3.4 pp.

juzhengz · 17 thg 9, 2026 đọc bản gốc ↗
↑