Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL
Bài báo xem xét quy chuẩn chỉ áp dụng hàm mất mát cho các token hành động do agent tạo ra trong quá trình tinh chỉnh có giám sát (SFT), và đề xuất ActObs để giám sát cả các token quan sát. Bằng cách huấn luyện mô hình dự đoán hệ quả của hành động mà không cần thêm dữ liệu hay tham số, phương pháp này ngăn chặn việc gradient hành động và quan sát trở nên trực giao. Trên Qwen3-4B, GRPO từ ActObs đạt điểm pass@k cao hơn trên Terminal-Bench 2.0 so với phương pháp chỉ dựa vào hành động. Trên Qwen3-8B, nó tăng pass@16 thêm +3.4 pp và mang lại lợi thế mở rộng sang nhiệm vụ chỉnh sửa mã nguồn đa miền trên aider-polyglot với +4.2 pp ở pass@1 tại cấu hình 4B. Giám sát chung giúp duy trì entropy tốt hơn trong suốt quá trình RL.
Trên Qwen3-8B, phương pháp này cải thiện pass@16 thêm +3.4 pp.