Bellman Policy Optimization
CÂU HỎI — Làm thế nào để cải thiện khả năng suy luận của mô hình ngôn ngữ lớn thông qua học tăng cường với phần thưởng xác thực mà không cần ước lượng giá trị trạng thái trung gian?
Bài báo giới thiệu Bellman Policy Optimization (BPO), một phương pháp không cần chỉ trích (critic-free) được dẫn xuất từ Policy Mirror Descent (PMD) dành cho học tăng cường với phần thưởng xác thực (RLVR). Đối với việc sinh tự hồi quy với phần thưởng kết thúc, BPO sử dụng các phương trình Bellman để định hình lại PMD thành một hàm mục tiêu cấp độ quỹ đạo, qua đó tránh được việc ước lượng giá trị trạng thái ở các trạng thái trung gian. Nghiên cứu chứng minh phương pháp này có chung nghiệm tối ưu duy nhất như mục tiêu PMD gốc và xây dựng hàm mất mát thực tế với trọng số hiệu chỉnh độ lệch dựa trên tỷ lệ xác suất token bổ sung đã được làm mượt.
Mat3579 · 14 thg 9, 2026
đọc bản gốc ↗