Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
Các tác giả giới thiệu VHD-Play, một pipeline đảo ngược quy trình thông thường bằng cách lấy mẫu và giải quyết một mô hình toán học trước, sau đó mới dùng corpus-grounded setter để chuyển quy trình quyết định thành các stateful tool. Động lực thực thi và tài liệu tham khảo chấm điểm quỹ đạo đều được kế thừa từ chính mô hình đã giải quyết đó. Pipeline này sản xuất 3.300 môi trường agent với chi phí vài xu mỗi môi trường. Khi huấn luyện mô hình Qwen3.6-35B-A3B trên ba họ môi trường, điểm số agent trung bình tăng từ 0.204 lên 0.815 trong bài kiểm tra năm họ, đồng thời vượt trội trên cả các benchmark bên ngoài về gọi hàm, lập lịch du lịch và thương mại điện tử.
Pipeline sản xuất 3.300 môi trường agent đa dạng với chi phí vài xu mỗi môi trường.
Huấn luyện Qwen3.6-35B-A3B trên ba họ nâng điểm số agent trung bình từ 0.204 lên 0.815 trong bài kiểm tra năm họ.
Checkpoint hoàn thành mọi lượt chạy mà không bị bankruptcy và vượt qua Qwen3.7-Max trên E-Commerce Bench.