Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
Les auteurs présentent VHD-Play, un pipeline qui inverse la génération standard en échantillonnant et résolvant un modèle mathématique avant qu'un générateur ne transforme le processus de décision en outils à états. Les dynamiques exécutables et les références de notation des trajectoires héritent du même modèle résolu. Le pipeline produit 3 300 environnements d'agents divers pour quelques centimes chacun. L'entraînement de Qwen3.6-35B-A3B sur trois familles élève son score moyen d'agent de 0,204 à 0,815 lors d'un diagnostic à cinq familles, avec des gains sur des benchmarks externes de code et de planification.
Le pipeline produit 3 300 environnements d'agents divers au coût de quelques centimes chacun.
L'entraînement de Qwen3.6-35B-A3B sur trois familles fait passer son score moyen d'agent de 0,204 à 0,815 dans un diagnostic à cinq familles.
Sur E-Commerce Bench, le point de contrôle entraîné complète chaque exécution sans faillite et dépasse Qwen3.7-Max.