CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 18 votes

Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

QUESTION — Comment générer systématiquement divers environnements d'apprentissage par renforcement pour agents avec des signaux de résultat fiables?

Les auteurs présentent VHD-Play, un pipeline qui inverse la génération standard en échantillonnant et résolvant un modèle mathématique avant qu'un générateur ne transforme le processus de décision en outils à états. Les dynamiques exécutables et les références de notation des trajectoires héritent du même modèle résolu. Le pipeline produit 3 300 environnements d'agents divers pour quelques centimes chacun. L'entraînement de Qwen3.6-35B-A3B sur trois familles élève son score moyen d'agent de 0,204 à 0,815 lors d'un diagnostic à cinq familles, avec des gains sur des benchmarks externes de code et de planification.

Le pipeline produit 3 300 environnements d'agents divers au coût de quelques centimes chacun.

L'entraînement de Qwen3.6-35B-A3B sur trois familles fait passer son score moyen d'agent de 0,204 à 0,815 dans un diagnostic à cinq familles.

Sur E-Commerce Bench, le point de contrôle entraîné complète chaque exécution sans faillite et dépasse Qwen3.7-Max.

taesiri · 23 sept. 2026 lire l'original ↗
↑