Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL
L'article examine la convention d'appliquer la perte uniquement aux jetons d'action écrits par l'agent lors du réglage fin supervisé (SFT) et introduit ActObs pour superviser également les jetons d'observation. En entraînant le modèle à prédire les conséquences des actions sans ajouter de données ou de paramètres, cette méthode empêche les gradients d'action et d'observation de devenir orthogonaux. Sur Qwen3-4B, le GRPO d'ActObs atteint un pass@k plus élevé sur Terminal-Bench 2.0. Sur Qwen3-8B, il augmente le pass@16 de +3,4 pp et étend les avantages à l'édition de code multi-domaine sur aider-polyglot avec +4,2 pp au pass@1 pour 4B.
Sur Qwen3-8B, il échange une certaine fiabilité de pass@1 contre un pass@k plus élevé (+3,4 pp au pass@16) et résout des tâches plus distinctes.