Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents
Les agents de terminal exécutent des générations de modèles stochastiques, mais des commandes erronées peuvent perturber l'environnement et entraver la progression. Les auteurs étudient Mid-Harness, qui échantillonne et vérifie les actions candidates à la frontière entre le modèle et le harnais avant l'exécution, tout en gardant le générateur intact. Des expériences sur TerminalBench-Lite montrent qu'un vérificateur performant permet au modèle d'exploiter des alternatives utiles, augmentant considérablement la précision Pass@1 à moindre coût de jetons.
Sur TerminalBench-Lite, un vérificateur GPT-5.6 Sol fait passer le Pass@1 de 50,00 % pour l'agent de base à 68,03 % avec 8 actions échantillonnées.
La combinaison de la mise à l'échelle des actions et des trajectoires atteint un succès supérieur pour un coût en jetons estimé inférieur.