CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 106 votes

Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

QUESTION — L'allocation de calcul au moment de l'inférence à la frontière entre le modèle et le harnais peut-elle améliorer la fiabilité des actions des agents de terminal?

Les agents de terminal exécutent des générations de modèles stochastiques, mais des commandes erronées peuvent perturber l'environnement et entraver la progression. Les auteurs étudient Mid-Harness, qui échantillonne et vérifie les actions candidates à la frontière entre le modèle et le harnais avant l'exécution, tout en gardant le générateur intact. Des expériences sur TerminalBench-Lite montrent qu'un vérificateur performant permet au modèle d'exploiter des alternatives utiles, augmentant considérablement la précision Pass@1 à moindre coût de jetons.

Sur TerminalBench-Lite, un vérificateur GPT-5.6 Sol fait passer le Pass@1 de 50,00 % pour l'agent de base à 68,03 % avec 8 actions échantillonnées.

La combinaison de la mise à l'échelle des actions et des trajectoires atteint un succès supérieur pour un coût en jetons estimé inférieur.

Nardien · 30 sept. 2026 lire l'original ↗
↑