onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
QUESTION — Comment annoter efficacement les données d'alignement pour les LLM et les agents à l'aide d'une correction au niveau des tokens ?
Les auteurs présentent onPanda, un outil interactif pour annoter efficacement les données d'alignement de LLM et les trajectoires d'agents grâce à la correction au niveau des tokens. Plutôt que de réécrire manuellement, l'annotateur localise le premier token inapproprié et choisit un substitut ou édite librement le texte. Le système tronque ensuite la suite et reprend la génération à partir de ce préfixe corrigé. En répétant cette boucle, on réduit les coûts de labélisation tout en préservant la distribution d'échantillonnage pour générer des données SFT et de préférence on-policy, avec une intégration possible d'outils externes.
onPanda reduces median annotation time by 52% over manual post-editing.
LichengLiu03 · 21 sept. 2026
lire l'original ↗