The Functionalizer: Lossless Functional Decomposition for Subword Tokenization
Cet article présente The Functionalizer, un cadre de pré-tokenisation sans perte qui décompose les variations orthographiques et structurelles en un flux de préfixes d'opcode/opérande compositionnel avant la tokenisation. En utilisant des opérateurs de transformation paramétrés encodés dans la zone d'utilisation privée Unicode pour la casse, les diacritiques et la répétition de caractères, le cadre atteint une couverture complète du corpus avec des vocabulaires nettement plus petits. Des évaluations en aval sur des modèles GPT-2 de 98M-parameter démontrent qu'il améliore la validité de la syntaxe du code Python tout en réduisant la répétition de n-grammes en double dans la prose en langage naturel.
Il réduit les besoins réels en emplacements de vocabulaire jusqu'à 19.7%.
Il améliore la validité de la syntaxe du code Python (9.12% vs. 7.70%) sur des modèles GPT-2 de 98M-parameter.