CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 17 votes

The Functionalizer: Lossless Functional Decomposition for Subword Tokenization

QUESTION — Comment la tokenisation par sous-mots peut-elle gérer les variations orthographiques et structurelles sans fragmenter l'espace d'incorporation ni perdre d'informations ?

Cet article présente The Functionalizer, un cadre de pré-tokenisation sans perte qui décompose les variations orthographiques et structurelles en un flux de préfixes d'opcode/opérande compositionnel avant la tokenisation. En utilisant des opérateurs de transformation paramétrés encodés dans la zone d'utilisation privée Unicode pour la casse, les diacritiques et la répétition de caractères, le cadre atteint une couverture complète du corpus avec des vocabulaires nettement plus petits. Des évaluations en aval sur des modèles GPT-2 de 98M-parameter démontrent qu'il améliore la validité de la syntaxe du code Python tout en réduisant la répétition de n-grammes en double dans la prose en langage naturel.

Il réduit les besoins réels en emplacements de vocabulaire jusqu'à 19.7%.

Il améliore la validité de la syntaxe du code Python (9.12% vs. 7.70%) sur des modèles GPT-2 de 98M-parameter.

mrkwanzaa · 18 sept. 2026 lire l'original ↗
↑