The Functionalizer: Lossless Functional Decomposition for Subword Tokenization
CÂU HỎI — Làm thế nào để xử lý các biến thể chữ hoa chữ thường và dấu câu trong tokenization mà không làm phân mảnh không gian embedding?
Nghiên cứu này giới thiệu The Functionalizer, một pre-tokenizer phi tổn thất giúp tách rời các biến thể cấu trúc và chữ viết thành một dòng tiền tố opcode/operand trước khi token hóa. Bằng cách sử dụng các toán tử tham số hóa được mã hóa trong Vùng sử dụng riêng của Unicode cho chữ hoa, dấu phụ và lặp ký tự, phương pháp này cho phép bao phủ toàn bộ văn bản với kích thước từ vựng nhỏ hơn đáng kể. Các thử nghiệm trên mô hình GPT-2 98M-parameter cho thấy phương pháp này cải thiện tính hợp lệ của cú pháp mã nguồn Python và giảm lặp n-gram trong văn bản tự nhiên.
Giảm nhu cầu về số lượng slot từ vựng thực tế lên đến 19.7%.
Cải thiện tính hợp lệ của cú pháp mã nguồn Python lên mức 9.12% so với 7.70% trên mô hình GPT-2 98M-parameter.
mrkwanzaa · 18 thg 9, 2026
đọc bản gốc ↗