CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — multimodal 55 votes

All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts

QUESTION — Comment pouvons-nous construire un reconnaisseur de texte de scène multilingue tout-en-un qui soit plus léger et plus précis que les VLM et les experts par langue ?

Les auteurs présentent TextMuSS-10M, un grand jeu de données synthétiques couvrant 10 écritures et 229 langues, ainsi que ScriptMoE, une architecture Mixture-of-Experts consciente de l'écriture. ScriptMoE partage un encodeur visuel unique et remplace le décodeur dense par un bloc sparse MoE utilisant un routeur au niveau de l'image et un expert partagé. Les expériences sur TextMuSS-Bench montrent que ScriptMoE atteint une précision de 82,06 %, surpassant la meilleure référence de 1,31 %. Sur la tâche CC-OCR, le remplacement du reconnaisseur dans PP-OCRv5 par ScriptMoE élève le score F1 de 65,71 % à 80,89 %, dépassant légèrement le meilleur VLM avec une fraction du nombre de paramètres.

ScriptMoE achieves the highest accuracy of 82.06%, outperforming the strongest STR baseline by 1.31%.

On the CC-OCR end-to-end multilingual task, replacing only the recognizer in PP-OCRv5 with ScriptMoE lifts F1 score from 65.71% to 80.89%, slightly surpassing the best VLM (80.73%) at a fraction of the parameter count.

Yesianrohn · 21 sept. 2026 lire l'original ↗
↑