Chinese-Jev: Bringing System One Model to Chinese-Language Tasks
Les auteurs présentent Chinese-Jev, un modèle de Système Un pour les tâches de décision en langue chinoise utilisant un pipeline unifié de traitement de données et d'entraînement. Il adopte une structure légère basée uniquement sur un encodeur avec une phase de pré-entraînement sur 10 millions d'exemples suivie d'un fine-tuning par domaine (médical, juridique, financier). Évalué sur le nouveau benchmark CJ-Bench, Chinese-Jev dépasse la précision du modèle Jev fermé de 1.24% sur le domaine général tout en réalisant une accélération de 20.3x. Dans les domaines spécialisés, il apporte une amélioration de 4.0% en médecine, une accélération de 17x, une latence moyenne de 15 ms par exemple, et un déploiement sur appareil en INT8 avec une latence d'environ 1.0 seconde.
Après le pré-entraînement de première étape, Chinese-Jev dépasse la précision du modèle Jev fermé de 1.24% sur les tâches du domaine général tout en réalisant une accélération de 20.3x.
Le fine-tuning spécifique au domaine apporte une amélioration de la précision de 4.0% par rapport à Jev en médecine avec une accélération de 17x et une latence moyenne de seulement 15 ms par exemple.
Un modèle quantifié en INT8 déployé sur des appareils mobiles atteint une latence d'inférence d'environ 1.0 seconde par décision.