CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — architecture 98 votes

IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts

QUESTION — Comment une architecture Mixture-of-Experts peut-elle contrôler indépendamment la participation, le coût d'exécution et la matérialisation des paramètres ?

L'article propose IntBMoE, une architecture Mixture-of-Experts conditionnée par blocs qui découple la participation des tokens, l'exécution du calcul et la matérialisation des paramètres. En associant une composition d'experts dense à une exécution de blocs éparse via un codebook et un hyperréseau léger, IntBMoE atteint une participation complète tout en maintenant une exécution éparse et une mémoire limitée. Le mécanisme Dual-Path Residual Gating (DPRG) couple en outre les chemins. IntBMoE est déployé dans le système de recommandation d'AMap, servant des centaines de millions d'utilisateurs sous un budget de latence de 60ms avec un gain UVCTR relatif de 2,4%.

IntBMoE découple la participation des tokens, l'exécution du calcul et la matérialisation des paramètres dans les architectures MoE.

Le modèle est entièrement déployé dans le système de recommandation d'AMap sous un budget de latence de 60ms.

Des tests A/B en ligne démontrent un gain UVCTR relatif de 2,4%.

Xufew · 18 sept. 2026 lire l'original ↗
↑