Scaling Laws for Looped Mixture of Experts
Ils introduisent les Loop Scaling Laws, la première loi de mise à l'échelle qui modélise conjointement la récurrence et la parcimonie aux côtés de la taille du modèle et des données. Au cœur de ce travail se trouve une application de récurrence bornée et conditionnée par la parcimonie qui caractérise le gain de paramètres effectifs issu du bouclage. Ces lois prédisent la perte retenue avec plus de précision que les alternatives antérieures et restituent les lois de mise à l'échelle denses et MoE standard comme des cas particuliers. Les évaluations en aval démontrent que la parcimonie offre une efficacité de ~3x en paramètres actifs, tandis que la récurrence procure une efficacité de ~2x en paramètres totaux sur le raisonnement. À l'échelle du billion de jetons, un MoE bouclé avec une récurrence dérivée de la loi égale un MoE non bouclé ~2x plus grand sur les benchmarks de raisonnement tout en permettant une mise à l'échelle au moment du test.
La parcimonie offre une efficacité de ~3x en paramètres actifs.
La récurrence procure une efficacité de ~2x en paramètres totaux sur le raisonnement.
À l'échelle du billion de jetons, un MoE bouclé égale un MoE non bouclé ~2x plus grand sur les benchmarks de raisonnement.