Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior
QUESTION — Quelles sont les performances du pré-pré-entraînement synthétique à grande échelle et avec des mélanges de données réalistes ?
Cet article évalue le pré-pré-entraînement synthétique (PPT) à travers cinq tâches, quatre mélanges de données, quatre échelles de paramètres de 500M à 7B, et des budgets allant jusqu'à 100B de tokens. Les résultats montrent que les gains d'efficacité en tokens et de performance en aval du PPT persistent à grande échelle, économisant par exemple au moins 21B de tokens à l'échelle 3B. Cependant, ces gains proviennent de tâches améliorant la récupération à long terme plutôt que d'un a priori grammatical.
Économisant au moins 21B de tokens de pré-entraînement à l'échelle 3B.
S'étendant sur cinq tâches PPT, quatre mélanges de données de PT, quatre échelles de paramètres (500M à 7B) et des budgets de PT allant jusqu'à 100B de tokens.
atsuki-yamaguchi · 30 sept. 2026
lire l'original ↗