CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 10 votes

Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior

QUESTION — Quelles sont les performances du pré-pré-entraînement synthétique à grande échelle et avec des mélanges de données réalistes ?

Cet article évalue le pré-pré-entraînement synthétique (PPT) à travers cinq tâches, quatre mélanges de données, quatre échelles de paramètres de 500M à 7B, et des budgets allant jusqu'à 100B de tokens. Les résultats montrent que les gains d'efficacité en tokens et de performance en aval du PPT persistent à grande échelle, économisant par exemple au moins 21B de tokens à l'échelle 3B. Cependant, ces gains proviennent de tâches améliorant la récupération à long terme plutôt que d'un a priori grammatical.

Économisant au moins 21B de tokens de pré-entraînement à l'échelle 3B.

S'étendant sur cinq tâches PPT, quatre mélanges de données de PT, quatre échelles de paramètres (500M à 7B) et des budgets de PT allant jusqu'à 100B de tokens.

atsuki-yamaguchi · 30 sept. 2026 lire l'original ↗
↑