CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 10 upvote

Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior

CÂU HỎI — Tiền tiền huấn luyện tổng hợp (Synthetic Pre-pretraining) hoạt động như thế nào ở quy mô lớn và dưới các hỗn hợp dữ liệu thực tế?

Nghiên cứu này đánh giá tiền tiền huấn luyện tổng hợp (PPT) trên năm tác vụ, bốn hỗn hợp dữ liệu, bốn quy mô tham số từ 500M đến 7B, và ngân sách lên tới 100B token. Kết quả cho thấy hiệu suất token và hiệu năng hạ nguồn của PPT vẫn duy trì ở quy mô lớn, ví dụ tiết kiệm ít nhất 21B token ở quy mô 3B. Tuy nhiên, lợi ích này đến từ các tác vụ cải thiện khả năng truy xuất tầm xa thay vì tiền định ngữ pháp như giả thuyết trước đây.

Tiết kiệm ít nhất 21B token tiền huấn luyện ở quy mô 3B.

Thử nghiệm bao gồm bốn quy mô tham số từ 500M đến 7B và ngân sách huấn luyện lên tới 100B token.

atsuki-yamaguchi · 30 thg 9, 2026 đọc bản gốc ↗
↑