CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 19 votes

Rufus-Air: An Open LLM Post-Training Recipe

QUESTION — Comment concevoir une recette de post-entraînement ouverte et reproductible pour un modèle de base 106B-A12B via un pipeline sériel en huit étapes ?

Les auteurs présentent Rufus-Air, une recette de post-entraînement ouverte structurée en un pipeline sériel à huit étapes basé sur GLM-4.5-Air-Base (106B-A12B), allant du SFT et du RL spécialisé jusqu'au RLHF. L'approche organise les étapes par progression des capacités et fiabilité des récompenses, en exploitant des données publiques sans annotation humaine ni enseignant de distillation interne. Les évaluations montrent que Rufus-Air surpasse la version officielle post-entraînée de GLM-4.5-Air et rivalise avec les modèles ouverts de taille similaire.

Diverse, high-quality SFT establishes a strong capability floor.

Difficulty filtering keeps RL prompts within a productive learning range.

Reward reliability provides a practical principle for ordering stages.

lawhy · 24 sept. 2026 lire l'original ↗
↑