Lightning Weave: Improving the Accuracy-Efficiency Frontier of Reasoning Models through Capability Composition
Les auteurs présentent Lightning Weave, un cadre de post-entraînement qui extrait et compose des capacités apprises indépendamment dans un seul étudiant par le biais de l'on-policy distillation. En combinant des log-ratio shifts alignés sur des états de jetons d'étudiants partagés et en utilisant le Tilted-Target DOPD, le cadre crée des cibles d'apprentissage stables sans nécessiter plusieurs modèles ancres en direct pendant l'entraînement. Des expériences en mathématiques et en code montrent des gains substantiels d'efficacité et de précision, par exemple sur Qwen3.5-4B faisant passer la précision HMMT 2025 de 59.2% à 64.0% avec 10.7% de jetons de réponse en moins, et LiveCodeBench v5 de 41.7% à 54.2% avec 9.6% de jetons de réponse en moins.
On Qwen3.5-4B, it raises HMMT 2025 accuracy from 59.2% to 64.0% with 10.7% fewer response tokens, and LiveCodeBench v5 accuracy from 41.7% to 54.2% with 9.6% fewer response tokens.