CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 21 votes

Learning to Learn from Context: Synthetic Training from Perturbed Public Documents

QUESTION — Comment synthétiser des données d'entraînement à partir de documents publics pour améliorer le raisonnement contextuel des LLM sans annotateurs humains ?

Ce travail résout la faiblesse des LLM à apprendre à partir de contextes complexes en développant un pipeline automatisé qui perturbe des documents publics pour générer des traces de raisonnement. Sur CL-bench, le SFT fait passer un étudiant Qwen3.6-35B-A3B de 13,7 % à 22,8 %, et une étape ultérieure de RL atteint 24,6 %, rivalisant avec des modèles de plus d'un billion de paramètres.

Le SFT élève un étudiant Qwen3.6-35B-A3B de 13,7 % à 22,8 %, et une étape de RL subséquente atteint 24,6 % sur CL-bench, comparable à un modèle de pointe de plus d'un billion de paramètres, Qwen3.8-2.4T (23,9 %).

YangXiao-nlp · 27 sept. 2026 lire l'original ↗
↑