CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 21 votes

Post-Training Leaves Behavioral Shadows on Unrelated Decisions

QUESTION — Comment transférer des capacités de modèles à l'aide de textes sans rapport avec la tâche, sans exemples de tâches cibles, logits ou paramètres du professeur ?

Les auteurs présentent l'Active Taskless Distillation (ATD), une méthode exploitant l'ombre comportementale du post-entraînement pour transférer des capacités à l'aide de paires de prompts d'un seul mot. Dans des expériences de code avec Qwen2.5-1.5B, 5 664 prompts ont généré un gain de 5,34 pp sur HumanEval+ par rapport à un contrôle. L'approche permet un transfert de capacités vers la science et le raisonnement sans logits ni accès direct aux paramètres du professeur.

Dans l'expérience de code principale avec Qwen2.5-1.5B, 5 664 nses procurent un gain de 5,34 pp sur HumanEval+ par rapport à un contrôle apparié.

Lines · 24 sept. 2026 lire l'original ↗
↑