CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 8 votes

Imprint Reader: From Weight-Update Readout to Behavioral Intervention

QUESTION — Comment les modèles de langage peuvent-ils décoder les traces de mise à jour des poids en descriptions textuelles explicites pour guider des interventions comportementales ?

Les auteurs présentent l'Imprint Reader, un modèle entraîné avec le réglage SMaRT pour décoder les mises à jour de poids figées en descriptions en langage naturel. SMaRT monte chaque mise à jour sur le Reader et utilise une méta-requête sans ancrage pour extraire des descriptions. Au-delà de la génération, le Reader offre un proxy différentiable entre un comportement cible et une mise à jour candidate, permettant une intervention comportementale directe via MetaEdit.

Sur les mises à jour réservées, le Reader atteint un Pass@100 basé sur un juge de 2% pour la connaissance et 16% pour le comportement.

À un taux d'élagage de 0.5%, la sélection guidée par le Reader fait passer le refus de requêtes malveillantes de 57.9% à 64.1%.

Sans données d'entraînement de tâches cibles, MetaEdit augmente le BFCL Overall de 41.69% à 44.60%.

quantumfr · 28 sept. 2026 lire l'original ↗
↑