Imprint Reader: From Weight-Update Readout to Behavioral Intervention
Les auteurs présentent l'Imprint Reader, un modèle entraîné avec le réglage SMaRT pour décoder les mises à jour de poids figées en descriptions en langage naturel. SMaRT monte chaque mise à jour sur le Reader et utilise une méta-requête sans ancrage pour extraire des descriptions. Au-delà de la génération, le Reader offre un proxy différentiable entre un comportement cible et une mise à jour candidate, permettant une intervention comportementale directe via MetaEdit.
Sur les mises à jour réservées, le Reader atteint un Pass@100 basé sur un juge de 2% pour la connaissance et 16% pour le comportement.
À un taux d'élagage de 0.5%, la sélection guidée par le Reader fait passer le refus de requêtes malveillantes de 57.9% à 64.1%.
Sans données d'entraînement de tâches cibles, MetaEdit augmente le BFCL Overall de 41.69% à 44.60%.