CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 13 votes

Removing the NEEDLE in the Haystack: Backdoor Removal in LLMs via Weight Orthogonalisation

QUESTION — Comment supprimer efficacement les portes dérobées (backdoors) des grands modèles de langage sans dégrader les performances bénignes ni la sécurité ?

Les auteurs proposent NEEDLE, une méthode sans entraînement pour la suppression ciblée de portes dérobées dans les LLM. En estimant une direction de porte dérobée et un sous-espace de refus via des vecteurs d'activation, la méthode applique une orthogonalisation séquentielle des poids pour supprimer la porte dérobée tout en préservant les représentations liées au refus. Les évaluations montrent que NEEDLE atteint le taux de réussite d'attaque le plus bas.

NEEDLE est une méthode sans entraînement pour la suppression ciblée de portes dérobées qui ne nécessite ni modèle de référence propre ni données empoisonnées d'origine.

NEEDLE atteint le taux de réussite d'attaque moyen le plus bas parmi les défenses évaluées.

NEEDLE atteint 0 % de taux de réussite d'attaque sur les attaques par injection de code complexes.

GeorgeDrayson · 29 sept. 2026 lire l'original ↗
↑