Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration
Les auteurs présentent la Decoy Direction Optimization (DDO), une défense rapide par modification de poids a posteriori pour les modèles de langage à poids ouverts qui ne nécessite aucun affinage du modèle de base. DDO fonctionne en injectant un signal leurre non linéaire de forte amplitude dans les neurones MLP du réseau pour corrompre les estimateurs de l'attaquant. Lorsque les attaquants tentent une ablation de caractéristiques de refus, le leurre les pousse à abluer une fonctionnalité inoffensive orthogonale tout en préservant le mécanisme de sécurité réel. Évalué sur six familles de modèles, DDO atteint un taux de réussite d'attaque inférieur à 10 % sous l'ablation standard et réduit le taux d'attaque au niveau des poids Heretic de 88,7 % à 18 %, tout en réduisant le coût d'optimisation de 30 à 450 fois par rapport aux bases d'entraînement.
Atteignant un taux de succès d'attaque inférieur à 10 % sous l'ablation standard.
Sur Llama-3-8B-Instruct, DDO reste comparable aux défenses entraînées sous des attaques adaptatives multiphases (65 % contre 58 % de pire taux de réussite) et réduit le taux d'attaque au niveau des poids Heretic de 88,7 % à 18 %.
Réduit le coût d'optimisation par configuration de 30 à 450 fois par rapport aux références entraînées.