Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
Cette recherche révèle que l'échantillonnage aléatoire d'exemples empoisonnés sous-estime gravement la vulnérabilité pire cas aux backdoors lors du fine-tuning des LLM, le succès de l'attaque variant de 3% à 80% selon l'ensemble choisi. Les auteurs formalisent la sélection comme une optimisation d'ensemble budgétisée par oracle et introduisent SAILS (Set-level Audit-Informed Iterative Learned Selection). SAILS apprend un scoreur d'ensemble à partir de quelques centaines d'exécutions de fine-tuning et d'évaluation, classe des millions d'ensembles candidats et audite une liste restreinte. SAILS améliore le succès de l'attaque en rétention de 30 points de pourcentage en moyenne par rapport aux bases d'influence.
Le succès de l'attaque varie de 3% à 80% selon l'ensemble de poison choisi dans les contextes LLaMA-3-8B.
SAILS améliore le succès de l'attaque en rétention de 30 points de pourcentage en moyenne par rapport aux bases d'influence les plus fortes.