CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — training 7 votes

Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks

QUESTION — Comment sélectionner stratégiquement des ensembles de données empoisonnées pour maximiser le succès des attaques de type backdoor lors du fine-tuning des LLM ?

Cette recherche révèle que l'échantillonnage aléatoire d'exemples empoisonnés sous-estime gravement la vulnérabilité pire cas aux backdoors lors du fine-tuning des LLM, le succès de l'attaque variant de 3% à 80% selon l'ensemble choisi. Les auteurs formalisent la sélection comme une optimisation d'ensemble budgétisée par oracle et introduisent SAILS (Set-level Audit-Informed Iterative Learned Selection). SAILS apprend un scoreur d'ensemble à partir de quelques centaines d'exécutions de fine-tuning et d'évaluation, classe des millions d'ensembles candidats et audite une liste restreinte. SAILS améliore le succès de l'attaque en rétention de 30 points de pourcentage en moyenne par rapport aux bases d'influence.

Le succès de l'attaque varie de 3% à 80% selon l'ensemble de poison choisi dans les contextes LLaMA-3-8B.

SAILS améliore le succès de l'attaque en rétention de 30 points de pourcentage en moyenne par rapport aux bases d'influence les plus fortes.

aashiqmuhamed · 14 sept. 2026 lire l'original ↗
↑