Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
Nghiên cứu này chỉ ra rằng việc chọn ngẫu nhiên các ví dụ độc hại từ một candidate pool làm đánh giá thấp đáng kể tính dễ bị tổn thương tồi tệ nhất trong các cuộc tấn công backdoor khi finetuning LLM. Trên các cài đặt LLaMA-3-8B, attack success dao động từ 3% đến 80% chỉ tùy thuộc vào poison set được chọn. Tác giả chính thức hóa việc lựa chọn này thành bài toán tối ưu hóa tập hợp được ngân sách oracle tài trợ, và giới thiệu SAILS (Set-level Audit-Informed Iterative Learned Selection). SAILS học một bộ chấm điểm tập hợp từ vài trăm lượt finetune-and-evaluate, xếp hạng hàng triệu tập hợp ứng viên và kiểm toán một danh sách rút gọn nhỏ. Phương pháp này cải thiện held-out attack success trung bình 30 percentage points so với các baseline influence mạnh nhất.
Attack success dao động từ 3% đến 80% tùy thuộc vào việc chọn poison set trong các cài đặt LLaMA-3-8B.
SAILS cải thiện held-out attack success trung bình 30 percentage points so với các influence baseline mạnh nhất.