CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 7 upvote

Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks

CÂU HỎI — Làm thế nào để lựa chọn tập hợp dữ liệu độc hại (poison set) nhằm tối đa hóa tỷ lệ thành công của backdoor attack trong quá trình finetuning LLM?

Nghiên cứu này chỉ ra rằng việc chọn ngẫu nhiên các ví dụ độc hại từ một candidate pool làm đánh giá thấp đáng kể tính dễ bị tổn thương tồi tệ nhất trong các cuộc tấn công backdoor khi finetuning LLM. Trên các cài đặt LLaMA-3-8B, attack success dao động từ 3% đến 80% chỉ tùy thuộc vào poison set được chọn. Tác giả chính thức hóa việc lựa chọn này thành bài toán tối ưu hóa tập hợp được ngân sách oracle tài trợ, và giới thiệu SAILS (Set-level Audit-Informed Iterative Learned Selection). SAILS học một bộ chấm điểm tập hợp từ vài trăm lượt finetune-and-evaluate, xếp hạng hàng triệu tập hợp ứng viên và kiểm toán một danh sách rút gọn nhỏ. Phương pháp này cải thiện held-out attack success trung bình 30 percentage points so với các baseline influence mạnh nhất.

Attack success dao động từ 3% đến 80% tùy thuộc vào việc chọn poison set trong các cài đặt LLaMA-3-8B.

SAILS cải thiện held-out attack success trung bình 30 percentage points so với các influence baseline mạnh nhất.

aashiqmuhamed · 14 thg 9, 2026 đọc bản gốc ↗
↑