CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 13 upvote

Removing the NEEDLE in the Haystack: Backdoor Removal in LLMs via Weight Orthogonalisation

CÂU HỎI — Làm thế nào để loại bỏ cửa hậu (backdoor) trong LLM mà không làm thay đổi phân phối đầu ra của các prompt lành tính hay giảm hiệu năng mô hình?

Bài báo đề xuất NEEDLE, một phương pháp không cần huấn luyện (training-free) nhằm loại bỏ cửa hậu có mục tiêu trong LLM. Bằng cách ước tính hướng cửa hậu và không gian con từ chối thông qua các vector kích hoạt, phương pháp này áp dụng việc trực giao hóa trọng số tuần tự (sequential weight orthogonalisation) để triệt tiêu cửa hậu mà không gây nhiễu loạn các biểu diễn liên quan đến sự từ chối. Thử nghiệm trên nhiều họ mô hình và kiểu tấn công cho thấy phương pháp đạt tỷ lệ tấn công thành công thấp nhất cùng độ lệch KL tối thiểu.

NEEDLE là phương pháp loại bỏ cửa hậu có mục tiêu mà không cần huấn luyện lại.

Phương pháp này không yêu cầu mô hình tham chiếu sạch hay dữ liệu huấn luyện bị đầu độc ban đầu.

NEEDLE đạt 0% tỷ lệ tấn công thành công trên các cuộc tấn công tiêm nhiễm mã độc.

GeorgeDrayson · 29 thg 9, 2026 đọc bản gốc ↗
↑