Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration
Các tác giả giới thiệu Decoy Direction Optimization (DDO), một phương pháp chỉnh sửa trọng số hậu kỳ (post-hoc) nhằm bảo vệ các mô hình ngôn ngữ lớn (LLM) mở mà không cần tinh chỉnh lại mô hình cơ sở. DDO hoạt động bằng cách tiêm một tín hiệu decoy phi tuyến tính, có biên độ lớn vào các nơ-ron MLP để làm hỏng trình ước tính của kẻ tấn công, khiến chúng phá hủy một tính năng vô hại trực giao trong khi cơ chế an toàn thực tế vẫn còn nguyên vẹn. Phương pháp này đạt kết quả cao trên sáu họ mô hình, giảm chi phí tối ưu hóa đáng kể so với các đường cơ sở được huấn luyện.
Đạt tỷ lệ tấn công thành công dưới <10% dưới tiêu chuẩn Refusal Feature Ablation.
Trên Llama-3-8B-Instruct, giữ vững hiệu suất tương đương các biện pháp phòng thủ được huấn luyện (65% so với 58% worst-case ASR) và giảm ASR của cuộc tấn công mức trọng số Heretic từ 88,7% xuống 18%.
Giảm chi phí tối ưu hóa cho mỗi cấu hình từ 30 đến 450 lần so với các đường cơ sở được huấn luyện.