Imprint Reader: From Weight-Update Readout to Behavioral Intervention
Bài báo giới thiệu Imprint Reader, một mô hình được huấn luyện bằng Semantic Mount-and-Read Tuning (SMaRT) để mô tả các weight update đã đóng băng (frozen weight updates). SMaRT gắn mỗi bản cập nhật vào Reader và dùng truy vấn meta không neo để trích xuất mô tả bằng ngôn ngữ tự nhiên. Phương pháp này cung cấp một proxy vi phân cho khoảng cách giữa hành vi mục tiêu và bản cập nhật trọng số, hỗ trợ can thiệp thông qua MetaEdit để tối ưu hóa khả năng từ chối prompt độc hại hoặc cải thiện khả năng lập luận toán học.
Trên các bản cập nhật giữ lại, Reader đạt judge-based Pass@100 là 2% cho kiến thức và 16% cho hành vi.
Ở mức pruning rate 0.5%, việc lựa chọn có sự hướng dẫn của Reader làm tăng tỷ lệ từ chối prompt độc hại từ 57.9% lên 64.1%.
MetaEdit làm tăng BFCL Overall từ 41.69% lên 44.60% mà không cần dữ liệu huấn luyện tác vụ mục tiêu.