CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 8 upvote

Imprint Reader: From Weight-Update Readout to Behavioral Intervention

CÂU HỎI — Làm thế nào để mô hình ngôn ngữ dịch mã trực tiếp các dấu vết cập nhật trọng số thành mô tả ngôn ngữ tự nhiên để can thiệp hành vi?

Bài báo giới thiệu Imprint Reader, một mô hình được huấn luyện bằng Semantic Mount-and-Read Tuning (SMaRT) để mô tả các weight update đã đóng băng (frozen weight updates). SMaRT gắn mỗi bản cập nhật vào Reader và dùng truy vấn meta không neo để trích xuất mô tả bằng ngôn ngữ tự nhiên. Phương pháp này cung cấp một proxy vi phân cho khoảng cách giữa hành vi mục tiêu và bản cập nhật trọng số, hỗ trợ can thiệp thông qua MetaEdit để tối ưu hóa khả năng từ chối prompt độc hại hoặc cải thiện khả năng lập luận toán học.

Trên các bản cập nhật giữ lại, Reader đạt judge-based Pass@100 là 2% cho kiến thức và 16% cho hành vi.

Ở mức pruning rate 0.5%, việc lựa chọn có sự hướng dẫn của Reader làm tăng tỷ lệ từ chối prompt độc hại từ 57.9% lên 64.1%.

MetaEdit làm tăng BFCL Overall từ 41.69% lên 44.60% mà không cần dữ liệu huấn luyện tác vụ mục tiêu.

quantumfr · 28 thg 9, 2026 đọc bản gốc ↗
↑