A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
Nhóm tác giả giới thiệu phương pháp Probe of Internal Recognition (PIR), lấy cảm hứng từ kỹ thuật kiểm tra thông tin giấu kín trong pháp y, nhằm đọc trạng thái bên trong của mô hình để xác định đáp án nào được nhận diện là đúng. Thử nghiệm trên 8 mô hình thuộc 5 họ khác nhau (Gemma, Qwen, Llama, Mistral, Phi), PIR đạt độ chính xác cân bằng từ 0.70 đến 0.87, vượt xa mức baseline từ 0.28 đến 0.40. Phương pháp này vẫn hoạt động hiệu quả dưới các hình thức che giấu khác nhau như lừa dối có định hướng và sandbagging, giúp hỗ trợ kiểm toán mô hình và xác minh quá trình unlearning.
PIR recovers the recognized answer at 0.70 to 0.87 balanced accuracy, well above the 0.28 to 0.40 unknown-item baseline and the 0.25 chance rate.
It stays readable across every form of concealment we test, from prompted deception and trained sandbagging to external password-locked and circuit-broken checkpoints, with recognition between 0.85 and 0.93.