CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 9 upvote

A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal

CÂU HỎI — Làm thế nào để phân biệt liệu một LLM thực sự không biết câu trả lời hay chỉ đang cố tình che giấu nó?

Nhóm tác giả giới thiệu phương pháp Probe of Internal Recognition (PIR), lấy cảm hứng từ kỹ thuật kiểm tra thông tin giấu kín trong pháp y, nhằm đọc trạng thái bên trong của mô hình để xác định đáp án nào được nhận diện là đúng. Thử nghiệm trên 8 mô hình thuộc 5 họ khác nhau (Gemma, Qwen, Llama, Mistral, Phi), PIR đạt độ chính xác cân bằng từ 0.70 đến 0.87, vượt xa mức baseline từ 0.28 đến 0.40. Phương pháp này vẫn hoạt động hiệu quả dưới các hình thức che giấu khác nhau như lừa dối có định hướng và sandbagging, giúp hỗ trợ kiểm toán mô hình và xác minh quá trình unlearning.

PIR recovers the recognized answer at 0.70 to 0.87 balanced accuracy, well above the 0.28 to 0.40 unknown-item baseline and the 0.25 chance rate.

It stays readable across every form of concealment we test, from prompted deception and trained sandbagging to external password-locked and circuit-broken checkpoints, with recognition between 0.85 and 0.93.

hisku · 18 thg 9, 2026 đọc bản gốc ↗
↑