A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
Les auteurs présentent le Probe of Internal Recognition (PIR), une méthode inspirée de la criminalistique qui lit les états internes d'un modèle pour identifier la réponse reconnue comme correcte. Testé sur huit modèles de cinq familles différentes (Gemma, Qwen, Llama, Mistral et Phi), le PIR atteint une exactitude équilibrée de 0,70 à 0,87, dépassant la référence des éléments inconnus fixée entre 0,28 et 0,40. La méthode reste efficace face à diverses formes de dissimulation, facilitant ainsi les audits de modèles et la vérification du désapprentissage.
PIR recovers the recognized answer at 0.70 to 0.87 balanced accuracy, well above the 0.28 to 0.40 unknown-item baseline and the 0.25 chance rate.
It stays readable across every form of concealment we test, from prompted deception and trained sandbagging to external password-locked and circuit-broken checkpoints, with recognition between 0.85 and 0.93.