CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 9 votes

A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal

QUESTION — Comment peut-on déterminer si un grand modèle de langage ignore réellement une information ou cherche simplement à la dissimuler ?

Les auteurs présentent le Probe of Internal Recognition (PIR), une méthode inspirée de la criminalistique qui lit les états internes d'un modèle pour identifier la réponse reconnue comme correcte. Testé sur huit modèles de cinq familles différentes (Gemma, Qwen, Llama, Mistral et Phi), le PIR atteint une exactitude équilibrée de 0,70 à 0,87, dépassant la référence des éléments inconnus fixée entre 0,28 et 0,40. La méthode reste efficace face à diverses formes de dissimulation, facilitant ainsi les audits de modèles et la vérification du désapprentissage.

PIR recovers the recognized answer at 0.70 to 0.87 balanced accuracy, well above the 0.28 to 0.40 unknown-item baseline and the 0.25 chance rate.

It stays readable across every form of concealment we test, from prompted deception and trained sandbagging to external password-locked and circuit-broken checkpoints, with recognition between 0.85 and 0.93.

hisku · 18 sept. 2026 lire l'original ↗
↑