Peut-on vraiment construire un détecteur de mensonges pour les IA ?
Aletheia’s Quest a mis des équipes au défi de détecter quand un modèle de langage ment. Surprise : les méthodes qui observent les réponses rivalisent avec celles qui inspectent l’intérieur du modèle.
En bref
- Aletheia’s Quest oppose deux approches : black-box, qui peut observer la conversation et interroger librement le modèle suspect, et white-box, qui inspecte aussi ses activations internes.
- EleutherAI obtient 0,926 d’AUROCArea Under the ROC Curve : métrique de discrimination d’un classifieur entre 0,5 (hasard) et 1 (séparation parfaite). moyen en black-box contre 0,945 en white-box ; l’équipe SAIN était en tête du classement de validation avec environ 0,95 et 0,97.
- Les modèles audités incluaient Qwen 3.5, Gemma 3 et Nemotron 3 Super, de 27B à 120B paramètres, avec aussi des LoRALow-Rank Adaptation : technique de fine-tuning efficace qui adapte un modèle via des matrices de rang faible au lieu de tout réentraîner. modifiant la verbosité et le style du mensonge pour corser l’exercice.
- Dans 120 conversations donnant exactement la même réponse, « je ne sais pas », trois juges atteignent encore 0,66 à 0,76 d’AUROC. Le fait que le juge réponde lui-même correctement à la question prédit le label à environ 0,82 d’AUROC.
- La corrélation d’ignorance entre juge et modèle surveillé atteint 96 %, contre un taux d’ignorance de base d’environ 23 % ; à statut de connaissance du juge identique, la séparation résiduelle retombe au niveau du hasard.
Sommaire · 8 sections
Faire du « mensonge » des IA un problème mesurable
Dire qu’une IA « ment » est facile. Construire une expérience capable de le montrer est beaucoup plus difficile.
C’est précisément l’objectif d’Aletheia’s Quest, une compétition organisée à l’été 2026 par Cadenza Labs et le National Deep InferencePhase d’utilisation d’un modèle déjà entraîné : produire une sortie à partir d’une entrée (par opposition à l’entraînement). Fabric (NDIF). Des modèles de langage étaient placés dans différentes situations où ils pouvaient produire des réponses trompeuses, puis les équipes devaient distinguer les comportements honnêtes des comportements mensongers.
Les systèmes audités n’étaient pas de petits modèles de laboratoire : la compétition incluait notamment Qwen 3.5, Gemma 3 et Nemotron 3 Super, dans des tailles allant d’environ 27 à 120 milliards de paramètres. Des variantes LoRA modifiaient aussi la verbosité et le style des réponses mensongères pour rendre l’exercice plus difficile.
La compétition séparait deux grandes familles de méthodes. En black-box, le détecteur n’accédait pas aux poids ni aux activations internes, mais pouvait observer la conversation et interroger librement le modèle suspect. En white-box, il disposait en plus de signaux internes comme les activations du réseau.
Ce détail sur le black-box est important : il ne s’agissait donc pas d’un simple classifieurModèle qui assigne une entrée à une classe (spam / légitime, fraude / OK…). Évalué via AUROC, précision, rappel ou F1. lisant une réponse finale. EleutherAI s’appuyait notamment sur Qwen 3.5 9B comme juge de confiance, un modèle plus petit que certains systèmes surveillés.
Le white-box fait mieux, mais de peu
La méthode black-box d’EleutherAI atteint un AUROC moyen de 0,926. Sa version white-box monte à 0,945.
L’AUROC mesure la capacité d’un système à séparer deux catégories. Un score de 0,5 correspond grossièrement au hasard ; plus on se rapproche de 1, meilleure est la séparation. Ici, l’écart entre les deux approches n’est que de 0,019 point.
Autrement dit, l’accès à l’intérieur du modèle améliore le résultat, mais pas autant qu’on pourrait l’imaginer.
La rétrospective cite aussi SAIN, qui avait pris la tête du classement de validation le dernier jour avec environ 0,95 en black-box et 0,97 en white-box. Il faut rester prudent sur la hiérarchie finale : la compétition comportait un jeu de test privé non publié, et le classement définitif ne peut donc pas être déduit du seul leaderboard de validation.
Ce contexte compte aussi pour lire la rétrospective elle-même : EleutherAI est ici à la fois analyste et concurrent de la compétition. Son retour d’expérience est particulièrement riche techniquement, mais il reste celui d’une équipe participante qui évalue aussi les limites du cadre dans lequel elle a concouru.
Le meilleur résultat est peut-être un problème de fact-checking
La question centrale est moins « est-ce que ça marche ? » que « qu’est-ce qui est réellement détecté ? ».
Dans l’approche black-box d’EleutherAI, un modèle juge examine notamment les affirmations du modèle suspect et vérifie si elles correspondent à ce qu’il connaît. Cela peut être très efficace lorsque les deux modèles partagent une grande partie de leurs connaissances.
Mais détecter une contradiction factuelle n’est pas la même chose que détecter une intention de tromper.
EleutherAI a justement construit une expérience qui rend ce problème beaucoup plus concret. Les chercheurs ont pris 120 conversations dont la réponse finale était exactement la même : « je ne sais pas ». Aucun indice évident dans le texte final ne permettait donc, à lui seul, de séparer les cas honnêtes des cas trompeurs.
Pourtant, trois modèles juges atteignent encore entre 0,66 et 0,76 d’AUROC.
Le résultat le plus frappant va encore plus loin : le fait que le juge réponde lui-même correctement à la question prédit le label à environ 0,82 d’AUROC. Ce signal fait donc mieux que les juges qui lisent la transcription complète.
L’équipe mesure en parallèle une corrélation d’ignorance de 96 % entre le juge et le modèle suspect. Ce chiffre devient parlant quand on le compare au taux d’ignorance de base, d’environ 23 % : lorsqu’un modèle ignore une information, l’autre a très souvent la même lacune.
Et une fois que l’on compare des cas où le juge a le même statut de connaissance, la séparation résiduelle entre exemples honnêtes et trompeurs n’est plus distinguable du hasard. Autrement dit, dans cette expérience, une fois neutralisé ce que le juge sait, il ne reste plus de signal clair montrant qu’il « lit » autre chose dans la conversation.
C’est un indice fort de ce qu’EleutherAI décrit comme un canal latéral de connaissances partagées. Le juge ne lit pas forcément une intention cachée ; il peut parfois déduire qu’une réponse est suspecte parce qu’il sait si le modèle surveillé devrait, ou non, connaître l’information en question.
Ce mécanisme rend les bons scores moins simples à interpréter. Un détecteur peut être excellent sans pour autant constituer un « détecteur de mensonges » au sens intuitif du terme.
Un second canal latéral, mais beaucoup moins établi
EleutherAI signale aussi une autre piste, sur la base d’observations que l’équipe qualifie elle-même d’anecdotiques.
L’asymétrie décrite est précise : nier une proposition vraie semble se faire rapidement, alors qu’affirmer positivement quelque chose de contraire à ce que le modèle sait s’accompagne davantage d’hésitations ou de tergiversations.
EleutherAI soupçonne un effet du RLHFReinforcement Learning from Human Feedback : alignement d’un modèle via des préférences humaines et un reward model., sans détailler le mécanisme qui produirait cette différence.
Cette observation est intéressante parce qu’elle suggère qu’un détecteur pourrait exploiter la manière dont un modèle formule un mensonge, et pas seulement son contenu. Mais contrairement au canal des connaissances partagées, elle ne repose pas ici sur une démonstration expérimentale aussi solide. Il vaut donc mieux la lire comme une hypothèse de travail que comme un résultat établi.
Les sondes internes peuvent se retourner hors distribution
Les approches white-box ont un problème différent : elles peuvent être très convaincantes sur les données auxquelles elles ressemblent, puis devenir fragiles ailleurs.
Une technique courante consiste à entraîner une sonde linéaire sur les activations internes du modèle afin de trouver une direction mathématique qui sépare exemples honnêtes et trompeurs.
Dans les expériences rapportées par EleutherAI, les cinq sondes linéaires examinées ont montré une inversion statistiquement significative sur au moins un jeu de donnéesEnsemble de données structuré utilisé pour entraîner, valider ou tester un modèle. hors distribution.
Autrement dit, dans certains contextes nouveaux, une sonde pouvait attribuer un score de tromperie plus faible aux exemples trompeurs qu’aux exemples honnêtes.
C’est une limite importante pour un outil de sécurité : un détecteur n’est réellement utile que s’il continue de fonctionner lorsque changent le modèle, le contexte ou le type de tromperie.
EleutherAI a finalement conservé une seule sonde linéaire dans son système white-box, et seulement sous certaines conditions.
290 modules testés, mais des benchmarks parfois déjà presque saturés
L’équipe a utilisé des agents de code pour générer et évaluer environ 290 modules de détection, testés sur 27 distributions d’évaluation. Elle publie également un ensemble de stress tests comprenant 6 168 exemples répartis sur 28 distributions de tromperie.
Ces chiffres montrent l’ampleur du travail nécessaire pour éviter de conclure trop vite à partir d’un seul benchmarkJeu de référence public ou interne pour comparer des modèles (MMLU, HumanEval, etc.) — à lire avec prudence hors domaine..
Ils montrent aussi pourquoi les moyennes doivent être lues avec prudence. Le jeu de données Iris, par exemple, était presque saturé dès le départ : la baseline atteignait déjà 0,961 d’AUROC. Sur un dataset aussi facile, gagner quelques centièmes dit moins de choses sur la capacité réelle d’un détecteur à généraliser.
Le vrai test n’est donc pas seulement d’obtenir un score élevé, mais de conserver ce score face à des distributions nouvelles, à des modèles différents et à des formes de tromperie qui ne ressemblent pas aux exemples vus auparavant.
Qu’appelle-t-on exactement « mentir » ?
Aletheia’s Quest reprend une définition issue de Liars’ Bench : un modèle ment lorsqu’il produit une affirmation qu’il croit fausse.
Cette définition est utile pour construire un benchmark, mais elle simplifie fortement le problème réel. Chez un humain, le mensonge suppose généralement plus qu’une information fausse : il implique aussi une intention de tromper.
Pour une IA, cette différence devient encore plus importante. Un agent pourrait omettre volontairement une information, ne présenter que les éléments favorables à son objectif ou manipuler progressivement une décision sur plusieurs étapes. Aucune phrase isolée ne serait forcément fausse.
Un détecteur conçu surtout pour repérer des contradictions factuelles, une connaissance manquante ou des hésitations atypiques pourrait alors ne rien voir.
Ce qu’Aletheia montre vraiment
Aletheia’s Quest ne fournit pas encore un détecteur universel de mensonges pour les IA. Mais l’expérience accomplit quelque chose de plus utile : elle transforme une question vague en problème expérimental que l’on peut mesurer, comparer et surtout tenter de casser.
Les scores sont déjà élevés. Le résultat le plus instructif est pourtant ailleurs : un bon score de détection ne dit pas encore clairement quel signal a été appris.
Un modèle juge peut repérer une fausse affirmation parce qu’il connaît la bonne réponse. Il peut reconnaître qu’un autre modèle devrait ignorer une information. Il peut peut-être aussi exploiter certains styles de réponse — mais ce dernier point reste beaucoup moins établi. Une sonde interne peut fonctionner sur un benchmark puis inverser son verdict ailleurs.
La prochaine étape consiste donc moins à faire monter l’AUROC de quelques centièmes qu’à démontrer que les détecteurs restent fiables lorsque disparaissent ces raccourcis.
Pour des agents capables d’utiliser des outils, de manipuler des fichiers ou de poursuivre un objectif sur de longues séquences d’actions, la question décisive ne sera probablement pas seulement de savoir s’ils disent quelque chose de faux.
Ce sera de savoir s’ils essaient de nous faire croire quelque chose qu’ils ne croient pas eux-mêmes — même lorsque rien, dans une phrase isolée, ne les trahit.
Lecture 404 Mates
Le résultat le plus intéressant n’est pas seulement qu’un détecteur de mensonge puisse obtenir de bons scores, mais ce qu’il mesure réellement. L’expérience des 120 réponses identiques (« je ne sais pas ») montre qu’un juge peut encore distinguer les cas honnêtes et trompeurs sans indice textuel dans la réponse finale. Plus frappant encore : le fait que le juge réponde lui-même correctement à la question prédit le label à environ 0,82 d’AUROC, mieux que les juges lisant la transcription complète.
Une fois comparés des cas où le juge a le même statut de connaissance, la séparation résiduelle n’est plus distinguable du hasard. Cela renforce fortement l’idée que certains détecteurs exploitent des connaissances partagées plutôt qu’une lecture directe de l’intention. Pour les futurs agents IASystème qui planifie et enchaîne des actions (outils, APIs, code) pour atteindre un objectif, au-delà d’une seule réponse texte., la distinction est essentielle : un score élevé de détection ne garantit pas encore qu’on sache reconnaître une intention de tromper.


