Les garde-fous d'un LLM tiennent-ils sans arithmétique à vérifier ? 368 fusions, cinq contrôles
L'auto-vérification rattrape 97,6 % des extractions de factures fausses. Sur des fusions de contacts, où rien ne se recalcule, elle en rattrape 76,0 %. L'accord entre modèles tombe de 92,9 % à 62,9 %, et il marche le plus mal sur le modèle qui se trompe le moins.
Publié le
12 septembre 2026
Rubrique
Petite entreprise
Un modèle nettoie un carnet de contacts, fusionne deux lignes, et l'une des deux personnes cesse d'exister. Rien ne plante. Le test publié le 2026-08-18 a mesuré la fréquence de cet accident : 48,4 % des paires pièges ont été fusionnées, et 70 % de ces fusions fausses revenaient sans que rien, dans la sortie du modèle, n'envoie quiconque vérifier.
Deux semaines plus tard, nous avons mesuré quels garde-fous rattrapent une extraction fausse sur une facture. Les deux qui tenaient debout étaient : demander au modèle de vérifier sa propre sortie, et faire tourner un second modèle puis comparer. Mais une facture porte un troisième garde-fou qui ne coûte rien, sous-total + taxe = total. Un carnet de contacts n'a aucune arithmétique. Nous avons donc posé les deux mêmes garde-fous sur les mêmes 96 passes de dédoublonnage, et les avons notés de la même façon.
Les deux garde-fous marchent encore, et les deux perdent de 22 à 30 points de rattrapage. L'auto-vérification rattrape 97,6 % des extractions fausses sur facture ; sur des fusions elle en rattrape 76,0 %. L'accord entre modèles tombe de 92,9 % à 62,9 %.
Ils deviennent aussi plus silencieux, et plus souvent justes quand ils parlent. L'auto-vérification signale 39 % des extractions justes sur facture, mais seulement 20,8 % des fusions justes, et sa précision monte de 29,9 % à 57,0 %. Moins de rattrapages, moins de bruit.
L'accord entre modèles marche le plus mal sur le meilleur modèle.claude-haiku-4.5 propose le moins de fusions fausses des trois, 19 sur 111, et l'accord n'en rattrape que 36,8 % pendant que 6 de ses 10 alertes portent sur une fusion juste. Plus votre modèle est bon, moins ce garde-fou vous aide.
Le meilleur second modèle n'est pas le même d'une tâche à l'autre. Comme témoin unique, gpt-4o-mini avait la meilleure précision sur les factures, 65,8 %, et il a la pire ici, 44,8 %. claude-haiku-4.5 avait la pire sur les factures, 37,9 %, et il a la meilleure ici, 91,1 %. Il n'existe pas de second modèle à recommander en général.
La méthode, en bref
Test conduit le 2026-09-12 par la chaîne de test automatisée de ce site : le corpus, les appels aux modèles et l'analyse sont des scripts, publiés plus bas pour que chacun puisse les rejouer et contester le résultat. Etienne signe cet article et répond de son contenu.
C'est le septième test mesuré publié ici, et le deuxième qui mesure des contrôles plutôt que des modèles.
Les 96 passes de dédoublonnage n'ont pas été refaites. Ce sont exactement celles publiées le 2026-08-18 sous le jeu de données de dédoublonnage : 8 carnets de 12 lignes générés par script, graine 20260817, quatre niveaux de désordre de présentation, trois modèles économiques, et une partition de vérité terrain tranchée à ce moment-là. Les rejouer aujourd'hui aurait mêlé l'effet des garde-fous à 26 jours de dérive des modèles, et aucun chiffre ci-dessous n'aurait séparé les deux.
L'unité notée ici n'est ni un carnet ni un appel. C'est une fusion proposée : une paire de lignes qu'un modèle a mises dans un même groupe.
Nombre
Fusions proposées, toutes passes confondues
368
Justes : deux lignes, une personne
271
Fausses : deux personnes, une ligne détruite
97
Les garde-fous
Ce qu'il fait
Coût
A0
le champ notes du modèle, rempli pendant le dédoublonnage : nomme-t-il les deux lignes ?
aucun
A1
clés fortes : refuser toute fusion dont les lignes ne partagent ni courriel ni téléphone
aucun
A3
auto-vérification : un appel de plus au même modèle, avec le carnet et ses propres groupes
un appel par passe
A4
accord des trois modèles : signaler toute fusion que les deux autres n'ont pas proposée
deux passes de plus
A5
accord avec un seul autre modèle, calculé pour les trois témoins
une passe de plus
A1 est le garde-fou de forme arithmétique de cette tâche, et la comparaison est tout l'objet du test : sous-total + taxe = total est vrai dans le monde, tandis que « deux doublons partagent un courriel ou un téléphone » n'est vrai que dans ce corpus. Cette réserve n'est pas décorative, et son prix est chiffré plus bas.
La consigne d'A3 ne laisse jamais entendre qu'une erreur a été trouvée et ne donne aucune vérité terrain. Dire au modèle qu'une erreur existe mesurerait la docilité, pas la détection. Le verdict est demandé groupe par groupe et non sur la partition entière : un verdict global ne se raccorde à aucune fusion précise, et un garde-fou qui ne nomme pas la ligne à relire ne dit pas où regarder.
Les chiffres bruts
368 fusions jugées, 97 fausses, 271 justes.
Garde-fou
Rattrapage
Fausse alerte
Précision
Fusions fausses manquées
A0 note spontanée
73,2 %
55,4 %
32,1 %
26
A1 clés fortes
72,2 %
0,0 %
100,0 %
27
A3 auto-vérification
76,0 %
20,8 %
57,0 %
23
A4 accord des trois modèles
62,9 %
9,2 %
70,9 %
36
A5 avec gpt-4o-mini seul
25,5 %
8,7 %
44,8 %
38
A5 avec gemini-2.5-flash-lite seul
40,0 %
3,9 %
78,8 %
39
A5 avec claude-haiku-4.5 seul
65,4 %
2,8 %
91,1 %
27
A1 et A4 ensemble
90,7 %
9,2 %
77,9 %
9
A1 et A3 ensemble
92,7 %
20,8 %
61,8 %
7
A3 et A4 ensemble
87,6 %
27,4 %
53,8 %
12
Mêmes garde-fous, deux tâches
Garde-fou
Factures, 2026-09-04
Contacts, 2026-09-12
Auto-vérification
97,6 % rattrapés / 39,0 % de fausses
76,0 % rattrapés / 20,8 % de fausses
Accord des trois modèles
92,9 % rattrapés / 11,0 % de fausses
62,9 % rattrapés / 9,2 % de fausses
La règle mécanique gratuite
59,5 % rattrapés / 22,0 % de fausses
72,2 % rattrapés / 0,0 % de fausses
Trois lectures, et aucune n'annule les autres. Les deux garde-fous à modèle descendent quand l'arithmétique disparaît, ils ne s'effondrent pas. Leur taux de fausse alerte descend aussi, et leur précision monte. Et le classement tient : l'auto-vérification rattrape plus, l'accord est plus précis. C'est le seul résultat d'ici qui se transporte.
Le garde-fou se retourne contre le meilleur modèle
Modèle
Fusions fausses proposées
Rattrapage A4
Précision A4
openai/gpt-4o-mini
46 sur 133
73,9 %
87,2 %
google/gemini-2.5-flash-lite
32 sur 124
62,5 %
66,7 %
anthropic/claude-haiku-4.5
19 sur 111
36,8 %
41,2 %
Le mécanisme ne demande aucune hypothèse : l'accord punit l'écart à la majorité, et le modèle le plus prudent est précisément celui qui s'écarte le plus souvent en ayant raison.
Le meilleur témoin change avec la tâche
Témoin unique
Précision sur factures
Précision sur contacts
gpt-4o-mini
65,8 %
44,8 %
gemini-2.5-flash-lite
74,1 %
78,8 %
claude-haiku-4.5
37,9 %
91,1 %
Le meilleur témoin des factures est le pire ici, et le pire des factures est le meilleur ici. C'est le seul endroit de ce test où la réponse honnête est : mesurez-le sur votre propre tâche.
Par niveau de désordre
Niveau
Fusions proposées
Fausses
A1 rattrape
A3 rattrape
A4 rattrape
Fausse alerte A4
N1 propre
82
18
66,7 %
88,2 %
83,3 %
10,9 %
N2 casse et espaces
95
26
69,2 %
65,4 %
53,8 %
8,7 %
N3 formats de téléphone mélangés
104
33
72,7 %
78,8 %
63,6 %
2,8 %
N4 colonnes fusionnées
87
20
80,0 %
75,0 %
55,0 %
14,9 %
Le carnet propre est le seul niveau où l'accord rattrape plus de huit fusions fausses sur dix, et c'est aussi celui qui en contient le moins. Là où il y a le plus à attraper, N3 et ses 33 fusions fausses, il en attrape 63,6 %.
Charge de relecture
Pour 1000 fusions proposées, dans une population où 264 sont fausses, ce qui est la proportion de ce corpus et non celle d'un carnet réel.
Garde-fou
À relire
Fusions fausses trouvées
Manquées
Lectures par fusion trouvée
A1
190
190
73
1,0
A3
355
202
64
1,8
A4
234
166
98
1,4
A1 et A4
307
239
25
1,3
Coûts
La passe d'auto-vérification, 96 appels : 0,07469 USD au total. Pour 1000 appels d'auto-vérification : gpt-4o-mini 0,196 USD, gemini-2.5-flash-lite 0,161 USD, claude-haiku-4.5 1,977 USD. Rien de tout cela n'est cher. La ressource chère est la personne qui relit les fusions signalées.
L'auto-vérification n'est pas faible, elle regarde ailleurs
Voici une réponse brute, telle qu'elle est revenue. Même modèle, même carnet, même appel : quatre groupes proposés, quatre verdicts.
Les lignes 4 et 5 sont Julie Lindqvist chez Halloway Electric Company à Peoria et Julie Lindqvist chez Vermillion Textiles LLC à Duluth. Société différente, ville différente, courriel différent, téléphone différent. Deux personnes. Le modèle les a fusionnées, puis a confirmé la fusion.
Les lignes 6 et 9 sont Ted Delgado et Theodore Delgado, tous deux chez Alder Bay Packaging, qui partagent la même adresse de courriel, t.delgado@alderbay.example. Une seule personne. Le modèle les a fusionnées à juste titre, puis a refusé sa propre fusion juste.
Dans une seule réponse, sur un seul carnet, l'auto-vérification a confirmé une fusion que rien n'appuie et rejeté une fusion qu'un courriel identique appuie. Elle ne lit les clés d'identité dans aucun des deux sens : elle lit la ressemblance des noms. C'est pourquoi la règle mécanique gratuite la bat en précision, 100 % contre 57 %, sans coûter un seul appel.
Ce que nous en ferions
Poser la règle des clés d'abord, puis un second modèle. A1 et A4 ensemble rattrapent 90,7 % des fusions fausses avec 9,2 % de fausses alertes et 1,3 lecture par fusion trouvée. C'est la meilleure combinaison de ce test, et la moitié « règle des clés » est gratuite.
Ne choisissez pas votre second modèle dans le palmarès de quelqu'un d'autre. Le classement des trois témoins s'inverse entre deux tâches de la même famille. Une passe supplémentaire d'un candidat sur cinquante paires que vous avez déjà tranchées vous en dira plus que n'importe quel tableau publié, celui-ci compris.
Méfiez-vous de l'accord entre modèles si vous avez déjà choisi le modèle prudent. Sur celui qui fait le moins de fusions fausses ici, l'accord en a rattrapé à peine un tiers et crié au loup sur 6 alertes sur 10.
Servez-vous du booléen par groupe, pas de la prose. C'est le booléen qui est noté ici, à 57 % de précision. Le texte libre qui l'accompagne n'a pas été noté et ne doit pas être traité comme s'il l'avait été : il est publié dans l'archive pour que vous en jugiez vous-même.
Mesurez toujours les deux chiffres. A1 affiche 0 % de fausse alerte sur ce corpus, et ce chiffre est vrai par construction, pas par mérite.
Les limites, dites franchement
Cette section n'est pas une formalité. C'est la condition pour que le reste soit lisible.
Les 0 % de fausse alerte d'A1 sont vrais par construction. Ce corpus impose à toute paire de doublons de partager un courriel ou un téléphone. Dans un carnet réel, une personne ayant changé des deux verrait sa fusion bloquée par cette règle. Nous l'avons dit le 2026-08-18 et nous le répétons ici, parce que c'est le chiffre le plus flatteur du tableau.
Les partitions ont 26 jours. Elles ont été produites le 2026-08-17. Rien ici ne dit que les mêmes modèles font les mêmes fusions aujourd'hui.
97 fusions fausses au plus. Tous les taux de rattrapage reposent là-dessus. Un pourcentage sur 97 éléments a une marge large : des ordres de grandeur, pas des constantes.
2 des 96 réponses ne sont pas du JSON valide, et 7 des 366 groupes soumis sont revenus sans verdict. Ces 7 fusions sortent de la population d'A3, qui est donc notée sur 96 fausses et 265 justes au lieu de 97 et 271. Le chiffre n'est pas réparé, il est déclaré.
A5 laisse 111 fusions non jugées par construction : un modèle ne peut pas être son propre témoin.
Un seul corpus, 96 lignes construites par script, graine fixe, déclaré comme construit dans son propre protocole. Aucune personne réelle. Les familles de pièges sont des propriétés voulues de ce corpus et leur fréquence ici n'est pas celle du CRM d'une entreprise.
Des carnets de 12 lignes, entièrement dans la fenêtre du modèle : le cas le plus favorable. Un carnet de 5000 lignes est un problème différent, non mesuré ici.
Trois modèles, un fournisseur, un jour. La passe d'auto-vérification est passée par OpenRouter le 2026-09-12.
La consigne d'auto-vérification est UNE consigne. Une autre donnerait d'autres chiffres. Nous publions celle que nous avons passée plutôt que d'en chercher une flatteuse.
La comparaison avec le test des factures met en regard deux tâches ET deux corpus. Ce qui change n'est pas seulement la présence d'une arithmétique, et ce test ne sait pas séparer les deux.
Une seule langue. Les carnets sont en anglais.
Rejouez-le
Tout est publié, pas résumé : les 96 partitions jugées, le script d'auto-vérification, les 96 réponses brutes exactement telles que les modèles les ont rendues, et l'analyse qui produit chacun des chiffres ci-dessus.
L'analyse n'appelle aucun modèle : elle rejoue à coût nul, et une règle de garde-fou que vous contestez peut être changée puis rejouée sur les mêmes 96 réponses. La clé d'API est lue dans une variable d'environnement et n'apparaît dans aucun de ces fichiers.
Télécharger le jeu de données (zip, avec l'inventaire complet et la somme de contrôle). Les scripts et leurs commentaires sont en français, qui est la langue de travail derrière ce site.
Si vous rejouez ce test et trouvez autre chose, nous voulons le savoir. Il y a un formulaire de contact, et les corrections sont publiées sur l'article lui-même, datées, comme le disent les règles éditoriales de ce site.
Prix faux, ligne jamais commandée, référence fausse, devise fausse : attrapés 383 fois sur 383. Les dix-sept faux accords du test portent tous sur une seule condition, la sur-livraison, et un modèle a écrit l'écart avant de l'approuver.
Sur une facture propre, la montée en gamme n'achète rien : les six modèles sont à 100 %. Là où elle achète quelque chose, les trois fournisseurs achètent les mêmes 10 ou 11 factures justes sur 96, et le prix de ce gain identique varie d'un facteur 6,5. Coûts lus dans l'API, jamais dans une grille tarifaire.
Le contrôle arithmétique publié en août rattrape 59 % des erreurs et se déclenche sur 22 % des extractions justes. Nous avons posé quatre garde-fous différents sur les mêmes 288 extractions. Celui qui rattrape le plus est le pire à déployer, et l'accord entre modèles ne se déclenche jamais sur une facture propre.