Tous les articles
Petite entreprise 12 min de lecture

Les garde-fous d'un LLM tiennent-ils sans arithmétique à vérifier ? 368 fusions, cinq contrôles

L'auto-vérification rattrape 97,6 % des extractions de factures fausses. Sur des fusions de contacts, où rien ne se recalcule, elle en rattrape 76,0 %. L'accord entre modèles tombe de 92,9 % à 62,9 %, et il marche le plus mal sur le modèle qui se trompe le moins.

Composition geometrique abstraite en deux tons, illustration de couverture
Publié le
12 septembre 2026
Rubrique
Petite entreprise

Un modèle nettoie un carnet de contacts, fusionne deux lignes, et l'une des deux personnes cesse d'exister. Rien ne plante. Le test publié le 2026-08-18 a mesuré la fréquence de cet accident : 48,4 % des paires pièges ont été fusionnées, et 70 % de ces fusions fausses revenaient sans que rien, dans la sortie du modèle, n'envoie quiconque vérifier.

Deux semaines plus tard, nous avons mesuré quels garde-fous rattrapent une extraction fausse sur une facture. Les deux qui tenaient debout étaient : demander au modèle de vérifier sa propre sortie, et faire tourner un second modèle puis comparer. Mais une facture porte un troisième garde-fou qui ne coûte rien, sous-total + taxe = total. Un carnet de contacts n'a aucune arithmétique. Nous avons donc posé les deux mêmes garde-fous sur les mêmes 96 passes de dédoublonnage, et les avons notés de la même façon.

Les deux garde-fous marchent encore, et les deux perdent de 22 à 30 points de rattrapage. L'auto-vérification rattrape 97,6 % des extractions fausses sur facture ; sur des fusions elle en rattrape 76,0 %. L'accord entre modèles tombe de 92,9 % à 62,9 %.

Ils deviennent aussi plus silencieux, et plus souvent justes quand ils parlent. L'auto-vérification signale 39 % des extractions justes sur facture, mais seulement 20,8 % des fusions justes, et sa précision monte de 29,9 % à 57,0 %. Moins de rattrapages, moins de bruit.

L'accord entre modèles marche le plus mal sur le meilleur modèle. claude-haiku-4.5 propose le moins de fusions fausses des trois, 19 sur 111, et l'accord n'en rattrape que 36,8 % pendant que 6 de ses 10 alertes portent sur une fusion juste. Plus votre modèle est bon, moins ce garde-fou vous aide.

Le meilleur second modèle n'est pas le même d'une tâche à l'autre. Comme témoin unique, gpt-4o-mini avait la meilleure précision sur les factures, 65,8 %, et il a la pire ici, 44,8 %. claude-haiku-4.5 avait la pire sur les factures, 37,9 %, et il a la meilleure ici, 91,1 %. Il n'existe pas de second modèle à recommander en général.

La méthode, en bref

Test conduit le 2026-09-12 par la chaîne de test automatisée de ce site : le corpus, les appels aux modèles et l'analyse sont des scripts, publiés plus bas pour que chacun puisse les rejouer et contester le résultat. Etienne signe cet article et répond de son contenu.

C'est le septième test mesuré publié ici, et le deuxième qui mesure des contrôles plutôt que des modèles.

Les 96 passes de dédoublonnage n'ont pas été refaites. Ce sont exactement celles publiées le 2026-08-18 sous le jeu de données de dédoublonnage : 8 carnets de 12 lignes générés par script, graine 20260817, quatre niveaux de désordre de présentation, trois modèles économiques, et une partition de vérité terrain tranchée à ce moment-là. Les rejouer aujourd'hui aurait mêlé l'effet des garde-fous à 26 jours de dérive des modèles, et aucun chiffre ci-dessous n'aurait séparé les deux.

L'unité notée ici n'est ni un carnet ni un appel. C'est une fusion proposée : une paire de lignes qu'un modèle a mises dans un même groupe.

Nombre
Fusions proposées, toutes passes confondues 368
Justes : deux lignes, une personne 271
Fausses : deux personnes, une ligne détruite 97

Les garde-fous

Ce qu'il fait Coût
A0 le champ notes du modèle, rempli pendant le dédoublonnage : nomme-t-il les deux lignes ? aucun
A1 clés fortes : refuser toute fusion dont les lignes ne partagent ni courriel ni téléphone aucun
A3 auto-vérification : un appel de plus au même modèle, avec le carnet et ses propres groupes un appel par passe
A4 accord des trois modèles : signaler toute fusion que les deux autres n'ont pas proposée deux passes de plus
A5 accord avec un seul autre modèle, calculé pour les trois témoins une passe de plus

A1 est le garde-fou de forme arithmétique de cette tâche, et la comparaison est tout l'objet du test : sous-total + taxe = total est vrai dans le monde, tandis que « deux doublons partagent un courriel ou un téléphone » n'est vrai que dans ce corpus. Cette réserve n'est pas décorative, et son prix est chiffré plus bas.

La consigne d'A3 ne laisse jamais entendre qu'une erreur a été trouvée et ne donne aucune vérité terrain. Dire au modèle qu'une erreur existe mesurerait la docilité, pas la détection. Le verdict est demandé groupe par groupe et non sur la partition entière : un verdict global ne se raccorde à aucune fusion précise, et un garde-fou qui ne nomme pas la ligne à relire ne dit pas où regarder.

Les chiffres bruts

368 fusions jugées, 97 fausses, 271 justes.

Garde-fou Rattrapage Fausse alerte Précision Fusions fausses manquées
A0 note spontanée 73,2 % 55,4 % 32,1 % 26
A1 clés fortes 72,2 % 0,0 % 100,0 % 27
A3 auto-vérification 76,0 % 20,8 % 57,0 % 23
A4 accord des trois modèles 62,9 % 9,2 % 70,9 % 36
A5 avec gpt-4o-mini seul 25,5 % 8,7 % 44,8 % 38
A5 avec gemini-2.5-flash-lite seul 40,0 % 3,9 % 78,8 % 39
A5 avec claude-haiku-4.5 seul 65,4 % 2,8 % 91,1 % 27
A1 et A4 ensemble 90,7 % 9,2 % 77,9 % 9
A1 et A3 ensemble 92,7 % 20,8 % 61,8 % 7
A3 et A4 ensemble 87,6 % 27,4 % 53,8 % 12

Mêmes garde-fous, deux tâches

Garde-fou Factures, 2026-09-04 Contacts, 2026-09-12
Auto-vérification 97,6 % rattrapés / 39,0 % de fausses 76,0 % rattrapés / 20,8 % de fausses
Accord des trois modèles 92,9 % rattrapés / 11,0 % de fausses 62,9 % rattrapés / 9,2 % de fausses
La règle mécanique gratuite 59,5 % rattrapés / 22,0 % de fausses 72,2 % rattrapés / 0,0 % de fausses

Trois lectures, et aucune n'annule les autres. Les deux garde-fous à modèle descendent quand l'arithmétique disparaît, ils ne s'effondrent pas. Leur taux de fausse alerte descend aussi, et leur précision monte. Et le classement tient : l'auto-vérification rattrape plus, l'accord est plus précis. C'est le seul résultat d'ici qui se transporte.

Le garde-fou se retourne contre le meilleur modèle

Modèle Fusions fausses proposées Rattrapage A4 Précision A4
openai/gpt-4o-mini 46 sur 133 73,9 % 87,2 %
google/gemini-2.5-flash-lite 32 sur 124 62,5 % 66,7 %
anthropic/claude-haiku-4.5 19 sur 111 36,8 % 41,2 %

Le mécanisme ne demande aucune hypothèse : l'accord punit l'écart à la majorité, et le modèle le plus prudent est précisément celui qui s'écarte le plus souvent en ayant raison.

Le meilleur témoin change avec la tâche

Témoin unique Précision sur factures Précision sur contacts
gpt-4o-mini 65,8 % 44,8 %
gemini-2.5-flash-lite 74,1 % 78,8 %
claude-haiku-4.5 37,9 % 91,1 %

Le meilleur témoin des factures est le pire ici, et le pire des factures est le meilleur ici. C'est le seul endroit de ce test où la réponse honnête est : mesurez-le sur votre propre tâche.

Par niveau de désordre

Niveau Fusions proposées Fausses A1 rattrape A3 rattrape A4 rattrape Fausse alerte A4
N1 propre 82 18 66,7 % 88,2 % 83,3 % 10,9 %
N2 casse et espaces 95 26 69,2 % 65,4 % 53,8 % 8,7 %
N3 formats de téléphone mélangés 104 33 72,7 % 78,8 % 63,6 % 2,8 %
N4 colonnes fusionnées 87 20 80,0 % 75,0 % 55,0 % 14,9 %

Le carnet propre est le seul niveau où l'accord rattrape plus de huit fusions fausses sur dix, et c'est aussi celui qui en contient le moins. Là où il y a le plus à attraper, N3 et ses 33 fusions fausses, il en attrape 63,6 %.

Charge de relecture

Pour 1000 fusions proposées, dans une population où 264 sont fausses, ce qui est la proportion de ce corpus et non celle d'un carnet réel.

Garde-fou À relire Fusions fausses trouvées Manquées Lectures par fusion trouvée
A1 190 190 73 1,0
A3 355 202 64 1,8
A4 234 166 98 1,4
A1 et A4 307 239 25 1,3

Coûts

La passe d'auto-vérification, 96 appels : 0,07469 USD au total. Pour 1000 appels d'auto-vérification : gpt-4o-mini 0,196 USD, gemini-2.5-flash-lite 0,161 USD, claude-haiku-4.5 1,977 USD. Rien de tout cela n'est cher. La ressource chère est la personne qui relit les fusions signalées.

L'auto-vérification n'est pas faible, elle regarde ailleurs

Voici une réponse brute, telle qu'elle est revenue. Même modèle, même carnet, même appel : quatre groupes proposés, quatre verdicts.

json
{"modele": "openai/gpt-4o-mini", "carnet": "carnet-01", "niveau": 1,
 "lu": true, "json_valide": true,
 "groupes_soumis": [[4, 5], [3, 8], [6, 9], [1, 10]],
 "verdicts": [{"rows": [4, 5], "same_person": true},
              {"rows": [3, 8], "same_person": true},
              {"rows": [6, 9], "same_person": false},
              {"rows": [1, 10], "same_person": false}]}

Les lignes 4 et 5 sont Julie Lindqvist chez Halloway Electric Company à Peoria et Julie Lindqvist chez Vermillion Textiles LLC à Duluth. Société différente, ville différente, courriel différent, téléphone différent. Deux personnes. Le modèle les a fusionnées, puis a confirmé la fusion.

Les lignes 6 et 9 sont Ted Delgado et Theodore Delgado, tous deux chez Alder Bay Packaging, qui partagent la même adresse de courriel, t.delgado@alderbay.example. Une seule personne. Le modèle les a fusionnées à juste titre, puis a refusé sa propre fusion juste.

Dans une seule réponse, sur un seul carnet, l'auto-vérification a confirmé une fusion que rien n'appuie et rejeté une fusion qu'un courriel identique appuie. Elle ne lit les clés d'identité dans aucun des deux sens : elle lit la ressemblance des noms. C'est pourquoi la règle mécanique gratuite la bat en précision, 100 % contre 57 %, sans coûter un seul appel.

Ce que nous en ferions

Poser la règle des clés d'abord, puis un second modèle. A1 et A4 ensemble rattrapent 90,7 % des fusions fausses avec 9,2 % de fausses alertes et 1,3 lecture par fusion trouvée. C'est la meilleure combinaison de ce test, et la moitié « règle des clés » est gratuite.

Ne choisissez pas votre second modèle dans le palmarès de quelqu'un d'autre. Le classement des trois témoins s'inverse entre deux tâches de la même famille. Une passe supplémentaire d'un candidat sur cinquante paires que vous avez déjà tranchées vous en dira plus que n'importe quel tableau publié, celui-ci compris.

Méfiez-vous de l'accord entre modèles si vous avez déjà choisi le modèle prudent. Sur celui qui fait le moins de fusions fausses ici, l'accord en a rattrapé à peine un tiers et crié au loup sur 6 alertes sur 10.

Servez-vous du booléen par groupe, pas de la prose. C'est le booléen qui est noté ici, à 57 % de précision. Le texte libre qui l'accompagne n'a pas été noté et ne doit pas être traité comme s'il l'avait été : il est publié dans l'archive pour que vous en jugiez vous-même.

Mesurez toujours les deux chiffres. A1 affiche 0 % de fausse alerte sur ce corpus, et ce chiffre est vrai par construction, pas par mérite.

Les limites, dites franchement

Cette section n'est pas une formalité. C'est la condition pour que le reste soit lisible.

  • Les 0 % de fausse alerte d'A1 sont vrais par construction. Ce corpus impose à toute paire de doublons de partager un courriel ou un téléphone. Dans un carnet réel, une personne ayant changé des deux verrait sa fusion bloquée par cette règle. Nous l'avons dit le 2026-08-18 et nous le répétons ici, parce que c'est le chiffre le plus flatteur du tableau.
  • Les partitions ont 26 jours. Elles ont été produites le 2026-08-17. Rien ici ne dit que les mêmes modèles font les mêmes fusions aujourd'hui.
  • 97 fusions fausses au plus. Tous les taux de rattrapage reposent là-dessus. Un pourcentage sur 97 éléments a une marge large : des ordres de grandeur, pas des constantes.
  • 2 des 96 réponses ne sont pas du JSON valide, et 7 des 366 groupes soumis sont revenus sans verdict. Ces 7 fusions sortent de la population d'A3, qui est donc notée sur 96 fausses et 265 justes au lieu de 97 et 271. Le chiffre n'est pas réparé, il est déclaré.
  • A5 laisse 111 fusions non jugées par construction : un modèle ne peut pas être son propre témoin.
  • Un seul corpus, 96 lignes construites par script, graine fixe, déclaré comme construit dans son propre protocole. Aucune personne réelle. Les familles de pièges sont des propriétés voulues de ce corpus et leur fréquence ici n'est pas celle du CRM d'une entreprise.
  • Des carnets de 12 lignes, entièrement dans la fenêtre du modèle : le cas le plus favorable. Un carnet de 5000 lignes est un problème différent, non mesuré ici.
  • Trois modèles, un fournisseur, un jour. La passe d'auto-vérification est passée par OpenRouter le 2026-09-12.
  • La consigne d'auto-vérification est UNE consigne. Une autre donnerait d'autres chiffres. Nous publions celle que nous avons passée plutôt que d'en chercher une flatteuse.
  • La comparaison avec le test des factures met en regard deux tâches ET deux corpus. Ce qui change n'est pas seulement la présence d'une arithmétique, et ce test ne sait pas séparer les deux.
  • Une seule langue. Les carnets sont en anglais.

Rejouez-le

Tout est publié, pas résumé : les 96 partitions jugées, le script d'auto-vérification, les 96 réponses brutes exactement telles que les modèles les ont rendues, et l'analyse qui produit chacun des chiffres ci-dessus.

bash
python3 auto-verifier.py --resultats resultats-bruts.json --corpus corpus.json \
    --sortie verifications.json
python3 analyser.py --resultats resultats-bruts.json \
    --verifications verifications.json --sortie chiffres.json

L'analyse n'appelle aucun modèle : elle rejoue à coût nul, et une règle de garde-fou que vous contestez peut être changée puis rejouée sur les mêmes 96 réponses. La clé d'API est lue dans une variable d'environnement et n'apparaît dans aucun de ces fichiers.

Télécharger le jeu de données (zip, avec l'inventaire complet et la somme de contrôle). Les scripts et leurs commentaires sont en français, qui est la langue de travail derrière ce site.

Si vous rejouez ce test et trouvez autre chose, nous voulons le savoir. Il y a un formulaire de contact, et les corrections sont publiées sur l'article lui-même, datées, comme le disent les règles éditoriales de ce site.

A lire dans la même rubrique

Recevoir le prochain article par e-mail

Un e-mail quand un article paraît. Pas d'outil de la semaine, pas de liste d'affiliation, aucune transmission de votre adresse à qui que ce soit.