Jeu de données
Répétabilité d'une étape LLM à température 0
360 réponses brutes de modèles, 12 entrées reprises des trois corpus déjà publiés ici, 3 modèles, 10 répétitions chacune. Test conduit le 2026-08-25.
Cette page décrit un jeu de données, publié en entier. C'est la matière brute derrière notre mesure de ce que la température 0 garantit réellement : 12 entrées, 3 modèles, 10 répétitions de chaque couple, et les 360 réponses que ces modèles ont réellement rendues.
Tout ce qui est sur cette page vient de ce seul passage. Rien n'est estimé.
Ce qu'il mesure, et ce qu'il ne prouve pas
Il mesure une chose précisément : est-ce que la même entrée, envoyée dix fois au même modèle à température 0 avec une consigne identique, revient sous la forme de la même réponse ? Puis, sur les couples où ce n'est pas le cas, est-ce que quelque chose dans la sortie signalerait à un flux de travail que quelque chose a bougé.
C'est le premier jeu de données publié ici qui ne mesure pas la justesse. Les trois précédents demandaient si le modèle avait raison. Celui-ci demande s'il est répétable, ce qui est une autre propriété et, comme les chiffres le montrent, une propriété indépendante.
Ce qu'il ne prouve pas, dit franchement, parce qu'un jeu de données cité sans ses limites fait plus de mal que pas de jeu de données du tout :
- Un jour, une heure, un fournisseur. Les 360 appels sont passés par OpenRouter le 2026-08-25. Rien ici ne dit ce que les mêmes modèles rendront dans un mois.
- 12 entrées, quatre par forme de sortie. Un taux calculé sur 12 cellules a une marge large. C'est un ordre de grandeur, pas une constante.
- Entrées de niveau 1 uniquement, le niveau propre des trois corpus d'origine, le plus favorable des quatre disponibles.
- Les entrées viennent de corpus construits par script, à graines fixes, déclarés comme construits dans leurs propres protocoles. Aucune facture réelle, aucun carnet réel, aucune réunion réelle.
- Rien sur les fenêtres longues. Les trois corpus tiennent largement dans la fenêtre de contexte des trois modèles.
- Le classement entre silencieux et visible dépend de la validation qu'on suppose. La nôtre vérifie les clés, les types, et pour la tâche binaire que chaque groupe compte au moins deux identifiants. Une validation plus riche verrait davantage.
Les entrées sont réutilisées, et voici ce que cela implique
Rien n'a été créé pour ce test. Les 12 entrées sont les quatre premiers éléments de chacun des trois corpus déjà publiés sur ce site, pris au niveau de dégradation 1, sans tirage. La sélection est déterministe et se rejoue à l'identique. Les consignes sont recopiées mot pour mot des tests d'origine : en changer une seule ferait mesurer autre chose que ce que ces tests ont mesuré.
C'est un choix délibéré et il coupe des deux côtés. Ce qu'il apporte : la vérité terrain existe déjà, déjà publiée, déjà contestable par qui le souhaite. Ce qu'il coûte : le périmètre est exactement celui des tests précédents, et il hérite de leurs limites en même temps que de leurs données.
Ce jeu de données n'a pas de graine propre, parce qu'il ne génère rien. Sa
reproductibilité repose sur les graines des trois corpus d'origine, qui sont
20260810 pour les factures, 20260817 pour les carnets d'adresses et
20260818 pour les réunions. Régénérez ces trois corpus, prenez les quatre
premiers éléments de chacun au niveau de dégradation 1, et vous tenez exactement
les 12 entrées utilisées ici.
Les trois corpus d'origine donnent trois formes de sortie, qui sont la variable sous test : fermée (7 champs d'une facture, taille connue d'avance), binaire (regrouper les doublons d'un carnet d'adresses, une décision) et ouverte (lister les actions d'un compte rendu, longueur libre).
Test conduit le 2026-08-25. Les appels ont été passés par la chaîne de test automatisée de ce site : le constructeur d'entrées, les appels aux modèles et l'analyse sont des scripts, et ils sont tous dans l'archive ci-dessous.
Les chiffres bruts
Stabilité par niveau de comparaison
| Niveau de comparaison | Cellules stables sur 36 | Part |
|---|---|---|
entière, notes comprise |
19 | 52,8 % |
charge utile, notes exclue |
24 | 66,7 % |
| sémantique, ordre ignoré | 27 | 75,0 % |
Par forme de sortie, au niveau de la charge utile
| Forme | Cellules stables | Variantes moyennes | Variantes max | Divergences silencieuses |
|---|---|---|---|---|
| fermée | 12 / 12 | 1,00 | 1 | 0 |
| binaire | 7 / 12 | 1,75 | 5 | 5 |
| ouverte | 5 / 12 | 2,08 | 6 | 7 |
Par modèle, au niveau de la charge utile
| Modèle | fermée | binaire | ouverte | ensemble | Divergences silencieuses |
|---|---|---|---|---|---|
| anthropic/claude-haiku-4.5 | 4/4 | 4/4 | 4/4 | 12/12 | 0 |
| openai/gpt-4o-mini | 4/4 | 2/4 | 1/4 | 7/12 | 5 |
| google/gemini-2.5-flash-lite | 4/4 | 1/4 | 0/4 | 5/12 | 7 |
Visible contre silencieux
| Nombre | |
|---|---|
| Appels passés | 360 |
| Appels ayant échoué à la validation de structure | 0 |
| Cellules ayant divergé | 12 |
| dont visibles par un contrôle de schéma | 0 |
| dont silencieuses | 12 |
Ce que vaut un essai unique
Calculé sur les 24 cellules dont la vérité terrain est bon marché et indiscutable, fermée et binaire. La forme ouverte n'est pas scorée en justesse ici.
| Ensemble | fermée | binaire | |
|---|---|---|---|
| Cellules justes sur 10 appels sur 10 | 16 / 24 | 12 / 12 | 4 / 12 |
| Cellules justes sur 0 appel sur 10 | 7 / 24 | 0 | 7 / 12 |
| Cellules partiellement justes | 1 / 24 | 0 | 1 / 12 |
| P(cellule fiable sachant un essai juste tiré au hasard) | 0,947 | 1,000 | 0,816 |
Coût total mesuré des 360 appels : 0,247 USD.
Ce que contient l'archive
Six fichiers, 697994 octets décompressés. L'inventaire est ici pour que vous sachiez ce que vous téléchargez avant de le télécharger.
| Fichier | Ce qu'il contient | Taille |
|---|---|---|
entrees.py |
construit les 12 entrées depuis les trois corpus d'origine, consignes comprises | 5,4 Kio |
conduire-test.py |
les 360 appels, sans rien interpréter | 5,0 Kio |
resultats-bruts.json |
les 360 réponses, brutes, avec les 12 consignes utilisées | 624,4 Kio |
analyser.py |
tout le classement, recalculable sans rappeler un modèle | 10,5 Kio |
chiffres.json |
les chiffres calculés, plus une ligne par cellule | 24,0 Kio |
PROTOCOLE.md |
le protocole, la lecture des chiffres et les limites | 12,3 Kio |
Les scripts et leurs commentaires sont en français, qui est la langue de travail derrière ce site. La clé d'API est lue dans l'environnement et n'apparaît dans aucun de ces fichiers.
Rejouer le test
L'analyse ne rappelle aucun modèle : elle se rejoue à coût nul sur les réponses
brutes livrées dans l'archive. Seul conduire-test.py dépense quelque chose.
unzip 2026-08-temperature-zero-repeatability.zip
python3 conduire-test.py --sortie resultats-bruts.json --repetitions 10 \
--modeles openai/gpt-4o-mini google/gemini-2.5-flash-lite anthropic/claude-haiku-4.5
python3 analyser.py --brut resultats-bruts.json --sortie chiffres.json--rejouer resultats-bruts.json ne rappelle que les lignes marquées lu: false :
un passage interrompu reprend sans payer deux fois.
Chaque réponse brute est une entrée de resultats-bruts.json, telle que le modèle
l'a rendue, avant tout classement. Celle-ci est le rang 9 de la cellule qui a
divergé au rang 10 :
{"modele": "google/gemini-2.5-flash-lite", "entree": "binaire-carnet-01",
"forme": "binaire", "rang": 9, "lu": true, "json_valide": true,
"reponse": {"groups": [["1","10"],["3","8"],["6","9"],["7","11"]],
"notes": "Row 5 and 4 have the same first name and last name, but different companies and emails, suggesting they are different people."}}Vérifiez ce que vous avez téléchargé avant de lui faire confiance :
shasum -a 256 2026-08-temperature-zero-repeatability.zip
# deda8d0f9829ed98807a39b19619cd42f1fe1111b9e25a477551b41deef493fdComment citer ce jeu de données
Copiez l'une des deux formes ci-dessous. La référence pointe vers cette page, qui est l'adresse stable de ce jeu de données ; l'archive est ce que cette adresse sert.
Think AI First (2026). Répétabilité d'une étape LLM à température 0, 360 réponses brutes.
Think AI First. Test conduit le 2026-08-25, publié le 2026-09-01.
https://think-ai-first.com/fr/donnees/repetabilite-temperature-zero-2026-08. Sous licence CC BY 4.0.@dataset{thinkaifirst2026repetabilite,
author = {{Think AI First}},
title = {Répétabilité d'une étape LLM à température 0, 360 réponses brutes},
year = {2026},
publisher = {Think AI First},
url = {https://think-ai-first.com/fr/donnees/repetabilite-temperature-zero-2026-08},
note = {Test conduit le 2026-08-25. Sous licence CC BY 4.0. Empreinte SHA-256 de l'archive deda8d0f9829ed98807a39b19619cd42f1fe1111b9e25a477551b41deef493fd}
}Licence et réutilisation
Publié sous CC BY 4.0. Utilisez-le, citez-le, contredisez-le. Si vous rejouez ce test et obtenez autre chose, dites-le nous par le formulaire de contact : les corrections sont publiées sur l'article lui-même, datées.
Télécharger le jeu de données (zip, 37,5 Kio, 6 fichiers)
Les autres jeux de données publiés ici
Chacun est un test distinct, avec son corpus, ses réponses brutes et son archive. Celui-ci réutilise des entrées des trois autres.
- Extraction de factures par trois modèles économiques, 288 réponses brutes, test conduit le 2026-08-10.
- Dédoublonnage de contacts par trois modèles économiques, 96 réponses brutes, test conduit le 2026-08-17.
- Extraction des actions d'un compte rendu par trois modèles économiques, 96 réponses brutes, test conduit le 2026-08-18.
- Quatre garde-fous de détection d'erreur sur 288 extractions de factures, 288 réponses brutes d'auto-vérification, test conduit le 2026-09-04.
- Prix contre justesse en extraction de factures, six modèles, 864 réponses brutes avec leur coût facturé, test conduit le 2026-09-06.
- Deux garde-fous de détection d'erreur sur 368 fusions de contacts proposées, 96 réponses brutes d'auto-vérification, test conduit le 2026-09-12.
- Rapprochement facture et bon de commande par quatre modèles, 672 décisions brutes, test conduit le 2026-09-14.