Jeu de données

Répétabilité d'une étape LLM à température 0

360 réponses brutes de modèles, 12 entrées reprises des trois corpus déjà publiés ici, 3 modèles, 10 répétitions chacune. Test conduit le 2026-08-25.

Cette page décrit un jeu de données, publié en entier. C'est la matière brute derrière notre mesure de ce que la température 0 garantit réellement : 12 entrées, 3 modèles, 10 répétitions de chaque couple, et les 360 réponses que ces modèles ont réellement rendues.

Tout ce qui est sur cette page vient de ce seul passage. Rien n'est estimé.

Ce qu'il mesure, et ce qu'il ne prouve pas

Il mesure une chose précisément : est-ce que la même entrée, envoyée dix fois au même modèle à température 0 avec une consigne identique, revient sous la forme de la même réponse ? Puis, sur les couples où ce n'est pas le cas, est-ce que quelque chose dans la sortie signalerait à un flux de travail que quelque chose a bougé.

C'est le premier jeu de données publié ici qui ne mesure pas la justesse. Les trois précédents demandaient si le modèle avait raison. Celui-ci demande s'il est répétable, ce qui est une autre propriété et, comme les chiffres le montrent, une propriété indépendante.

Ce qu'il ne prouve pas, dit franchement, parce qu'un jeu de données cité sans ses limites fait plus de mal que pas de jeu de données du tout :

  • Un jour, une heure, un fournisseur. Les 360 appels sont passés par OpenRouter le 2026-08-25. Rien ici ne dit ce que les mêmes modèles rendront dans un mois.
  • 12 entrées, quatre par forme de sortie. Un taux calculé sur 12 cellules a une marge large. C'est un ordre de grandeur, pas une constante.
  • Entrées de niveau 1 uniquement, le niveau propre des trois corpus d'origine, le plus favorable des quatre disponibles.
  • Les entrées viennent de corpus construits par script, à graines fixes, déclarés comme construits dans leurs propres protocoles. Aucune facture réelle, aucun carnet réel, aucune réunion réelle.
  • Rien sur les fenêtres longues. Les trois corpus tiennent largement dans la fenêtre de contexte des trois modèles.
  • Le classement entre silencieux et visible dépend de la validation qu'on suppose. La nôtre vérifie les clés, les types, et pour la tâche binaire que chaque groupe compte au moins deux identifiants. Une validation plus riche verrait davantage.

Les entrées sont réutilisées, et voici ce que cela implique

Rien n'a été créé pour ce test. Les 12 entrées sont les quatre premiers éléments de chacun des trois corpus déjà publiés sur ce site, pris au niveau de dégradation 1, sans tirage. La sélection est déterministe et se rejoue à l'identique. Les consignes sont recopiées mot pour mot des tests d'origine : en changer une seule ferait mesurer autre chose que ce que ces tests ont mesuré.

C'est un choix délibéré et il coupe des deux côtés. Ce qu'il apporte : la vérité terrain existe déjà, déjà publiée, déjà contestable par qui le souhaite. Ce qu'il coûte : le périmètre est exactement celui des tests précédents, et il hérite de leurs limites en même temps que de leurs données.

Ce jeu de données n'a pas de graine propre, parce qu'il ne génère rien. Sa reproductibilité repose sur les graines des trois corpus d'origine, qui sont 20260810 pour les factures, 20260817 pour les carnets d'adresses et 20260818 pour les réunions. Régénérez ces trois corpus, prenez les quatre premiers éléments de chacun au niveau de dégradation 1, et vous tenez exactement les 12 entrées utilisées ici.

Les trois corpus d'origine donnent trois formes de sortie, qui sont la variable sous test : fermée (7 champs d'une facture, taille connue d'avance), binaire (regrouper les doublons d'un carnet d'adresses, une décision) et ouverte (lister les actions d'un compte rendu, longueur libre).

Test conduit le 2026-08-25. Les appels ont été passés par la chaîne de test automatisée de ce site : le constructeur d'entrées, les appels aux modèles et l'analyse sont des scripts, et ils sont tous dans l'archive ci-dessous.

Les chiffres bruts

Stabilité par niveau de comparaison

Niveau de comparaison Cellules stables sur 36 Part
entière, notes comprise 19 52,8 %
charge utile, notes exclue 24 66,7 %
sémantique, ordre ignoré 27 75,0 %

Par forme de sortie, au niveau de la charge utile

Forme Cellules stables Variantes moyennes Variantes max Divergences silencieuses
fermée 12 / 12 1,00 1 0
binaire 7 / 12 1,75 5 5
ouverte 5 / 12 2,08 6 7

Par modèle, au niveau de la charge utile

Modèle fermée binaire ouverte ensemble Divergences silencieuses
anthropic/claude-haiku-4.5 4/4 4/4 4/4 12/12 0
openai/gpt-4o-mini 4/4 2/4 1/4 7/12 5
google/gemini-2.5-flash-lite 4/4 1/4 0/4 5/12 7

Visible contre silencieux

Nombre
Appels passés 360
Appels ayant échoué à la validation de structure 0
Cellules ayant divergé 12
dont visibles par un contrôle de schéma 0
dont silencieuses 12

Ce que vaut un essai unique

Calculé sur les 24 cellules dont la vérité terrain est bon marché et indiscutable, fermée et binaire. La forme ouverte n'est pas scorée en justesse ici.

Ensemble fermée binaire
Cellules justes sur 10 appels sur 10 16 / 24 12 / 12 4 / 12
Cellules justes sur 0 appel sur 10 7 / 24 0 7 / 12
Cellules partiellement justes 1 / 24 0 1 / 12
P(cellule fiable sachant un essai juste tiré au hasard) 0,947 1,000 0,816

Coût total mesuré des 360 appels : 0,247 USD.

Ce que contient l'archive

Six fichiers, 697994 octets décompressés. L'inventaire est ici pour que vous sachiez ce que vous téléchargez avant de le télécharger.

Fichier Ce qu'il contient Taille
entrees.py construit les 12 entrées depuis les trois corpus d'origine, consignes comprises 5,4 Kio
conduire-test.py les 360 appels, sans rien interpréter 5,0 Kio
resultats-bruts.json les 360 réponses, brutes, avec les 12 consignes utilisées 624,4 Kio
analyser.py tout le classement, recalculable sans rappeler un modèle 10,5 Kio
chiffres.json les chiffres calculés, plus une ligne par cellule 24,0 Kio
PROTOCOLE.md le protocole, la lecture des chiffres et les limites 12,3 Kio

Les scripts et leurs commentaires sont en français, qui est la langue de travail derrière ce site. La clé d'API est lue dans l'environnement et n'apparaît dans aucun de ces fichiers.

Rejouer le test

L'analyse ne rappelle aucun modèle : elle se rejoue à coût nul sur les réponses brutes livrées dans l'archive. Seul conduire-test.py dépense quelque chose.

bash
unzip 2026-08-temperature-zero-repeatability.zip
python3 conduire-test.py --sortie resultats-bruts.json --repetitions 10 \
    --modeles openai/gpt-4o-mini google/gemini-2.5-flash-lite anthropic/claude-haiku-4.5
python3 analyser.py --brut resultats-bruts.json --sortie chiffres.json

--rejouer resultats-bruts.json ne rappelle que les lignes marquées lu: false : un passage interrompu reprend sans payer deux fois.

Chaque réponse brute est une entrée de resultats-bruts.json, telle que le modèle l'a rendue, avant tout classement. Celle-ci est le rang 9 de la cellule qui a divergé au rang 10 :

json
{"modele": "google/gemini-2.5-flash-lite", "entree": "binaire-carnet-01",
 "forme": "binaire", "rang": 9, "lu": true, "json_valide": true,
 "reponse": {"groups": [["1","10"],["3","8"],["6","9"],["7","11"]],
   "notes": "Row 5 and 4 have the same first name and last name, but different companies and emails, suggesting they are different people."}}

Vérifiez ce que vous avez téléchargé avant de lui faire confiance :

bash
shasum -a 256 2026-08-temperature-zero-repeatability.zip
# deda8d0f9829ed98807a39b19619cd42f1fe1111b9e25a477551b41deef493fd

Comment citer ce jeu de données

Copiez l'une des deux formes ci-dessous. La référence pointe vers cette page, qui est l'adresse stable de ce jeu de données ; l'archive est ce que cette adresse sert.

citation
Think AI First (2026). Répétabilité d'une étape LLM à température 0, 360 réponses brutes.
Think AI First. Test conduit le 2026-08-25, publié le 2026-09-01.
https://think-ai-first.com/fr/donnees/repetabilite-temperature-zero-2026-08. Sous licence CC BY 4.0.
bibtex
@dataset{thinkaifirst2026repetabilite,
  author    = {{Think AI First}},
  title     = {Répétabilité d'une étape LLM à température 0, 360 réponses brutes},
  year      = {2026},
  publisher = {Think AI First},
  url       = {https://think-ai-first.com/fr/donnees/repetabilite-temperature-zero-2026-08},
  note      = {Test conduit le 2026-08-25. Sous licence CC BY 4.0. Empreinte SHA-256 de l'archive deda8d0f9829ed98807a39b19619cd42f1fe1111b9e25a477551b41deef493fd}
}

Licence et réutilisation

Publié sous CC BY 4.0. Utilisez-le, citez-le, contredisez-le. Si vous rejouez ce test et obtenez autre chose, dites-le nous par le formulaire de contact : les corrections sont publiées sur l'article lui-même, datées.

Télécharger le jeu de données (zip, 37,5 Kio, 6 fichiers)

Les autres jeux de données publiés ici

Chacun est un test distinct, avec son corpus, ses réponses brutes et son archive. Celui-ci réutilise des entrées des trois autres.