Jeu de données
Extraction des actions d'un compte rendu par trois modèles économiques
96 réponses brutes de modèles, 8 réunions générées par script avec leur vérité terrain, quatre formats de compte rendu. Test conduit le 2026-08-18.
Cette page décrit un jeu de données, publié en entier. C'est la matière première de notre mesure de ce qui atterrit sur une liste de suivi sans que personne ne l'ait décidé : 8 réunions, quatre formats de compte rendu, trois modèles économiques, et les 96 réponses que ces modèles ont réellement rendues.
Tout ce qui est sur cette page vient de ce seul passage. Rien n'est estimé.
Ce qu'il mesure, et ce qu'il ne prouve pas
Il mesure deux choses précisément. D'abord ce qu'un modèle ajoute à une liste de suivi : du travail annulé pendant la réunion, et des noms de responsables posés sur des éléments qui n'en portaient aucun. Ensuite, à quelle fréquence il le fait sans rien qui enverrait quelqu'un vérifier.
Une liste d'actions est une liste ouverte. Personne ne donne au modèle le nombre d'éléments à trouver, donc un élément oublié et un élément inventé se ressemblent dans la sortie. C'est ce qui distingue ce test de l'extraction de champs, où les champs sont connus d'avance.
Ce qu'il ne prouve pas, dit franchement, parce qu'un jeu de données cité sans ses limites fait plus de mal que pas de jeu de données du tout :
- Les réunions font environ 18 tours de parole et tiennent entièrement dans la fenêtre du modèle. Une transcription d'une heure est un autre problème, et rien ici ne le mesure.
- Le corpus est construit par script, pas collecté. Aucune réunion réelle, aucune personne réelle, aucune société réelle.
- 8 réunions, 64 éléments. Un test sur 8 réunions est un test sur 8 réunions.
- Un passage par combinaison, à température 0. Des écarts de quelques points entre modèles ne sont pas significatifs ici. C'est la forme des erreurs qui tient.
- Anglais seulement, prénoms seuls, alphabet latin seulement. Les réunions tenues en deux langues, ou avec deux personnes qui partagent un prénom, sont un cas difficile connu que ce corpus ne contient pas.
- Trois modèles d'entrée de gamme. Rien ici ne dit ce que feraient des modèles plus chers.
Le corpus est construit, et voici ce que cela veut dire
Les 8 réunions ont été générées par script avec la graine fixe 20260818. C'est un
choix assumé, et il coupe des deux côtés.
Ce qu'il achète : la vérité terrain d'une liste d'actions est une liste, et elle n'est indiscutable que si c'est nous qui l'avons posée. N'importe qui peut régénérer exactement le même corpus et contester notre lecture. Ce qu'il coûte : ce ne sont pas de vraies réunions, et un vrai compte rendu porte des désordres que nous n'avons pas pensé à inventer.
Chaque réunion contient 3 actions avec un responsable nommé, 2 actions pour lesquelles personne n'est nommé, 1 action attribuée puis annulée plus loin dans la même réunion, 1 proposition refusée sur-le-champ, et 1 tâche annoncée comme déjà faite. Sur les 8 réunions : 40 actions réelles et 24 pièges.
Chaque élément porte une ancre, un mot concret unique dans tout le corpus, présent dans la phrase qui le porte et nulle part ailleurs. C'est l'ancre qui rattache une ligne rendue à un élément, mécaniquement. Quatre invariants sont vérifiés avant le moindre appel : les ancres sont uniques, chacune est présente dans le texte servi, aucune n'apparaît dans une phrase qui ne la porte pas, et aucun prénom de participant ne figure dans les phrases des actions que personne n'a prises.
Test conduit le 2026-08-18. Cette page a été publiée le 2026-08-18. Les extractions ont été conduites par la chaîne de test automatisée de ce site : le corpus, les appels aux modèles et l'analyse sont des scripts, et tous sont dans l'archive ci-dessous.
Chiffres bruts
Actions retrouvées, et ce qui est revenu avec elles
| Modèle | Actions retrouvées | Responsable inventé | Travail annulé réémis | Erreurs | dont silencieuses |
|---|---|---|---|---|---|
| openai/gpt-4o-mini | 140/160 | 12 | 9/32 | 51 | 49 |
| google/gemini-2.5-flash-lite | 158/160 | 8 | 8/32 | 18 | 15 |
| anthropic/claude-haiku-4.5 | 157/160 | 14 | 2/32 | 19 | 12 |
| Tous modèles | 455/480 | 34 | 19/96 | 88 | 76 |
Par format de compte rendu
| Format | Actions retrouvées | Responsable inventé | Travail annulé réémis | Erreurs |
|---|---|---|---|---|
| N1 notes propres | 112/120 | 7 | 2/24 | 18 |
| N2 casse et hésitations | 115/120 | 9 | 4/24 | 22 |
| N3 paragraphe continu | 115/120 | 11 | 8/24 | 26 |
| N4 transcription brute | 113/120 | 7 | 5/24 | 22 |
Les trois pièges
| Piège | À quoi il ressemble dans les notes | Rendu comme action |
|---|---|---|
| Attribué, puis annulé plus loin | un tour donne la tâche, un tour plus bas l'annule | 19/96 |
| Proposition refusée sur-le-champ | « Should we ...? » suivi de « No, not this quarter » | 0/96 |
| Tâche annoncée comme déjà faite | « I already did that last week, that one is closed » | 0/96 |
Les deux pièges qui tiennent dans une seule phrase ne sont jamais pris pour des actions. Celui qui s'étend sur deux tours éloignés échappe à près d'une liste sur cinq, et 17 de ces 19 actions fantômes portent un nom de responsable.
Attribution
| Sur les 273 actions retrouvées qui nommaient un responsable | Effectif |
|---|---|
| Responsable juste | 272 |
| Mauvais participant | 0 |
| Responsable manquant | 1 |
| Sur les 182 actions retrouvées qui ne nommaient personne | Effectif |
|---|---|
| Correctement laissé vide | 147 |
| Mis sur la personne qui a prononcé la phrase | 29 |
| Mis sur quelqu'un d'autre | 5 |
| Mis sur un collectif, « l'équipe » | 1 |
Échéances
| État | Effectif |
|---|---|
| Juste | 207 |
| Fausse | 10 |
| Perdue alors qu'elle existait | 15 |
| Inventée alors qu'il n'y en avait pas | 0 |
Citations
Chaque élément rendu devait citer la phrase des notes qui le porte. La citation est comparée tour de parole par tour de parole au texte réellement servi à ce niveau.
| État | Effectif |
|---|---|
| Verbatim, dans un seul tour | 459 |
| Recollée à partir de fragments réels | 15, dont 14 au niveau N3 |
| Contenant des mots que personne n'a dits | 0 |
Comparer au texte servi entier plutôt que tour par tour fait basculer 15 citations dans la colonne verbatim, parce que la normalisation efface la frontière entre les orateurs. Les chiffres ci-dessus emploient la règle tour par tour. Les deux sont calculables depuis l'archive.
La règle du responsable ancré
Ne conserver un nom que si la phrase citée le porte : soit elle nomme la personne, soit elle est un engagement à la première personne de son orateur.
| Grandeur | Valeur |
|---|---|
| Responsables inventés bloqués | 34 sur 34 |
| Responsables justes bloqués à tort | 20 sur 272, 7,4 % |
| Travail annulé bloqué | 3 sur 19 |
La règle porte sur l'attribution, pas sur l'annulation, et la dernière ligne le dit. Nous ne publions aucun détecteur d'annulation : les nôtres suivent toutes une même formulation, donc n'importe quel détecteur par mots-clés se noterait lui-même sur le gabarit qui les a écrites.
Totaux du passage
| Grandeur | Valeur |
|---|---|
| Extractions | 96 |
| Lignes d'action rendues | 474 |
| Lignes rattachées à aucun élément, ou à deux | 0 et 0 |
| Échecs techniques | 0 |
| Réponses JSON invalides | 0 |
| Coût total d'API | 0,091618 USD |
| Listes portant au moins une erreur | 57 sur 96 |
| dont rien ne la signale | 50 |
Ce que contient l'archive
Sept fichiers, 743151 octets décompressés. L'inventaire est ici pour que vous sachiez ce que vous téléchargez avant de le télécharger.
| Fichier | Ce qu'il contient | Taille |
|---|---|---|
generer-corpus.py |
le générateur du corpus, graine fixe 20260818, et ses quatre invariants | 16,9 Kio |
corpus.json |
les 8 réunions, leur vérité terrain, chaque ancre et chaque famille | 33,0 Kio |
degrader.py |
les quatre formats, et la vue tour par tour qui sert à noter les citations | 4,8 Kio |
conduire-test.py |
les appels aux modèles, avec la consigne en clair | 6,4 Kio |
resultats-bruts.json |
les 96 réponses, brutes, avec la consigne employée | 269,4 Kio |
analyser.py |
le classement et le calcul de chacun des chiffres de cette page | 18,7 Kio |
chiffres.json |
les chiffres calculés, plus une ligne par élément jugé et par ligne rendue | 376,5 Kio |
Les scripts et leurs commentaires sont en français, qui est la langue de travail derrière ce site. La clé d'API est lue dans une variable d'environnement et n'apparaît dans aucun de ces fichiers.
Rejouez-le
Le générateur emploie une graine fixe, donc le corpus que vous produisez est celui que nous avons employé.
unzip 2026-08-meeting-action-items.zip
cd 2026-08-meeting-action-items
python3 generer-corpus.py --graine 20260818 --sortie corpus.json
python3 conduire-test.py --corpus corpus.json --sortie resultats-bruts.json \
--niveaux 1 2 3 4 \
--modeles openai/gpt-4o-mini google/gemini-2.5-flash-lite anthropic/claude-haiku-4.5
python3 analyser.py --corpus corpus.json --resultats resultats-bruts.json \
--sortie chiffres.jsonChaque réponse brute est une entrée de resultats-bruts.json, exactement telle que
le modèle l'a rendue, avant tout classement :
{"modele": "openai/gpt-4o-mini", "reunion": "M1", "niveau": 4,
"json_valide": true,
"reponse": {"actions": [
{"task": "Update the pricing on the kiosk", "owner": "rafael",
"due": "by wednesday",
"evidence": "rafael i er will update the pricing on the kiosk by wednesday"},
{"task": "Call the sign shop about the awning", "owner": "nadia",
"due": null, "evidence": "nadia sure um that is mine"}],
"notes": "I was unsure about who is responsible for emptying the mailbox and rotating the gate keypad code, as the notes did not specify an owner for these tasks."}}Vérifiez ce que vous avez téléchargé avant de lui faire confiance :
shasum -a 256 2026-08-meeting-action-items.zip
# f90dc30daf2059f37824912ca53ab9fe356345fb1fe201d3926c0544f4da2ee8Comment citer ce jeu de données
Copiez l'une des deux formes ci-dessous. La référence pointe vers cette page, qui est l'adresse stable de ce jeu de données ; l'archive est ce que cette adresse sert.
Think AI First (2026). Extraction des actions d'un compte rendu par trois modèles économiques, 96 réponses brutes.
Think AI First. Test conduit le 2026-08-18, publié le 2026-08-18.
https://think-ai-first.com/fr/donnees/actions-compte-rendu-2026-08. Sous licence CC BY 4.0.@dataset{thinkaifirst2026comptesrendus,
author = {{Think AI First}},
title = {Extraction des actions d'un compte rendu par trois modèles économiques, 96 réponses brutes},
year = {2026},
publisher = {Think AI First},
url = {https://think-ai-first.com/fr/donnees/actions-compte-rendu-2026-08},
note = {Test conduit le 2026-08-18. Sous licence CC BY 4.0. SHA-256 de l'archive f90dc30daf2059f37824912ca53ab9fe356345fb1fe201d3926c0544f4da2ee8}
}Licence et réutilisation
Publié sous CC BY 4.0. Employez-le, citez-le, contredisez-le. Si vous le rejouez et obtenez autre chose, dites-le-nous par le formulaire de contact : les corrections sont publiées sur l'article lui-même, datées.
Télécharger le jeu de données (zip, 59,6 Kio, 7 fichiers)
Les autres jeux de données publiés ici
Chacun est un test distinct, avec son corpus, ses réponses brutes et son archive.
- Extraction de factures par trois modèles économiques, 288 réponses brutes, test conduit le 2026-08-10.
- Dédoublonnage de contacts par trois modèles économiques, 96 réponses brutes, test conduit le 2026-08-17.