Jeu de données

Extraction des actions d'un compte rendu par trois modèles économiques

96 réponses brutes de modèles, 8 réunions générées par script avec leur vérité terrain, quatre formats de compte rendu. Test conduit le 2026-08-18.

Cette page décrit un jeu de données, publié en entier. C'est la matière première de notre mesure de ce qui atterrit sur une liste de suivi sans que personne ne l'ait décidé : 8 réunions, quatre formats de compte rendu, trois modèles économiques, et les 96 réponses que ces modèles ont réellement rendues.

Tout ce qui est sur cette page vient de ce seul passage. Rien n'est estimé.

Ce qu'il mesure, et ce qu'il ne prouve pas

Il mesure deux choses précisément. D'abord ce qu'un modèle ajoute à une liste de suivi : du travail annulé pendant la réunion, et des noms de responsables posés sur des éléments qui n'en portaient aucun. Ensuite, à quelle fréquence il le fait sans rien qui enverrait quelqu'un vérifier.

Une liste d'actions est une liste ouverte. Personne ne donne au modèle le nombre d'éléments à trouver, donc un élément oublié et un élément inventé se ressemblent dans la sortie. C'est ce qui distingue ce test de l'extraction de champs, où les champs sont connus d'avance.

Ce qu'il ne prouve pas, dit franchement, parce qu'un jeu de données cité sans ses limites fait plus de mal que pas de jeu de données du tout :

  • Les réunions font environ 18 tours de parole et tiennent entièrement dans la fenêtre du modèle. Une transcription d'une heure est un autre problème, et rien ici ne le mesure.
  • Le corpus est construit par script, pas collecté. Aucune réunion réelle, aucune personne réelle, aucune société réelle.
  • 8 réunions, 64 éléments. Un test sur 8 réunions est un test sur 8 réunions.
  • Un passage par combinaison, à température 0. Des écarts de quelques points entre modèles ne sont pas significatifs ici. C'est la forme des erreurs qui tient.
  • Anglais seulement, prénoms seuls, alphabet latin seulement. Les réunions tenues en deux langues, ou avec deux personnes qui partagent un prénom, sont un cas difficile connu que ce corpus ne contient pas.
  • Trois modèles d'entrée de gamme. Rien ici ne dit ce que feraient des modèles plus chers.

Le corpus est construit, et voici ce que cela veut dire

Les 8 réunions ont été générées par script avec la graine fixe 20260818. C'est un choix assumé, et il coupe des deux côtés.

Ce qu'il achète : la vérité terrain d'une liste d'actions est une liste, et elle n'est indiscutable que si c'est nous qui l'avons posée. N'importe qui peut régénérer exactement le même corpus et contester notre lecture. Ce qu'il coûte : ce ne sont pas de vraies réunions, et un vrai compte rendu porte des désordres que nous n'avons pas pensé à inventer.

Chaque réunion contient 3 actions avec un responsable nommé, 2 actions pour lesquelles personne n'est nommé, 1 action attribuée puis annulée plus loin dans la même réunion, 1 proposition refusée sur-le-champ, et 1 tâche annoncée comme déjà faite. Sur les 8 réunions : 40 actions réelles et 24 pièges.

Chaque élément porte une ancre, un mot concret unique dans tout le corpus, présent dans la phrase qui le porte et nulle part ailleurs. C'est l'ancre qui rattache une ligne rendue à un élément, mécaniquement. Quatre invariants sont vérifiés avant le moindre appel : les ancres sont uniques, chacune est présente dans le texte servi, aucune n'apparaît dans une phrase qui ne la porte pas, et aucun prénom de participant ne figure dans les phrases des actions que personne n'a prises.

Test conduit le 2026-08-18. Cette page a été publiée le 2026-08-18. Les extractions ont été conduites par la chaîne de test automatisée de ce site : le corpus, les appels aux modèles et l'analyse sont des scripts, et tous sont dans l'archive ci-dessous.

Chiffres bruts

Actions retrouvées, et ce qui est revenu avec elles

Modèle Actions retrouvées Responsable inventé Travail annulé réémis Erreurs dont silencieuses
openai/gpt-4o-mini 140/160 12 9/32 51 49
google/gemini-2.5-flash-lite 158/160 8 8/32 18 15
anthropic/claude-haiku-4.5 157/160 14 2/32 19 12
Tous modèles 455/480 34 19/96 88 76

Par format de compte rendu

Format Actions retrouvées Responsable inventé Travail annulé réémis Erreurs
N1 notes propres 112/120 7 2/24 18
N2 casse et hésitations 115/120 9 4/24 22
N3 paragraphe continu 115/120 11 8/24 26
N4 transcription brute 113/120 7 5/24 22

Les trois pièges

Piège À quoi il ressemble dans les notes Rendu comme action
Attribué, puis annulé plus loin un tour donne la tâche, un tour plus bas l'annule 19/96
Proposition refusée sur-le-champ « Should we ...? » suivi de « No, not this quarter » 0/96
Tâche annoncée comme déjà faite « I already did that last week, that one is closed » 0/96

Les deux pièges qui tiennent dans une seule phrase ne sont jamais pris pour des actions. Celui qui s'étend sur deux tours éloignés échappe à près d'une liste sur cinq, et 17 de ces 19 actions fantômes portent un nom de responsable.

Attribution

Sur les 273 actions retrouvées qui nommaient un responsable Effectif
Responsable juste 272
Mauvais participant 0
Responsable manquant 1
Sur les 182 actions retrouvées qui ne nommaient personne Effectif
Correctement laissé vide 147
Mis sur la personne qui a prononcé la phrase 29
Mis sur quelqu'un d'autre 5
Mis sur un collectif, « l'équipe » 1

Échéances

État Effectif
Juste 207
Fausse 10
Perdue alors qu'elle existait 15
Inventée alors qu'il n'y en avait pas 0

Citations

Chaque élément rendu devait citer la phrase des notes qui le porte. La citation est comparée tour de parole par tour de parole au texte réellement servi à ce niveau.

État Effectif
Verbatim, dans un seul tour 459
Recollée à partir de fragments réels 15, dont 14 au niveau N3
Contenant des mots que personne n'a dits 0

Comparer au texte servi entier plutôt que tour par tour fait basculer 15 citations dans la colonne verbatim, parce que la normalisation efface la frontière entre les orateurs. Les chiffres ci-dessus emploient la règle tour par tour. Les deux sont calculables depuis l'archive.

La règle du responsable ancré

Ne conserver un nom que si la phrase citée le porte : soit elle nomme la personne, soit elle est un engagement à la première personne de son orateur.

Grandeur Valeur
Responsables inventés bloqués 34 sur 34
Responsables justes bloqués à tort 20 sur 272, 7,4 %
Travail annulé bloqué 3 sur 19

La règle porte sur l'attribution, pas sur l'annulation, et la dernière ligne le dit. Nous ne publions aucun détecteur d'annulation : les nôtres suivent toutes une même formulation, donc n'importe quel détecteur par mots-clés se noterait lui-même sur le gabarit qui les a écrites.

Totaux du passage

Grandeur Valeur
Extractions 96
Lignes d'action rendues 474
Lignes rattachées à aucun élément, ou à deux 0 et 0
Échecs techniques 0
Réponses JSON invalides 0
Coût total d'API 0,091618 USD
Listes portant au moins une erreur 57 sur 96
dont rien ne la signale 50

Ce que contient l'archive

Sept fichiers, 743151 octets décompressés. L'inventaire est ici pour que vous sachiez ce que vous téléchargez avant de le télécharger.

Fichier Ce qu'il contient Taille
generer-corpus.py le générateur du corpus, graine fixe 20260818, et ses quatre invariants 16,9 Kio
corpus.json les 8 réunions, leur vérité terrain, chaque ancre et chaque famille 33,0 Kio
degrader.py les quatre formats, et la vue tour par tour qui sert à noter les citations 4,8 Kio
conduire-test.py les appels aux modèles, avec la consigne en clair 6,4 Kio
resultats-bruts.json les 96 réponses, brutes, avec la consigne employée 269,4 Kio
analyser.py le classement et le calcul de chacun des chiffres de cette page 18,7 Kio
chiffres.json les chiffres calculés, plus une ligne par élément jugé et par ligne rendue 376,5 Kio

Les scripts et leurs commentaires sont en français, qui est la langue de travail derrière ce site. La clé d'API est lue dans une variable d'environnement et n'apparaît dans aucun de ces fichiers.

Rejouez-le

Le générateur emploie une graine fixe, donc le corpus que vous produisez est celui que nous avons employé.

bash
unzip 2026-08-meeting-action-items.zip
cd 2026-08-meeting-action-items
python3 generer-corpus.py --graine 20260818 --sortie corpus.json
python3 conduire-test.py --corpus corpus.json --sortie resultats-bruts.json \
    --niveaux 1 2 3 4 \
    --modeles openai/gpt-4o-mini google/gemini-2.5-flash-lite anthropic/claude-haiku-4.5
python3 analyser.py --corpus corpus.json --resultats resultats-bruts.json \
    --sortie chiffres.json

Chaque réponse brute est une entrée de resultats-bruts.json, exactement telle que le modèle l'a rendue, avant tout classement :

json
{"modele": "openai/gpt-4o-mini", "reunion": "M1", "niveau": 4,
 "json_valide": true,
 "reponse": {"actions": [
   {"task": "Update the pricing on the kiosk", "owner": "rafael",
    "due": "by wednesday",
    "evidence": "rafael i er will update the pricing on the kiosk by wednesday"},
   {"task": "Call the sign shop about the awning", "owner": "nadia",
    "due": null, "evidence": "nadia sure um that is mine"}],
  "notes": "I was unsure about who is responsible for emptying the mailbox and rotating the gate keypad code, as the notes did not specify an owner for these tasks."}}

Vérifiez ce que vous avez téléchargé avant de lui faire confiance :

bash
shasum -a 256 2026-08-meeting-action-items.zip
# f90dc30daf2059f37824912ca53ab9fe356345fb1fe201d3926c0544f4da2ee8

Comment citer ce jeu de données

Copiez l'une des deux formes ci-dessous. La référence pointe vers cette page, qui est l'adresse stable de ce jeu de données ; l'archive est ce que cette adresse sert.

citation
Think AI First (2026). Extraction des actions d'un compte rendu par trois modèles économiques, 96 réponses brutes.
Think AI First. Test conduit le 2026-08-18, publié le 2026-08-18.
https://think-ai-first.com/fr/donnees/actions-compte-rendu-2026-08. Sous licence CC BY 4.0.
bibtex
@dataset{thinkaifirst2026comptesrendus,
  author    = {{Think AI First}},
  title     = {Extraction des actions d'un compte rendu par trois modèles économiques, 96 réponses brutes},
  year      = {2026},
  publisher = {Think AI First},
  url       = {https://think-ai-first.com/fr/donnees/actions-compte-rendu-2026-08},
  note      = {Test conduit le 2026-08-18. Sous licence CC BY 4.0. SHA-256 de l'archive f90dc30daf2059f37824912ca53ab9fe356345fb1fe201d3926c0544f4da2ee8}
}

Licence et réutilisation

Publié sous CC BY 4.0. Employez-le, citez-le, contredisez-le. Si vous le rejouez et obtenez autre chose, dites-le-nous par le formulaire de contact : les corrections sont publiées sur l'article lui-même, datées.

Télécharger le jeu de données (zip, 59,6 Kio, 7 fichiers)

Les autres jeux de données publiés ici

Chacun est un test distinct, avec son corpus, ses réponses brutes et son archive.