Comptes rendus de réunion par IA : 96 tests sur les actions que personne n'a décidées
Trois modèles économiques, 8 réunions, quatre formats de compte rendu. Ils retrouvent 94,8 % des actions réelles. Le problème est ce qu'ils ajoutent : le travail annulé pendant la réunion revient sur une liste sur cinq, au nom de quelqu'un.
Publié le
18 août 2026
Rubrique
Petite entreprise
Toute réunion produit une liste de choses à faire, et il faut bien que quelqu'un l'écrive. C'est l'un des premiers travaux qu'une PME confie à un modèle, parce qu'il est ennuyeux, quotidien, et que le résultat a l'air juste immédiatement. Savoir si le modèle trouve les actions n'est pas vraiment la question. Il les trouve. La question est ce qui atterrit sur la liste sans que personne ne l'ait décidé, et à quel nom.
Nous avons conduit 96 extractions pour le savoir. Voici les résultats, avant la méthode.
Trois modèles économiques ont retrouvé 455 des 480 actions réelles, 94,8 %. Le rappel n'est pas le problème, et rien dans ce test ne suggère qu'il le soit. Deux des trois modèles ont manqué 2 et 3 éléments sur 160. Le troisième en a manqué 20.
Sur 19 des 96 listes, un travail explicitement annulé pendant la réunion revient comme une action à faire. Quelqu'un a reçu une tâche, a dit oui, et plus loin dans la même réunion la personne qui la lui avait donnée l'a annulée. Près d'une liste sur cinq la réémet quand même, et 17 de ces 19 actions fantômes portent un nom de responsable. Les deux autres pièges posés, une proposition refusée sur-le-champ et une tâche annoncée comme déjà faite, n'ont jamais été pris pour des actions. Pas une fois sur 96 passages, ni pour l'un ni pour l'autre.
Sur 182 actions ne nommant personne, 34 reviennent avec un nom, 18,7 %. Dans 29 cas, ce nom est celui de la personne qui a prononcé la phrase. Dans 5 cas, c'est celui de quelqu'un qui n'a rien à y voir : un participant qui n'a jamais parlé de ce sujet.
Sur 88 erreurs, 76 n'étaient accompagnées de rien qui enverrait quelqu'un vérifier, 86,4 %. La consigne offrait aux modèles un champ notes pour signaler ce dont ils n'étaient pas sûrs. 57 des 96 listes portent au moins une erreur. Sur 50 d'entre elles, les notes n'en disent rien.
La méthode, en bref
Test conduit le 2026-08-18 par la chaîne de test automatisée de ce site : le corpus, les appels aux modèles et l'analyse sont des scripts, publiés plus bas pour que chacun puisse les rejouer et contester le résultat. Etienne signe cet article et répond de son contenu.
C'est le troisième test mesuré publié ici. Le premier mesurait l'extraction de champs dans un document. Le deuxième mesurait une décision, fusionner deux lignes ou non. Celui-ci mesure ce que les deux premiers ne mesuraient pas : ce que le modèle fait d'une liste ouverte. Personne ne lui donne le nombre d'actions à trouver, donc il peut en oublier une et il peut en ajouter une, et les deux erreurs se ressemblent dans la sortie.
Le corpus est construit, pas collecté. 8 réunions, 8 entreprises, 4 participants nommés chacune, générés par script avec la graine fixe 20260818, donc le corpus se régénère à l'identique. Aucune réunion réelle, aucune personne réelle, aucune société réelle.
C'est un choix assumé. La vérité terrain d'une liste d'actions est une liste, et elle n'est indiscutable que si c'est nous qui l'avons posée. Sur un compte rendu réel, il aurait fallu trancher à la main ce qui compte comme une action, avec notre propre jugement à l'intérieur de la référence, et le test aurait mesuré notre accord avec le modèle plutôt que la justesse du modèle.
Chaque réunion contient 8 éléments à juger :
Élément
Par réunion
Total
Ce qu'il teste
Action avec un responsable nommé
3
24
le bon nom revient-il
Action pour laquelle personne n'est nommé
2
16
un nom est-il inventé
Action attribuée, puis annulée plus loin dans la réunion
1
8
l'annulation est-elle lue
Proposition refusée sur-le-champ
1
8
un refus devient-il une tâche
Tâche annoncée comme déjà faite
1
8
un travail clos est-il réémis
Chaque élément porte une ancre : un mot concret qui apparaît une seule fois dans tout le corpus, dans la phrase qui le porte et nulle part ailleurs. C'est l'ancre qui rattache une ligne rendue par un modèle à un élément du corpus, mécaniquement, sans jugement humain. Trois invariants sont vérifiés avant le moindre appel : l'ancre est unique, l'ancre est présente dans le texte servi, et aucune ancre n'apparaît dans une phrase qui ne la porte pas. Un quatrième contrôle vérifie qu'aucun prénom de participant ne figure dans les phrases des actions que personne n'a prises, ce qui est toute la raison d'être de cette famille.
Trois modèles, choisis parmi ceux qu'une PME emploierait réellement pour leur prix : openai/gpt-4o-mini, google/gemini-2.5-flash-lite, anthropic/claude-haiku-4.5. Accès par OpenRouter, température 0, un passage par combinaison de réunion, de format et de modèle. 96 appels, 0 échec technique, 0 réponse JSON invalide, coût total d'API 0,091618 USD.
La consigne était identique mot pour mot pour les trois modèles :
texte
You are turning the notes of a small business meeting into a follow-up list.
Return ONLY a JSON object with exactly these keys:
- actions: an array of objects, one per action that still has to be done after
this meeting. Each object has these four keys:
- task: string, what has to be done.
- owner: string, the name of the person the notes say will do it, or null
if the notes do not say who.
- due: string, the deadline exactly as the notes state it, or null if the
notes state none.
- evidence: string, one sentence copied from the notes word for word that
shows this action.
- notes: string, empty if every decision was unambiguous, otherwise say which
items you were unsure about and why.
Do not include anything that was decided against, cancelled, or already done.
Deux choses là-dedans sont la mesure. owner autorise explicitement null, donc un modèle qui ne nomme personne fait ce qu'on lui a demandé, il n'échoue pas. Et la dernière ligne nomme les trois pièges à voix haute. Rien ici n'est un traquenard : les modèles étaient prévenus, dans la consigne, de ce qu'il ne fallait pas inclure.
Le champ evidence est le contrôle le plus dur du test. Une phrase citée existe ou n'existe pas dans le texte qu'on a servi au modèle, et cela se tranche par une recherche de chaîne, pas par un avis.
Les quatre formats de compte rendu
Des notes ne sont jamais propres. On dégrade la présentation, jamais l'information : à chaque niveau, les mêmes tours de parole, les mêmes prénoms d'orateur et les mêmes ancres restent présents et dans le même ordre. Un niveau qui effacerait le nom de l'orateur ne mesurerait plus le jugement du modèle, il mesurerait ce qu'on lui a caché, et la vérité terrain de l'attribution cesserait d'exister.
Niveau
Ce qui est dégradé
N1 notes propres
en-tête, un tour de parole par ligne, prénom en tête
N2 casse et hésitations
N1, plus une casse incohérente, des hésitations orales, des points finaux manquants
N3 paragraphe continu
les mêmes tours coulés dans un paragraphe, prénoms conservés en ligne, plus aucun retour à la ligne entre les orateurs
N4 transcription brute
N3, plus un horodatage par tour, tout en minuscules, sans aucune ponctuation, coupé à 68 caractères au milieu des phrases
Chiffres bruts
Chaque nombre ci-dessous est recalculé depuis les 96 réponses brutes par le script d'analyse. Aucun n'est estimé.
Par modèle
Modèle
Actions retrouvées
Manquées
Nom inventé
Travail annulé réémis
Erreurs
Silencieuses
Listes avec une erreur
Passages au champ notes vide
gpt-4o-mini
140/160
20
12
9/32
51
49
29/32
5/32
gemini-2.5-flash-lite
158/160
2
8
8/32
18
15
13/32
18/32
claude-haiku-4.5
157/160
3
14
2/32
19
12
15/32
0/32
Trois profils différents, et aucun n'est sûr de la même façon. gpt-4o-mini perd une action sur huit. gemini-2.5-flash-lite retrouve presque tout et ne dit rien de rien sur 18 passages sur 32. claude-haiku-4.5 est le seul qui lise les annulations, 2 manquées contre 8 et 9, et c'est aussi celui qui pose le plus de noms sur des éléments qui n'en portaient aucun.
Par format
Format
Actions retrouvées
Nom inventé
Travail annulé réémis
Erreurs
Silencieuses
Listes avec une erreur
N1 notes propres
112/120
7
2/24
18
14
12/24
N2 casse et hésitations
115/120
9
4/24
22
20
15/24
N3 paragraphe continu
115/120
11
8/24
26
24
17/24
N4 transcription brute
113/120
7
5/24
22
18
13/24
Les formats abîmés n'ont pas coûté de rappel. Ils ont coûté tout le reste, et le pire format n'est pas celui qui a l'air le pire. N3, un texte propre sans retours à la ligne, produit plus d'erreurs que la transcription en minuscules sans ponctuation. S'il avait fallu parier avant le passage, nous aurions parié sur N4, et nous aurions eu tort.
Attribution et échéances
Mesure
Effectif
Actions avec un responsable nommé, retrouvées
273/288
Responsable juste
272
Responsable, mauvais participant
0
Responsable manquant
1
Actions sans responsable nommé, retrouvées
182/192
Responsable correctement laissé vide
147
Responsable mis sur la personne qui a prononcé la phrase
29
Responsable mis sur quelqu'un d'autre
5
Responsable mis sur un collectif, « l'équipe »
1
Quand les notes nomment quelqu'un, les modèles ont raison : 272 sur 273. Tout le problème d'attribution est de l'autre côté, là où les notes ne nomment personne.
Échéance
Effectif
Juste
207
Fausse
10
Perdue alors qu'elle existait
15
Inventée alors qu'il n'y en avait pas
0
Pas une seule échéance inventée sur 480 occasions. Cela mérite d'être dit aussi fort que les échecs.
Citations
Citation
Effectif
Verbatim, à l'intérieur d'un seul tour de parole
459
Recollée à partir de fragments réels de plusieurs tours
15
Contenant des mots que personne n'a dits
0
Zéro citation inventée sur 474 lignes rendues. Quoi qu'ils aient fait d'autre, ces modèles n'ont pas mis de mots dans la bouche de quelqu'un. 14 des 15 citations recollées viennent de N3, le paragraphe continu, où la frontière entre deux orateurs est réellement plus difficile à voir.
Ce chiffre ne vaut que grâce à une correction que nous avons dû faire à notre propre analyse. La première version du contrôle cherchait la citation dans le texte servi entier après retrait de la ponctuation, ce qui effaçait la frontière entre les tours : une citation cousue à partir de deux orateurs différents passait pour verbatim. La comparaison tour par tour fait sortir 15 citations de la colonne verbatim. Le chiffre publié ici est le second.
Le travail annulé est le résultat de ce test
Les trois pièges n'étaient pas d'égale difficulté, et l'écart entre eux est la chose la plus utile que ce test ait produite.
Une proposition refusée sur-le-champ, « Should we rent a billboard on the highway? » suivi de « No, not this quarter » : 0 sur 96. Une tâche annoncée comme déjà terminée, « I already reset the alarm codes last week, that one is closed » : 0 sur 96. Les deux tiennent dans une seule phrase, et les modèles les traitent parfaitement.
Un travail attribué puis annulé plus loin dans la réunion : 19 sur 96. L'annulation est un tour de parole distinct, plus bas, et elle défait un engagement antérieur. C'est la seule forme d'instruction que les modèles ratent, et c'est celle qu'une vraie réunion produit sans arrêt, parce qu'une réunion change d'avis.
Voici les huit annulations, une par réunion, avec la distance entre l'attribution et le retrait :
Élément
Tours entre l'attribution et le retrait
Réémis comme action
pergola
2
5/12
flyer
2
2/12
barcodes
2
0/12
vending
6
2/12
carport
5
0/12
recliner
7
1/12
skirting
9
7/12
intercom
10
2/12
Nous avons cherché une relation entre la distance et le taux d'échec. Il n'y en a aucune de visible. Le pire élément, 7 sur 12, est à 9 tours de son retrait ; un élément à 10 tours n'est raté que deux fois, et un élément à 5 tours ne l'est jamais. Huit éléments, c'est beaucoup trop peu pour y tracer une droite, et nous préférons le dire plutôt que publier une tendance que huit points ne peuvent pas porter.
Ce que l'on peut dire sans rien forcer : 17 de ces 19 actions fantômes portent un nom de responsable. La défaillance ne produit pas une ligne vague en bas d'une liste. Elle produit une tâche, attribuée à une personne, que la réunion avait décidé de ne pas faire.
Le responsable inventé, et une règle qui l'attrape
29 des 34 responsables inventés sont la personne qui a prononcé la phrase. Quand Priya dit « Someone has to see to this: the freezer needs a defrost cycle », un modèle qui écrit owner: Priya fait quelque chose de défendable au sens large et de faux au sens strict. Priya a soulevé le sujet. Rien ne dit qu'elle l'a pris.
Les 5 autres ne sont défendables à aucun titre. Greta dit « Someone has to see to this: the firewall licence has to be renewed », et la liste rendue l'attribue à Ruth, qui n'a jamais parlé du pare-feu. Sur une vraie liste, c'est une personne qui découvre à son nom un travail que personne ne lui a confié.
Comme nous avons demandé aux modèles de citer leur preuve, le correctif peut être mécanique. Un nom n'est conservé que si la phrase citée le porte. Soit elle nomme la personne, « Nadia, can you call the sign shop about the awning », soit elle est un engagement à la première personne de cet orateur, « I will take down the summer banner ». Dans tout autre cas, le nom saute et l'élément remonte en tête de liste pour être attribué par un humain.
Cette règle ne lit rien d'autre que la sortie du modèle et les notes d'origine. Elle n'a pas besoin de la vérité terrain, ce qui est la condition pour être utilisable sur vos propres réunions. Passée sur les 96 réponses :
Résultat de la règle
Effectif
Responsables inventés bloqués
34/34
Responsables justes bloqués à tort
20/272
Travail annulé bloqué
3/19
Tous les noms inventés sont attrapés, au prix de 7,4 % des noms justes. Les 20 blocages à tort se concentrent sur une seule forme : le modèle a cité l'acceptation, « Sure, that is mine », au lieu de l'attribution. Un lecteur plus strict en récupérerait la plupart en regardant aussi le tour immédiatement précédent, et nous ne l'avons pas fait, parce que la version publiable est celle que nous avons mesurée.
Notez la dernière ligne. La règle ne fait presque rien contre les annulations, 3 sur 19, et ce n'est pas un défaut de la règle, c'est un autre problème. L'attribution est une propriété d'une phrase. Une annulation est une relation entre deux phrases éloignées. Nous n'avons pas de détecteur mesuré pour la seconde, et voici pourquoi nous n'en publions pas : nos annulations suivent toutes une même formulation, donc n'importe quel détecteur par mots-clés que nous écririons se noterait lui-même sur le gabarit qui a servi à les écrire. Ce chiffre aurait l'air excellent et ne voudrait rien dire.
Notre première version de la règle d'attribution était fausse elle aussi, et cela mérite d'être rapporté parce que cela change la façon de lire les chiffres. Elle cherchait « I will » par expression régulière, et ratait 100 attributions justes sur 272, parce que le niveau N2 insère une hésitation entre le sujet et le verbe : « I er, will update the pricing ». Les modèles avaient raison et notre règle avait tort. La version publiée tolère jusqu'à cinq mots entre les deux.
Ce que nous en ferions
Ne laissez pas un modèle produire la liste de suivi. Laissez-le produire un brouillon. Le rendement est de son côté, 94,8 %, et le risque du vôtre : une tâche que personne n'a acceptée, au nom de quelqu'un.
Retirez le nom de tout ce que la phrase citée ne porte pas. Cela coûte un script, cela a attrapé 34 cas sur 34 ici, et un élément sans responsable est visible et se fait attribuer. Un élément avec le mauvais responsable est invisible et se fait ignorer.
Lisez les annulations vous-même. C'est la seule chose qu'aucune règle de cet article ne couvre. Si une réunion a annulé quelque chose, cette décision est l'information la plus fragile du compte rendu, et c'est celle qui produit du travail quand elle se perd.
Ne lisez pas un champ de notes vide comme un passage propre. gemini-2.5-flash-lite a rendu un champ de notes vide sur 18 passages sur 32 et a commis 18 erreurs au total. 50 des 57 listes fautives ne portaient aucun avertissement pertinent. Un champ de notes est un commentaire, pas un contrôle.
8 réunions, 64 éléments, 96 passages. Un test sur 8 réunions est un test sur 8 réunions.
Le corpus est construit par script, pas collecté. Il porte les désordres que nous avons pensé à inventer, et un vrai compte rendu en porte que nous n'avons pas pensés.
Des réunions d'environ 18 tours de parole, entièrement dans la fenêtre du modèle. Une transcription d'une heure est un autre problème, que ce test ne touche pas.
Un passage par combinaison, à température 0. Les modèles ne sont pas parfaitement déterministes pour autant. Des écarts de quelques points ne doivent pas être lus comme significatifs. L'écart entre 2 et 20 actions manquées, et surtout la forme des erreurs, toujours la même famille de piège, le sont.
Trois modèles d'entrée de gamme. Rien ici ne dit ce que feraient des modèles plus chers. C'est une question ouverte et elle mérite son propre test.
Anglais seulement, prénoms seuls, alphabet latin seulement. Les réunions tenues en deux langues, ou avec deux personnes qui partagent un prénom, sont un cas difficile connu que ce corpus ne contient pas.
Rattacher une ligne rendue à un élément par un mot d'ancrage est notre règle. Elle a rattaché 474 lignes sur 474 sans ambiguïté et sans reste, ce qui est le meilleur indice dont nous disposons qu'elle ne déforme rien, mais elle reste notre règle.
Un jugement de ce test est réellement discutable : celui de savoir si la personne qui soulève une tâche non attribuée la prend implicitement. Nous l'avons compté comme une erreur et nous le rapportons à part, 29 des 34, pour qu'un lecteur qui n'est pas d'accord puisse le soustraire et garder les 5 autres.
Rejouez-le
Tout ce que ce test a produit est ici, pas résumé : le script qui a généré les 8 réunions et celui qui les a dégradées, la vérité terrain avec chaque ancre et chaque famille, les 96 réponses brutes exactement telles que les modèles les ont rendues, et l'analyse qui produit chacun des chiffres ci-dessus.
Le générateur emploie une graine fixe, donc le corpus que vous produisez est celui que nous avons employé.
La clé d'API est lue dans une variable d'environnement et n'apparaît nulle part dans ces fichiers.
Télécharger le jeu de données (zip, avec l'inventaire complet et la somme de contrôle). Les scripts et leurs commentaires sont en français, qui est la langue de travail derrière ce site.
Si vous le rejouez et que vous obtenez autre chose, nous voulons le savoir. Il y a un formulaire de contact, et les corrections sont publiées sur l'article lui-même, datées, comme les règles éditoriales de ce site l'annoncent.
Trois modèles bon marché, 8 carnets, quatre niveaux de désordre. Trouver les doublons est la partie facile, 94,1 pour cent. Le chiffre qui vous coûte une fiche, c'est la part des personnes distinctes fusionnées sans le moindre avertissement.
Trois modèles bon marché, 24 factures, quatre niveaux de texte dégradé. L'exactitude est le chiffre facile. Celui qui coûte de l'argent, c'est la part des extractions fausses qui ne signalent rien.
Une petite équipe n'a ni programme pilote ni évaluateur d'outils. La décision doit donc être arithmétique. Voici le calcul, y compris le coût que tout le monde oublie.