Essai I
La part du jugement
Sur ce que l’intelligence artificielle révèle des organisations d’experts
Vous étiez arrivé à la section
I. La scène
Un mardi matin, dans la salle de réunion d’un centre de recherche. Sur l’écran, un document de huit pages produit en quarante secondes par une machine. Une synthèse. Vingt-trois références, un raisonnement, une recommandation.
Autour de la table, six personnes. Cinq attendent. La sixième est celle qui compte : trente ans de métier, une réputation qui la précède de trois couloirs, le genre de personne dont on dit si elle le dit, c’est que c’est vrai.
Elle lit. Elle repose ses lunettes. Elle dit : « Non. »
Silence. Quelqu’un demande pourquoi.
Elle prend quatre secondes. Elle répond : « Ce n’est pas comme ça qu’on travaille. »
Aucune réponse là-dedans, un verdict sans motivation. La réunion s’arrête quand même, le projet recule de trois mois, personne ne conteste. Personne dans cette pièce ne dispose du moindre instrument pour lui dire qu’elle a tort. Ni pour lui dire qu’elle a raison, d’ailleurs.
Elle avait probablement raison, elle a souvent raison. L’organisation vient donc de prendre une bonne décision pour une mauvaise raison. Elle n’a pas jugé le document, elle a suivi une personne. Que cette personne soit fiable ne change rien à ce qui s’est produit. Le système fonctionne tant qu’elle est là, et il ne laisse rien derrière lui.
Cette scène montre ce qu’on retrouve partout ailleurs. Une organisation entière découvre, sans le formuler, qu’elle n’a jamais su expliquer pourquoi un travail est bon.
Elle savait autre chose. Elle savait qui était bon.
Entre les deux, un abîme.
La question qu’on se pose partout, est-ce que cette IA est fiable, n’est pas la bonne. La bonne question est : sauriez-vous le dire ?
II. L’évaluation déportée
Il faut rendre justice au système avant de l’attaquer.
Dans un laboratoire, un centre de R&D, une direction scientifique, un département de recherche clinique, l’évaluation du travail n’a jamais été absente. Elle était déportée.
Déportée dans le temps. On évalue une personne à l’entrée, massivement, une fois. Concours, thèse, publications, entretiens, parfois plusieurs journées de sélection. L’investissement est lourd et il est délibéré. Puis on cesse. La suite de la carrière fonctionne au crédit, un crédit qui s’accroît avec l’ancienneté et qu’on ne révise presque jamais à la baisse. Il va de préférence à ceux qui en ont déjà.
Déportée dans l’espace. La vraie évaluation se produit dehors, par la revue des pairs, la publication, la citation. L’organisation n’évalue que très rarement ses propres productions. Elle attend que le monde académique le fasse pour elle, avec plusieurs mois de délai et une couverture qui, dans un centre de R&D industriel, dépasse rarement dix pour cent de ce qu’on y produit. Le reste ne passe devant aucun juge. Notes internes, dossiers de décision, synthèses de veille, arbitrages de portefeuille. Presque jamais.
Déportée dans la forme, enfin. Ce qui reste d’évaluation interne tient du rituel social plutôt que du critère. Le séminaire du jeudi. La revue de projet. Le comité scientifique. On n’y note rien. On discute, on nuance, et à la fin quelqu’un dont la voix pèse plus que les autres oriente la salle.
Déportée vers le régulateur, dans une partie de ces maisons. Un dossier d’autorisation est examiné par des rapporteurs nommés, qui écrivent une objection motivée sur le choix du comparateur, sur la population retenue, sur le critère principal et sur l’usage qui a été fait de la littérature. C’est du jugement, écrit et signé, auquel il faut répondre sous délai. Trente ans de ce régime n’ont produit aucune capacité d’évaluation interne dans les mêmes maisons. On y a appris à fabriquer le dossier que le juge attend, et le juge est resté dehors.
On va m’objecter que ces maisons sont couvertes de dispositifs qualité. C’est vrai, et c’est parfois même un euphémisme. Protocoles, procédures opératoires normalisées, traçabilité d’échantillon, validation statistique, revue réglementaire, audits croisés. Certaines industries en sont saturées au point que le contrôle occupe plus de temps que le travail contrôlé. Elles savent parfaitement vérifier qu’une procédure a été suivie.
Vérifier qu’une procédure a été suivie ne revient pas à évaluer un jugement. Un protocole impeccablement exécuté sur une mauvaise hypothèse produit un résultat impeccable et inutile. Toutes les cases sont cochées, tous les contrôles sont passés, et l’ensemble ne vaut rien parce que la question de départ était mal posée. C’est l’hypothèse qui n’a jamais été notée. Le choix de la question, la sélection des sources, la construction du raisonnement, la décision de s’arrêter là plutôt qu’ici.
Ma liste est peut-être trop commode. Les jalons assortis de critères de passage écrits avant le lancement d’un projet, les revues de conception, les niveaux de maturité technologique, les comités qui statuent chaque année sur chaque famille de projets avec un motif écrit et un décideur nommé. Voilà des dispositifs qui tranchent sur autre chose qu’une procédure suivie. Un jalon de fin de phase statue sur les données du programme et sur son coût restant. Ce qu’il ne fait que rarement, c’est noter la qualité du raisonnement de celui qui a proposé le programme. Le dossier passe ou ne passe pas. Personne n’écrit que l’hypothèse de départ était mal construite, et personne ne rouvre la cotation trois ans plus tard pour regarder qui s’était trompé et sur quoi.
Ces organisations évaluent bel et bien : des personnes, une fois ; des procédures, toujours ; des jugements, bien trop rarement.
Ce n’était pas absurde. C’était économique. Construire une fonction d’évaluation du jugement expert coûte cher, prend du temps, et heurte frontalement des gens qu’on ne veut pas heurter. Tant que la production restait lente et rare, s’en passer était le bon calcul. Le filtre d’entrée effectuait le travail. Quand il faut quinze ans pour former quelqu’un capable de produire une hypothèse défendable, et trois semaines à cette personne pour la produire, la rareté du producteur garantit à peu près la qualité du produit. On ne contrôle pas ce qui est rare et cher à fabriquer. On contrôle le fabricant, une fois, à l’entrée. Il y a juste une conséquence qu’on n’a pas vu venir.
Une organisation qui n’évalue pas son travail ne développe pas le vocabulaire pour en parler. Au bout de trente ans, l’outil manque et les mots aussi. Demandez à un comité scientifique ce qui sépare une bonne synthèse bibliographique d’une synthèse médiocre. Vous obtiendrez des adjectifs. Rigoureux. Solide. Sérieux. Bien mené. Complet. Honnête.
Ce sont des appréciations, pas des critères. On ne peut rien en faire, ni former quelqu’un, ni arbitrer un désaccord, ni, bien sûr, noter une machine.
Testez-le, c’est instructif. Prenez deux experts d’un même domaine, montrez-leur le même document, demandez-leur séparément ce qu’ils en pensent. Ils convergeront souvent sur le verdict global. Demandez-leur ensuite d’écrire les trois critères qui ont produit ce verdict. Vous obtiendrez deux listes qui se recoupent peu, et souvent chacun découvrira en s’écoutant qu’il ne sait pas dire ce qu’il fait. La mauvaise volonté n’y est pour rien. On ne le leur a jamais demandé, et un savoir qu’on n’énonce pas ne se structure pas.
C’est le trou. Il est ancien, confortable, et il est resté parfaitement invisible jusqu’à un mardi matin.
III. Le goulot était ailleurs
On a vendu l’IA générative comme un gain de productivité. Si mes experts produisent trois fois plus vite, je produis trois fois plus. C’est une lecture industrielle. Elle valait pour la ligne de production, le back-office, le service client, le centre d’appel, et on l’a transposée sans examen à un contexte où elle ne vaut pas.
La raison est structurelle. Dans une organisation savante, la production n’a jamais été le goulot.
Le goulot, c’était la sélection. La capacité à décider, parmi toutes les directions possibles, laquelle vaut qu’on y engage six mois, un budget, une équipe. Cette décision reposait sur un petit nombre de gens, et elle était rare parce qu’ils étaient rares.
Multipliez la production par cent, et vous n’avez pas multiplié la performance par cent. Vous avez déplacé toute la pression sur le point qui n’a jamais été instrumenté.
L’IA générative a multiplié ce qui n’était pas rare et laissé intact ce qui l’était.
Prenez une synthèse de littérature. Avant, un chercheur y consacrait deux semaines, en tirait douze références qu’il avait lues, et son jugement sur ce qui compte était incorporé au texte, invisible et incontestable. Après, une machine produit trente pages et cent références en un après-midi, dont quatre-vingt-quinze sont réelles, trois approximatives, et deux n’existent pas.
L’IA écrit très bien, la question est ailleurs : sauriez-vous repérer les deux références qui n’existent pas ? Si oui, vous venez de gagner un facteur dix sur la production brute. Une vérification sérieuse vous en reprendra une bonne part, et le compte final tourne plutôt autour de trois ou quatre, ce qui reste considérable. Si non, vous venez d’introduire dans votre corpus interne un poison lent, sous une forme qui inspire plus confiance que ce qu’elle remplace. C’est bien écrit, c’est bien structuré, ça ressemble beaucoup à du travail sérieux.
Prenez un second cas, moins évident mais possiblement plus révélateur. Un comité de portefeuille doit arbitrer entre douze programmes de recherche. Avant l’IA, chaque programme arrivait avec un dossier de quinze pages, produit en trois semaines par son porteur, et le comité passait la moitié de sa séance à demander des précisions qui manquaient. Aujourd’hui, chaque dossier fait quarante pages, il est complet, il anticipe les questions, il est structuré de manière irréprochable.
Le comité est-il mieux armé pour décider ? Non. Il est moins bien armé.
Dans l’ancien monde, ce qui distinguait un bon programme d’un mauvais tenait autant à la qualité de son argumentation qu’à son contenu, et cette qualité signalait indirectement celle de son porteur. Un dossier confus signalait une pensée confuse. Le signal était grossier, injuste par moments, et il portait de l’information. Tous les dossiers sont maintenant également bien écrits. Le comité doit juger sur le fond, uniquement sur le fond, c’est-à-dire faire explicitement ce qu’il n’a jamais eu à faire.
Voilà pourquoi le problème n’apparaît jamais là où on l’attend. On le cherche du côté de la fiabilité de la machine. Il surgit du côté de la capacité de l’organisation à distinguer, une capacité qui reposait sur des signaux indirects que l’abondance vient d’effacer.
Presque personne n’a franchi ce seuil. D’où le paradoxe qu’on observe dans à peu près toutes les grandes organisations de recherche. Des taux d’utilisation très élevés, une satisfaction déclarée très élevée, et aucun effet que quiconque ait su établir sur ce qui compte. Ni sur le délai de décision, ni sur la longueur de la file qui attend devant l’expérimentation.
Le taux de succès des programmes ne figure pas dans cette liste et il ne peut pas y figurer. Sa latence se compte en années, aucune organisation ne collecte la donnée, et j’écris au quatrième essai que c’est elle qui tranchera.
Il y a une manière simple de vérifier ce diagnostic chez vous. Prenez votre dernier comité de direction R&D. Comptez les décisions prises. Comparez avec celui d’il y a trois ans. Si le nombre n’a pas bougé, et si le délai moyen entre l’émergence d’une question et sa résolution n’a pas bougé non plus, alors quel que soit votre taux d’adoption, vous n’avez rien transformé. Vous avez rendu du confort à des gens. C’est estimable. Mais ce n’est pas ce que vous aviez budgété.
IV. Quatre paliers, et un seul qui compte
Je propose ici une manière de lire ce qui se passe. Quatre paliers, qui ne se franchissent pas dans le désordre.
Palier 1 — L’assistance. Chacun utilise l’IA à sa main. Le chercheur pour reformuler, le chef de projet pour synthétiser, le manager pour préparer une réunion. C’est réel, c’est utile et d’ailleurs c’est apprécié. Ça ne se voit nulle part dans les comptes de l’entreprise et ça ne s’y verra jamais, parce que la valeur est captée par les individus et se dissipe à leur niveau. C’est une amélioration des conditions de travail, et il faudrait avoir l’honnêteté de la présenter comme telle.
Palier 2 — L’évaluation. L’organisation se dote de la capacité à dire, sur un type de travail donné, ce qui distingue un bon résultat d’un mauvais. Explicitement, et d’une manière que d’autres peuvent reprendre après elle. Ce palier ne produit aucune valeur directe. C’est un coût pur, un péage.
Palier 3 — La délégation. Une fois qu’on sait noter, on peut confier. Un périmètre borné, des critères connus, une traçabilité, un seuil au-delà duquel un humain reprend la main. C’est ici, et pas avant, que la valeur économique apparaît, parce que c’est ici qu’on cesse d’ajouter du travail à des gens et qu’on commence à en retirer.
Palier 4 — La reconception. Le processus lui-même est reconçu pour une organisation où la production est abondante et le jugement rare. On ne fait plus la même chose plus vite, on fait autre chose. C’est le palier de l’avantage durable, et il est inutile d’en parler tant qu’on n’a pas franchi le palier 2.
Voilà l’observation qui m’intéresse :
La grande majorité des organisations sont au palier 1 et se croient au palier 3.
Elles s’en croient parce qu’elles ont des chiffres. Taux d’adoption, utilisateurs actifs, cas d’usage lancés, heures économisées déclarées. Tous ces indicateurs mesurent avec précision le palier 1. Aucun ne mesure le franchissement du palier 2. Et comme ils montent bien, ils produisent une conviction sincère de progrès. Ils montent toujours bien : la satisfaction déclarée pour un outil gratuit et pratique est un des chiffres les plus faciles à obtenir au monde.
Le taux d’adoption est l’indicateur qui pourrait malheureusement vous faire perdre trois ans. Facile à collecter, flatteur, il monte tout seul, et il est parfaitement décorrélé de la seule question qui détermine si votre investissement produira quoi que ce soit.
La question n’est pas combien de vos gens utilisent l’IA. Elle est : sur combien de types de travail savez-vous dire, sans convoquer votre expert le plus réputé, si le résultat est bon ?
Pour la plupart des organisations, la réponse honnête est : pas beaucoup.
Voici à quoi ressemble le franchissement. Une équipe décide de traiter un seul type de travail, par exemple : la synthèse de l’état de l’art sur une question donnée. Un livrable précisément délimité, et rien d’autre. Elle réunit trois experts du domaine et leur demande d’écrire ce qu’ils exigeraient d’un collaborateur junior sur ce livrable. Personne ne leur demande d’évaluer un outil. La conversation dure quatre heures et elle est pénible, parce qu’ils découvrent qu’ils ne sont d’accord ni sur le nombre de sources attendu, ni sur le traitement des résultats contradictoires, ni sur ce qu’il faut faire d’une littérature majoritairement chinoise et non traduite.
Ils finissent par produire une liste. Onze critères, dont quatre éliminatoires. Ils écrivent aussi, ce qui n’était pas prévu, une dizaine d’exemples de fautes qu’ils tiennent pour rédhibitoires. Ils se sont aperçus qu’il est plus facile de nommer ce qui disqualifie que ce qui qualifie.
Puis ils prennent quinze travaux passés, produits par des humains, et les notent avec leur propre grille. Trois de ces travaux, signés par des gens respectés, échouent aux critères éliminatoires.
C’est ce moment-là qui fait ou défait le projet. Soit l’organisation traite ces trois échecs comme la preuve que la grille est mauvaise, et elle retourne au palier 1 en ayant perdu six semaines. Soit elle les traite comme la première information nouvelle qu’elle produit sur elle-même depuis longtemps.
Ces onze critères deviendront onze cases, et il vaut mieux le dire avant que la maison ne le découvre. C’est ce qu’elle sait faire de mieux, transformer un critère en formulaire en dix-huit mois, sans intention mauvaise, parce que le formulaire se remplit plus vite que le critère ne s’applique.
Deux choses seulement s’y opposent. La première tient à ce qu’on écrit. Un critère qui demande comment le document traite les résultats contradictoires publiés sur la question, ou ce qu’il a fait d’une littérature majoritairement non traduite, ne peut pas être coché par quelqu’un qui n’a pas lu. Une case du type respect du plan type se coche sans rien lire du tout. La différence est entièrement dans la rédaction du critère, et c’est pour cela que ce travail revient à des gens du domaine et jamais à une direction de la qualité.
La seconde est un test. Une grille qui ne recale rien pendant un an est morte. Celle des quinze travaux en a recalé trois, signés par des gens respectés, et c’est à ce prix qu’elle prouvait qu’elle mesurait quelque chose. Le jour où ce taux tombe à zéro, la grille est devenue une case et il n’y a rien à sauver.
Une règle écrite abaisse aussi le coût du non. Celui qui refuse cesse de refuser en son nom propre et applique un critère que ses pairs ont écrit avec lui, ce qui lui retire l’obligation de motiver seul et le risque d’être celui qui n’a pas compris l’époque.
Ce que je peux dire, c’est que le second cas est rare, et qu’il est toujours le fait d’une direction qui a décidé à l’avance que les résultats seraient assumés quels qu’ils soient. Ça ne s’improvise pas dans la réunion de restitution.
Une dernière remarque que je souhaite partager ici concernant cette échelle. Elle se franchit par périmètre, jamais par organisation, et le franchissement d’un périmètre n’entraîne pas le suivant.
V. Pourquoi personne ne franchit le péage
On pourrait croire que le palier 2 est un problème technique. Techniquement, ce n’est pas très difficile. C’est fastidieux, méthodique, et il n’y a rien là qui exige une percée. Ce qui bloque est ailleurs. Construire une évaluation du travail expert, c’est écrire noir sur blanc ce qui fait qu’un expert a raison. Et donc, mécaniquement, quand il a tort. C’est pour ça que ça ne se fait pas très souvent.
Depuis trente ans, l’autorité scientifique dans ces maisons est fondée sur une opacité fonctionnelle. La personne qui dit non en quatre secondes n’a pas besoin de justifier, c’est précisément le privilège que sa réputation lui a acheté. Lui demander de formuler ses critères revient à lui demander de rendre contestable ce qui ne l’était pas.
Un critère explicite s’applique à tout le monde. Si vous établissez qu’une synthèse doit citer au moins trois sources primaires contradictoires, ce critère s’applique à la machine, et il s’applique aussi au rapport que votre directeur scientifique a signé le mois dernier. Vous ne pouvez pas construire une règle qui ne vaut que pour l’IA.
C’est donc, au sens strict, un acte politique. Il redistribue de l’autorité, d’une catégorie de personnes vers un ensemble de critères. Il transforme un pouvoir personnel en institution. C’est exactement ce que font les organisations quand elles passent de la confiance interpersonnelle à la règle, et historiquement, ça ne s’est jamais fait sans conflit.
Il y a un précédent instructif, et il est financier. Pendant longtemps, la solidité d’une entreprise se jugeait à la réputation de son dirigeant et à la parole de son banquier. Le passage à la comptabilité normalisée, puis à l’audit externe, puis à la certification obligatoire, s’est fait sur plus d’un siècle et contre une certaine résistance, parce qu’il retirait aux dirigeants le pouvoir de dire ce que valait leur entreprise. Personne ne défendrait aujourd’hui l’idée qu’on revienne à la parole du banquier. Chaque étape a été combattue par ceux dont elle réduisait la latitude, avec des arguments qui ressemblent beaucoup à ceux qu’on entend dans les laboratoires. Que la réalité est trop complexe pour des règles, que le chiffre tue le discernement, que celui qui connaît vraiment le dossier ne peut pas expliquer ce qu’il sait. Ces arguments n’étaient pas entièrement faux.
Il existe un second précédent, et je le connais mieux parce que j’en viens. La physique des particules a longtemps vu s’évanouir des découvertes annoncées à trois écarts-types. Le signal était réel au sens statistique, il ne survivait pas à la vérification, et la discipline a mis du temps à comprendre pourquoi. Quand on regarde dans assez d’endroits, il se trouve toujours un endroit où le bruit ressemble à un signal. Elle en a tiré une règle unique et volontairement brutale. Cinq écarts-types. Une chance sur trois millions et demi qu’une simple fluctuation produise un écart aussi grand.
La formulation compte, et je la corrige parce que la confusion est constante, y compris chez ceux qui invoquent le seuil. Ce que le seuil mesure est la probabilité que le bruit seul produise ce qu’on observe. La probabilité inverse, celle que l’écart observé soit du bruit, demande de savoir ce qu’on croyait avant de regarder, et personne ne l’écrit jamais. C’est exactement l’inversion que produit un score de confiance calculé par la machine sur sa propre réponse.
Le seuil est arbitraire et personne ne prétend le contraire. Il rend un service que son arbitraire n’entame pas. Il s’applique au doctorant de première année comme au lauréat du Nobel, et aucune réputation n’en dispense. Ce précédent est plus encourageant que le précédent comptable, parce que la contrainte n’a pas été imposée du dehors. Les experts se la sont donnée eux-mêmes, en constatant que leur jugement collectif produisait trop d’erreurs pour qu’on continue à s’y fier sans garde-fou. Rien n’interdit à une direction scientifique le même mouvement.
D’où les trois évitements qu’on observe partout, et qui sont trois manières de contourner le conflit.
Le premier consiste à laisser l’IA se noter elle-même. Séduisant, rapide, et ça évite complètement le passage devant les experts. On demande au système un score de confiance sur sa propre réponse, et on décide sur cette base. Ça revient à supprimer votre fonction de contrôle interne au motif que le contrôlé s’engage à être honnête. Personne n’accepterait ça pour ses comptes. Beaucoup l’acceptent pour leur science, parce que la ligne entre celui qui produit et celui qui juge n’a jamais été posée dans ce domaine, puisqu’il n’y avait pas de juge.
Et le piège est plus retors qu’il n’y paraît. Un système d’IA est très bon pour produire un score de confiance plausible. Il ne se contredit pas, il ne rougit pas, il ne bafouille pas. Le score sera bien calibré en apparence, distribué de manière convaincante, et il aura toutes les propriétés statistiques d’une mesure sauf celle d’en être une. Une mesure suppose un protocole fixé avant l’observation et une incertitude qu’on sait estimer. Vous obtiendrez un tableau de bord magnifique.
Le deuxième consiste à importer un référentiel externe. On prend un classement public, un benchmark disponible, et on annonce que le modèle est excellent parce qu’il y obtient un bon score. C’est confortable. Un référentiel externe vous dit si une machine est bonne en général. Il ne vous dit rien sur ce qui, chez vous, fait qu’un travail est acceptable. Vos critères sont particuliers. Ils portent la trace de vos échecs passés, de vos contraintes industrielles, de vos arbitrages historiques, parfois d’un accident qui a coûté cher il y a douze ans et dont plus personne ne parle mais dont tout le monde tient compte. Personne d’autre ne les a écrits, et personne d’autre ne peut les écrire à votre place.
Le troisième, le plus courant, consiste à renvoyer la décision à l’expert le plus réputé. On construit un pilote, on lui montre le résultat, on lui demande ce qu’il en pense. Il donne un avis. On le note comme une validation. On vient de reproduire, sur un support numérique, exactement le système de réputation qu’on prétendait dépasser, avec en prime l’illusion d’avoir avancé.
Ces trois évitements ont un point commun. Ils permettent de ne jamais tenir la conversation difficile.
Ce qui la rend faisable, quand elle l’est, est une inversion de posture. Le sujet n’est pas de faire valider une machine par vos experts. Il est de leur faire écrire l’examen. Poser les questions, définir ce qu’une bonne réponse contient, dire ce qui constitue une faute rédhibitoire.
La différence est presque entièrement psychologique, et elle change beaucoup de choses. Dans le premier cas, on demande à quelqu’un de céder de l’autorité. Dans le second, on lui demande de la fixer, de faire passer dans une institution durable ce qu’il détenait à titre personnel et qui disparaîtra avec lui. Beaucoup l’acceptent volontiers quand c’est présenté ainsi. Certains le vivent même comme une reconnaissance, ce qu’objectivement c’est.
J’ajoute une observation, que je livre pour ce qu’elle est, une impression répétée plutôt qu’un relevé. Les experts les plus réticents ne sont presque jamais les plus anciens. Ce sont ceux du milieu de carrière, ceux dont la légitimité est acquise mais pas consolidée. Les plus seniors, ceux qui n’ont plus rien à prouver et qui commencent à penser à ce qu’ils laisseront, sont souvent les meilleurs alliés. La question de la transmission les occupe déjà, et on leur propose exactement un dispositif de transmission.
Il reste une règle qui ne souffre aucune exception. Celui qui produit ne peut pas être celui qui note. Ni la machine sur elle-même, ni l’équipe qui a construit l’outil sur la qualité de l’outil, ni le porteur du projet sur le succès du projet. Cette séparation paraît évidente quand on l’énonce, non ?
VI. Celui qui vérifie ne vérifie pas
Il reste une croyance à démonter et elle a l’apparence du bon sens. Nous n’avons pas besoin de construire une évaluation, puisque nos experts relisent.
C’est la position par défaut à peu près partout. L’humain garde la main, l’humain valide, l’humain est dans la boucle. La formule est devenue si standard qu’on l’inscrit dans les chartes d’usage sans se demander une seconde ce qu’elle recouvre. Elle recouvre ceci : un expert reçoit un document produit par une machine, le parcourt, et donne son accord.
Je crois que cette relecture, dans la très grande majorité des cas, ne vérifie rien du tout. Et je crois qu’elle est pire que rien, parce qu’elle produit une trace de contrôle là où il n’y a pas eu de contrôle.
Trois raisons à cela, et elles sont cumulatives.
La première est que la forme désarme l’examen.
Nous avons appris, sur des décennies de lecture professionnelle, à utiliser la qualité formelle d’un texte comme indice de la qualité de sa préparation. Un document bien structuré, correctement référencé, sans faute de langue, avec des transitions justes et un vocabulaire maîtrisé, signalait quelqu’un qui avait travaillé. Ce n’était pas un préjugé. L’inférence était statistiquement fondée, parce que produire cette forme coûtait cher et que personne ne payait ce coût pour un contenu qu’il savait creux.
L’inférence est morte. La forme ne coûte plus rien. Le réflexe, lui, est intact. Il est trop ancien, trop solidement installé, trop utile par ailleurs pour qu’on le désactive par décision consciente.
Le résultat est qu’un expert qui relit un texte parfaitement écrit le lit avec un niveau de vigilance calibré sur l’ancien monde. Il cherche les défauts là où ils se signalaient autrefois : dans les hésitations, les approximations de langue, les structures bancales. Il n’en trouve aucun. Sa vigilance baisse. Et c’est à ce moment-là qu’il passe sur la référence inventée, qui est écrite exactement comme les vingt-deux autres.
Il suffirait, dit-on, de prévenir les gens. On les prévient. Ça ne suffit pas. Ce n’est pas une information qui manque, c’est un automatisme perceptif, et un automatisme perceptif ne se corrige pas par une note de service.
La deuxième raison est que vérifier coûte plus cher que produire.
C’est l’inversion la plus compliquée de toute cette histoire. Dans l’ancien monde, produire une synthèse coûtait deux semaines et la relire coûtait deux heures. Le rapport était de un à quarante, ce qui rendait la relecture économiquement évidente. On ne discutait même pas de son opportunité.
Aujourd’hui, produire coûte un après-midi de machine. Et vérifier réellement, c’est-à-dire aller chercher chacune des cent références, l’ouvrir, confirmer qu’elle existe, qu’elle dit ce qu’on lui fait dire, et qu’elle le dit dans le contexte où on l’invoque, coûte bien plus de temps.
Le rapport s’est inversé. La vérification est devenue l’opération la plus coûteuse de la chaîne.
Aucune organisation n’accepte consciemment cette dépense. Alors elle ne la fait pas. Elle fait autre chose, qu’elle appelle du même nom : elle échantillonne. L’expert vérifie trois références sur cent, choisies parce qu’elles lui semblent inhabituelles, trouve qu’elles sont correctes, et étend son verdict à l’ensemble.
Ce raisonnement serait légitime si les erreurs étaient distribuées aléatoirement. Or elles ne le sont pas. C’est la différence entre une erreur statistique et une erreur systématique. La première se réduit quand on augmente l’échantillon, la seconde ne se réduit jamais, quel que soit le nombre de références qu’on vérifie. Un système génératif se trompe précisément là où la littérature est la plus fine. Sur les sujets peu couverts, les résultats récents, les combinaisons rares. C’est-à-dire exactement sur les points qui ont le plus de valeur pour vous, puisque ce sont ceux sur lesquels vous cherchez quelque chose que les autres n’ont pas. L’échantillonnage a vérifié le trivial et laissé passer le décisif.
Cette dépense a trois étages et ils n’ont pas le même prix. L’existence d’une référence se vérifie par résolution d’identifiant, à coût presque nul et sur la totalité du document. Quelques jours de développement y suffisent, et aucun expert n’a besoin d’y toucher. Savoir si elle dit ce qu’on lui fait dire demande le texte intégral, souvent payant, et une lecture humaine. Reste le troisième étage, celui où l’on demande si elle le dit dans le contexte où on l’invoque, et celui-là ne se délègue à rien. C’est lui qui coûte plusieurs jours. Une organisation qui paie des experts pour faire le premier étage se trompe de dépense.
La troisième raison est la plus dérangeante : celui qui relit n’a pas envie de trouver.
Un expert à qui l’on demande de relire une production de machine se trouve dans une position sociale inconfortable, et cette position pousse dans deux directions opposées, aucune des deux ne menant à une vérification honnête.
S’il valide, il gagne du temps, il paraît coopératif, il évite d’apparaître comme le frein du projet. Et il fait porter le risque à un objet impersonnel qui ne lui sera pas reproché. S’il rejette, il doit motiver, il retarde, il s’expose à ce que quelqu’un d’autre revalide derrière lui, et il prend le risque d’être celui qui n’a pas compris l’époque.
Dans les deux cas, ce qui détermine sa décision n’est pas ce que contient le document. C’est ce que sa décision lui coûtera.
Ajoutez à cela que la relecture n’est presque jamais rémunérée, jamais mesurée, jamais valorisée dans une carrière, et vous obtenez une activité que tout le monde accomplit et que personne n’a de raison de bien accomplir. Nous avons construit un contrôle qualité dont le contrôleur n’a aucun intérêt à l’exercer sérieusement.
Ces trois raisons se renforcent. La forme désarme la vigilance, le coût rend la vérification impraticable, l’incitation pousse à valider. Le résultat est un dispositif qui produit systématiquement des accords, et qui, parce qu’il en produit systématiquement, ne porte aucune information.
Un contrôle qui approuve toujours n’est pas un contrôle bienveillant. C’est un contrôle qui n’existe pas.
Je veux être précis sur ce que ça implique, parce que la conclusion est contre-intuitive.
Elle n’est pas qu’il faut relire plus sérieusement. C’est ce qu’on répond en général, et on ne remonte pas contre trois forces structurelles par un appel à la conscience professionnelle.
Elle est que la relecture humaine devient possible une fois l’évaluation construite, et pas avant.
Un expert à qui l’on demande si ce document est bon est renvoyé à son jugement global, sans point d’appui, dans les conditions décrites plus haut. Il validera. Un expert à qui l’on demande si ce document satisfait ces quatre critères éliminatoires, dont voici les définitions, fait un travail entièrement différent. Il a une prise, il sait où regarder, sa décision est motivée par autre chose que sa position sociale, et son rejet éventuel n’est plus une opinion personnelle mais l’application d’une règle qu’il a lui-même contribué à écrire.
C’est la même personne, le même document, et deux opérations qui n’ont rien à voir.
On voit alors que demander s’il faut un humain dans la boucle n’apprend rien à personne. La réponse est évidemment oui. Ce qu’il faut demander, c’est avec quoi dans les mains.
Un humain dans la boucle sans instrument n’est pas une garantie. C’est un alibi, et c’est un alibi que les organisations s’offrent d’autant plus volontiers qu’il est gratuit.
VII. Évaluer tue l’exploration
Le camp d’en face a un argument sérieux : évaluer tue l’exploration.
Elle est formulée le plus souvent par les chercheurs les plus créatifs. Une organisation qui note tout finit par ne produire que ce qui est notable. Les critères explicites récompensent la conformité et pénalisent l’écart. Les découvertes qui comptent ont presque toujours l’apparence, au moment où elles surviennent, d’un résultat mal fondé. Une hypothèse mal étayée, une piste qui contredit la littérature, une intuition qu’on ne sait pas encore justifier. Si vous aviez soumis ces travaux-là à une grille, la grille les aurait rejetés.
C’est vrai. Historiquement, c’est massivement vrai. L’histoire des sciences est pleine de travaux qui auraient échoué à n’importe quel critère de leur époque, et l’histoire de l’évaluation de la recherche, bibliométrie, facteurs d’impact, indices divers, est un catalogue d’effets pervers documentés. Quand on mesure les publications, on obtient des publications. Quand on mesure les citations, on obtient des réseaux de citations. Le principe est connu et il est robuste. Toute mesure qui devient un objectif cesse d’être une bonne mesure. C’est la loi de Goodhart, énoncée à l’origine pour la politique monétaire et vérifiée depuis partout où l’on a tenté de piloter par indicateur.
J’ajoute l’aggravation qui vient avec l’IA : un système entraîné sur ce qui existe est structurellement conservateur. Il produit le consensus avec fluidité et l’écart avec réticence. Si vous construisez une évaluation qui récompense la conformité à la littérature, vous obtiendrez une machine excellente pour vous répéter ce que vous savez déjà, et vous appellerez ça un succès, parce que vos scores seront superbes.
Donc l’objection tient. Elle ne tient simplement pas là où on croit.
Elle ne dit pas qu’il ne faut pas évaluer. Elle dit qu’il n’existe pas une seule évaluation, et que tout dépend du nombre d’instruments dont on dispose. Il y a deux natures de travail intellectuel, et elles n’obéissent pas au même contrôle.
Il y a le travail qui doit être vrai. Une synthèse de l’état de l’art, une compilation de résultats, un dossier de preuve, une note réglementaire. Ici, l’exigence est binaire et impitoyable. Une référence inventée disqualifie le document, elle ne se pondère pas avec d’autres critères. Un dossier de preuve dont on ne peut garantir aucune ligne ne vaut pas moins qu’un bon dossier, il vaut moins que rien, parce qu’il consomme du temps de vérification qu’il prétendait faire économiser. Sur ce type de travail, la traçabilité est la condition d’entrée.
Et il y a le travail qui doit être fécond. Une hypothèse, une piste, une reformulation de problème, une analogie venue d’ailleurs. Ici, appliquer le critère de vérité est une erreur de catégorie. Une hypothèse n’est ni vraie ni fausse au moment où on la formule. Elle est plausible, originale, et surtout testable. Trois critères exigeants, dont aucun ne ressemble à de la conformité. La question n’est pas de savoir si la littérature le confirme. Elle est de savoir si l’on saurait construire l’expérience qui tranche.
La testabilité pénalise le vague, mais elle récompense l’écart : une hypothèse conforme à la littérature est généralement peu intéressante à tester, puisqu’on connaît déjà la réponse. Une grille qui note la testabilité pousse donc vers l’audace, pas vers la conformité : à condition qu’elle ne soit pas contaminée par des critères de vérité qui n’ont rien à y faire.
Il existe une troisième nature de travail, dont je parle moins parce qu’elle est moins discutée, et qui est la plus fréquente dans une organisation industrielle. Le travail qui doit être décidable. Une recommandation d’arbitrage, une note d’aide à la décision, une comparaison d’options. Ce travail porte sur un futur incertain, il n’a donc pas à être vrai au sens strict, et il n’a pas à être fécond non plus. Il doit être conclusif. Ses critères sont encore différents. L’exhaustivité des options considérées, l’explicitation des hypothèses, la robustesse de la recommandation aux variations de ces hypothèses. Une note qui recommande A et qui recommanderait encore A si l’on changeait trois paramètres est une bonne note. Une note qui bascule sur B au moindre ajustement est une mauvaise note, même si son raisonnement est impeccable.
Trois natures, trois grilles. Une organisation qui applique la grille de vérité au travail de fécondité stérilise sa recherche. Une organisation qui applique la grille de fécondité au travail de vérité empoisonne son corpus. Une organisation qui applique l’une ou l’autre au travail décidable produit des notes brillantes dont personne ne peut rien faire.
Je concède donc entièrement l’objection, et je la retourne. Le risque n’est pas d’évaluer, il est d’évaluer avec un seul instrument. C’est très exactement ce que fait le système de réputation. Un seul instrument, la confiance en une personne, appliqué indifféremment à tout.
Il reste une seconde objection, plus courte, et c’est souvent la vraie : c’est beaucoup d’efforts.
Oui. Construire une évaluation sérieuse sur un type de travail, c’est quelques semaines-homme d’experts qui ont autre chose à faire. C’est un coût réel, et il est visible, alors que le coût de ne rien faire est invisible.
Mais regardez ce que vous achetez. Pas la capacité de noter une machine, le droit de lui déléguer quoi que ce soit. Et, accessoirement, la mise par écrit d’un savoir de jugement qui n’existait jusque-là que dans la tête de quelques personnes et qui partait avec elles. Beaucoup d’organisations découvrent, en construisant leur évaluation, qu’elles viennent surtout de documenter leur propre expertise pour la première fois de leur histoire.
L’effet secondaire est peut-être le bénéfice principal, et il aurait justifié l’effort même sans l’IA.
VIII. Retour dans la salle
Revenons à la salle de réunion.
Ce qui s’y est passé ce mardi-là n’était pas un incident d’adoption, ni de la résistance au changement. Cette femme n’a pas résisté. Elle a fait ce qu’on lui demandait de faire depuis trente ans, arbitrer avec son jugement, dans une organisation qui n’a jamais construit d’alternative.
Le problème n’était pas elle. Le problème était que la pièce entière dépendait d’elle et l’ignorait.
C’est ce que l’IA est en train de révéler, et c’est pour ça que ce sujet ne restera pas technique très longtemps. Une organisation qui ne sait pas évaluer son travail savant est une organisation dont la qualité repose sur un petit nombre de personnes irremplaçables et non documentées. C’était déjà vrai avant. On pouvait ne pas le voir.
On peut d’ailleurs formuler l’ensemble de ce texte sans jamais mentionner l’intelligence artificielle, et c’est un bon test de sa solidité. Une organisation qui ne sait pas dire pourquoi un travail est bon ne peut ni former, ni transmettre, ni arbitrer un désaccord, ni se défendre devant un régulateur, ni survivre au départ de ses figures. Tout cela était vrai en 2015. L’IA n’ajoute rien à ce constat. Elle en supprime seulement la possibilité de l’ignorer, parce qu’elle place devant vous, chaque jour, des dizaines de productions dont personne ne peut dire si elles valent quelque chose.
Et le point le plus important, celui que je crois que les dirigeants sous-estiment entièrement : ils croient arbitrer un budget technologique alors qu’ils arbitrent où réside l’autorité chez eux, dans des personnes ou dans des critères. C’est une affaire de constitution interne, pas d’outillage. Elle se pose peut-être une fois par siècle dans une organisation. Elle est en train de se poser maintenant, par la petite porte, dans des comités de pilotage où l’on parle de licences et de taux d’usage.
Celles qui ne franchiront pas le palier 2 ne vont pas s’effondrer. C’est plus insidieux. Elles resteront au palier 1 pendant des années, avec des chiffres d’adoption excellents, une satisfaction interne réelle, et aucune amélioration de leur capacité à décider. Elles auront dépensé, elles auront communiqué, et elles ne pourront rien déléguer, parce qu’on ne délègue pas ce qu’on ne sait pas contrôler. Elles s’en apercevront le jour où un concurrent aura décidé trois fois plus vite qu’elles pendant deux ans, et ce jour-là, l’écart accumulé ne sera plus rattrapable par un investissement.
Celles qui le franchiront paieront d’abord un prix inconfortable. Quelques mois lents, des conversations désagréables, des experts qu’il faut convaincre de mettre par écrit ce qu’ils savaient sans le dire, et au moins un moment où la grille dira quelque chose que personne ne voulait entendre. Puis elles disposeront de quelque chose qu’aucune technologie n’achète, la capacité de dire ceci est bon sans convoquer personne. À partir de là, sur ce périmètre, elles pourront déléguer et reconcevoir. Sur le périmètre voisin, elles repartiront de zéro. C’est le prix de cette affaire.
Pour mesurer où vous en êtes, aucun outil n’est nécessaire.
Prenez la dernière décision importante de votre R&D, l’arrêt d’un programme, le choix entre deux voies techniques, l’allocation d’un budget significatif. Demandez-vous si, aujourd’hui, quelqu’un de nouveau pourrait retrouver pourquoi elle a été prise. Pas le compte rendu de la réunion, les raisons. Les options écartées et les motifs de leur écartement. Les hypothèses sous-jacentes et ce qui les fondait.
Dans la plupart des cas, la réponse est non. Il reste une décision, une date, des signatures, et un savoir qui n’existe plus que dans quelques mémoires. Lesquelles, dans dix ans, seront ailleurs.
Le problème dépasse l’archivage. Le raisonnement n’a jamais été considéré comme un livrable. On livrait la conclusion. Le chemin restait à celui qui l’avait parcouru, et personne ne trouvait cela anormal, parce que celui qui l’avait parcouru serait là pour le refaire si besoin.
Cette hypothèse-là, il sera là, est celle qui vient de tomber, et elle est tombée pour deux raisons simultanées. La démographie d’abord. La génération qui détient ce savoir dans ces maisons est majoritairement en fin de parcours. L’abondance ensuite. Même si elle restait, elle ne pourrait plus arbitrer seule un volume de production multiplié par cent.
C’est la conjonction qui rend le moment particulier. Chacune des deux causes, prise isolément, aurait pu être absorbée. Ensemble, elles secouent l’organisation.
Je termine sur une remarque qui n’est pas rassurante mais qui me paraît juste.
Une organisation franchit rarement le palier 2 parce qu’elle a compris un raisonnement. Elle le franchit parce qu’un événement précis l’y contraint : un dossier rejeté par un régulateur pour cause de référence non vérifiable, un programme arrêté trop tard qui a coûté deux ans, le départ simultané de trois experts sur un même domaine. Le déclencheur est toujours une perte, jamais une lucidité.
Il n’y a rien d’étonnant à cela. Le palier 2 est un coût certain contre un bénéfice probable, ce qui est le type d’arbitrage que les organisations font le plus mal. Il faut une force extérieure pour le rendre acceptable.
Ce que je peux dire est donc modeste : cette force arrivera. Elle prend la forme d’un régulateur, d’un concurrent ou d’une retraite, et son calendrier n’est pas de votre ressort. La seule variable qui l’est, c’est de savoir si vous aurez commencé avant qu’elle n’arrive.
Le vrai chantier de l’IA dans les organisations savantes n’est donc pas un chantier d’IA.
C’est celui de la part du jugement : combien il en reste, où elle se situe, et à qui elle appartient.