Aller au texte

Hors bilan La part du jugement

Essai III

La moitié qui n’accélère pas

Sur l’économie des organisations à deux vitesses


Karim Louedec · août 2026 · ~27 min

Hors bilan · Opus I · Essai III — datatropy.ai

Essai III

La moitié qui n’accélère pas

Sur l’économie des organisations à deux vitesses

I. Le mur

Une équipe de recherche me montre, avec une fierté légitime, ce qu’elle a obtenu sur l’année écoulée.

Auparavant, la formulation d’une hypothèse sérieuse, celle qui justifie qu’on monte une expérience, demandait plusieurs semaines. Il fallait lire, croiser, discuter, écarter. Aujourd’hui, avec les outils dont elle dispose, l’équipe en produit une par jour ouvré. Documentées, argumentées, référencées, plausibles.

Deux cent quarante hypothèses dans l’année, là où il y en avait vingt, un ou deux ans plus tôt. Je demande combien ils en ont testées. Silence, puis la réponse. Dix-huit. À peu près ce qu’ils testaient avant. Et à peu près ce qu’ils testeront l’an prochain, et très probablement l’année d’après.

Je pose alors la question qu’on oublie. Combien coûte un de ces dix-huit tests, et qui en a fixé le nombre. Dix-huit peut être un plafond de capacité. Ce peut être aussi une ligne budgétaire qu’on reconduit sans la rouvrir. Le premier cas est celui que décrit ce texte. Le second est un défaut de pilotage de portefeuille, et un exercice budgétaire le corrige.

Deux cent quarante hypothèses. Dix-huit tests. Le reste attend, dans un fichier que personne ne rouvre, et qui grossit. Une moitié de l’organisation vient d’accélérer d’un facteur dix, et l’autre moitié n’a pas bougé d’un cheveu.

Cette asymétrie est un fait, et il manque à presque toutes les conversations sur l’intelligence artificielle. On y parle de productivité, d’adoption, de gains de temps, de cas d’usage. On y parle rarement de ce qui se passe quand on accélère un seul côté d’un système qui en a deux.

On ne l’accélère pas. On construit une file d’attente.

Une file d’attente est un objet économique, avec ses lois propres. Elle détruit de la valeur, et elle déplace l’endroit où une organisation devrait investir.

II. Deux horloges

Toute organisation de recherche fonctionne sur deux horloges qui n’ont aucun rapport l’une avec l’autre.

La première est celle de la pensée. Formuler une question, chercher ce qui existe, construire une hypothèse, concevoir un protocole, interpréter un résultat, écrire une recommandation. Cette horloge est réglée par la disponibilité cognitive des gens. Elle est lente parce que les gens sont peu nombreux et occupés.

La seconde est celle de la matière. Faire pousser une plante. Mener une cohorte de patients jusqu’à un critère d’évaluation. Vieillir un matériau. Attendre une saison, un cycle de reproduction, une période de latence. Obtenir l’autorisation d’un comité. Faire tourner un essai pilote. Cette seconde horloge est réglée par autre chose que nous. La biologie, la chimie.

La distinction paraît triviale. Nos organisations savantes ont été construites comme si les deux horloges tournaient à peu près à la même vitesse.

C’était vrai dans une partie des sciences et faux dans l’autre. Sur une paillasse de chimie, concevoir une expérience prenait quelques semaines et la mener en prenait quelques mois, un rapport de un à trois, parfois de un à cinq. En sélection variétale, en foresterie, en épidémiologie de cohorte, le rapport était de un à cent avant que la moindre machine s’en mêle, et il l’était déjà dans les années soixante-dix.

Ces maisons-là n’ont pas découvert l’asymétrie avec l’intelligence artificielle. Elles ont construit leurs pipelines étagés, leurs générations qui se chevauchent, leurs pépinières de contre-saison et leurs portefeuilles décalés d’un an précisément pour vivre avec un rapport de un à cent.

Ce qui a changé est l’amplitude, et le fait que ces structures ont toutes été calées sur un flux amont donné. Un pipeline conçu pour cent hypothèses par an en absorbe cent vingt sans broncher. Il n’en absorbe pas mille. Le rapport de un à trois est passé à un à trente. Celui de un à cent a bougé dans la même proportion.

L’horloge de la matière n’est pas complètement rigide, c’est l’objection sérieuse à ce texte, et elle viendra. La compression du temps physique n’est pas uniforme. Elle atteint un ordre de grandeur là où l’expérience se parallélise ou se remplace par un calcul. Elle plafonne à quelques dizaines de pour cent là où la durée de l’essai est le phénomène lui-même. La compression du temps de conception, elle, a été de plusieurs centaines de pour cent, partout à la fois, sans distinction de domaine.

L’asymétrie de coût s’est réduite aussi. Une pépinière de contre-saison se loue à la parcelle chez un prestataire. Un créneau de séquençage ou de phénotypage s’achète à l’unité comme un dosage. Une étude se sous-traite à un organisme de recherche sous contrat. Une part croissante de la capacité expérimentale est devenue de la dépense de fonctionnement, achetable au marginal, sans immobilisation ni délai d’équipement. La compression amont a été générale et rapide. La compression aval reste inégale, elle se paie, et elle s’arrête là où le temps est le phénomène.

Ce sont deux ordres de grandeur différents. Beaucoup de stratégies d’investissement l’ignorent encore et continuent de financer massivement le côté qui vient de devenir abondant.

III. La file

L’intuition spontanée est qu’une file est un stock qui attend, et qu’un stock qui attend est neutre. Il ne produit rien, il ne détruit rien non plus, et on le traitera plus tard, dans l’ordre. C’est faux sur trois points, et chaque erreur coûte de l’argent.

Premier point, le contenu d’une file se périme.

Une hypothèse formulée aujourd’hui repose sur l’état des connaissances d’aujourd’hui. Dix-huit mois plus tard, une partie de ce qui la fondait a bougé. Un résultat publié ailleurs, un brevet déposé, un changement réglementaire, une évolution du marché. La file contient donc des hypothèses qui étaient bonnes et ne le sont plus, et personne ne le sait, parce que personne ne réexamine une file.

Le taux de péremption n’est pas marginal. Dans les domaines où la littérature progresse vite, une bonne part de ce qui attend plus d’un an a perdu l’essentiel de son intérêt. L’organisation a payé pour produire ces hypothèses. Elle ne les testera jamais.

Deuxième point, une file longue rend l’ordonnancement décisif, et l’ordonnancement existe rarement.

Quand vingt hypothèses attendent dix-huit places, l’ordre importe peu, on fera presque tout. Quand deux cent quarante hypothèses attendent dix-huit places, l’ordre est la chose qui compte. La valeur produite dans l’année dépend de la qualité du tri.

Or ce tri n’a jamais été conçu comme une fonction. Il n’a pas de titulaire, pas de critères écrits, pas de budget, pas d’évaluation. Il se fait par des mécanismes qui étaient acceptables quand l’enjeu était faible. L’ancienneté du demandeur, l’insistance, la proximité avec le décideur, l’ordre d’arrivée, la familiarité du sujet.

Troisième point, et c’est une impression répétée plutôt qu’un relevé. Une file longue décourage la production de qualité.

C’est un effet de comportement. Lorsqu’un chercheur sait que son hypothèse a une chance sur treize d’être testée, et que cette chance dépend de facteurs qu’il ne contrôle pas, il cesse d’investir dans la qualité de ses hypothèses. Il en produit davantage, ce qui augmente ses chances statistiques, et il les soigne moins. Le système récompense le volume.

Ce troisième effet dépend donc du deuxième. Il suppose que le tri reste opaque, et il s’inverse le jour où les critères sont écrits et publiés.

On obtient donc, mécaniquement, une file qui s’allonge et dont la qualité moyenne baisse. Ce qui rend le tri à la fois plus important et plus difficile.

Le résultat est une situation que je crois assez répandue aujourd’hui. Une organisation qui a beaucoup investi dans sa capacité de production d’idées, qui constate une explosion de son activité amont, et dont la production de résultats est rigoureusement identique à ce qu’elle était avant.

Elle ne comprend pas pourquoi. Elle en conclut souvent que le problème vient de l’exécution, qu’il faudrait plus de capacité expérimentale, plus d’équipements. Elle demande des budgets pour élargir le goulot. La réponse est compréhensible, et souvent mauvaise.

IV. La science de l’attente

Il existe une science de l’attente. Elle n’est pas nouvelle puisque construite en 1909 pour dimensionner les centraux téléphoniques de Copenhague, puis appliquée aux usines, puis aux hôpitaux. Elle dit des choses précises sur ce qui se passe quand une capacité limitée reçoit un flux qui la dépasse. Trois de ses enseignements s’appliquent directement ici.

Le premier, l’attente n’augmente pas proportionnellement à la charge. Elle explose.

Tant qu’un système fonctionne à soixante ou soixante-dix pour cent de sa capacité, les temps d’attente restent modérés et à peu près prévisibles. Au-delà de quatre-vingt-cinq pour cent, ils s’envolent, et la variabilité s’envole avec eux. La courbe est une asymptote.

La plupart des organisations de recherche fonctionnaient déjà, avant l’IA, à des taux de charge élevés, parce que laisser une capacité expérimentale inutilisée est considéré comme une faute de gestion. Elles vivaient près de l’asymptote. Ce qui s’est produit ensuite est d’une autre nature. Deux cent quarante arrivées pour dix-huit services font un rapport de treize, et le système est passé de l’autre côté du point de stabilité. Il n’y a plus d’asymptote parce qu’il n’y a plus de régime stationnaire du tout. Le stock croît, régulièrement, indéfiniment, au rythme de la différence entre ce qui entre et ce qui sort.

Le deuxième, ajouter de la capacité coûte cher et soulage peu.

Près de la saturation, ajouter dix pour cent de capacité réduit l’attente de bien plus de dix pour cent, parce qu’on sort de la zone asymptotique. C’est le meilleur rendement que connaisse la théorie des files. Un flux entrant multiplié par douze ne se rattrape pas ainsi. Il faudrait multiplier la capacité expérimentale par douze, ce qui n’est ni finançable ni physiquement possible dans la plupart des domaines.

Il faut alors dire précisément ce que la capacité achète et ce qu’elle n’achète pas. Une place expérimentale de plus ne raccourcit aucun délai. Les dix-huit programmes engagés avancent au même rythme, qu’ils aient deux cents hypothèses derrière eux ou vingt. Ce qu’elle achète est une hypothèse testée de plus, la dix-neuvième par ordre de mérite, et son rendement croît avec la longueur de la file, puisque le vivier dans lequel on puise s’est enrichi. Ce rendement est réel et il se calcule. Là où la capacité se loue, à la parcelle ou au créneau de séquençage, l’arbitrage se pose place par place, coût du créneau contre valeur de l’hypothèse à laquelle on renonce.

Ce que la capacité n’achètera jamais, c’est l’ordre. Un créneau de plus fait passer dix-huit à dix-neuf. Un meilleur tri agit sur les dix-huit à la fois. C’est une différence de portée, et c’est elle, plutôt qu’un argument de saturation, qui met le tri devant la capacité quand les deux coûtent le même prix.

Le troisième, quand on ne peut pas augmenter la capacité, la seule variable qui reste est la qualité de l’entrée.

Un système saturé se traite par trois voies. On réduit le flux entrant. On améliore la sélection de ce qui entre. La troisième réduit la variabilité, celle des arrivées comme celle des durées d’essai, par des campagnes groupées et des tailles de lot fixes. C’est la moins chère des trois et elle est trop souvent oubliée. Elle a une limite. À un rapport de treize entre ce qui entre et ce qui sort, lisser les arrivées ne change rien. Elle rend service à qui vit près de la saturation, pas à qui l’a franchie.

Dans une organisation saturée en aval, la valeur ne se crée plus dans la production. Elle se crée dans le tri.

Le tri devient la seule chose qui détermine la performance. Deux organisations qui produisent le même nombre d’hypothèses, qui disposent de la même capacité expérimentale, et qui ne diffèrent que par la qualité de leur sélection, obtiendront des résultats sans commune mesure, parce que l’une aura testé ses dix-huit meilleures hypothèses et l’autre dix-huit hypothèses quelconques parmi deux cent quarante.

Cet écart a une limite haute, bien sûr. Le gain d’un tri est la différence entre l’espérance des dix-huit meilleures sous le critère dont on dispose et l’espérance de dix-huit prises au hasard. Cette différence vaut zéro si le critère ne dit rien de la qualité, et elle atteint son maximum s’il la prédit parfaitement. Elle dépend donc d’une grandeur que personne ne mesure, la part, visible avant le test, de ce qui décidera du succès d’une hypothèse. Si c’est la moitié, le tri est le seul sujet qui vaille. Si c’est cinq pour cent, il vaut la peine d’être construit et il ne renversera rien.

C’est un argument économique fort en faveur de tout ce qui touche à l’évaluation et au jugement. La théorie des files n’y fournit qu’une prémisse, et elle est arithmétique. Deux cent quarante entrent, dix-huit sortent. Tout le reste est de la statistique d’ordre. Quand on ne peut servir qu’une fraction d’un vivier, ce qui détermine le résultat est la règle qui décide du rang.

V. Le mauvais indicateur

Presque toutes les organisations de recherche suivent un même chiffre, le nombre d’expériences menées. On l’appelle diversement, débit expérimental, nombre d’essais, volume de campagnes, taux d’occupation des plateformes. Il a longtemps été un bon indicateur. Quand la capacité expérimentale est le facteur limitant et que les idées sont rares, faire tourner les machines à plein est ce qu’il faut faire.

Ce chiffre mesure aujourd’hui la mauvaise chose, et il la mesure d’autant plus mal qu’il est bon.

Considérez deux équipes. La première mène cent quatre-vingts expériences dans l’année, dont vingt confirment l’hypothèse testée. La seconde en mène cent vingt, dont quarante confirment.

Sur l’indicateur de débit, la première est nettement meilleure, avec cinquante pour cent d’activité en plus. Sur le taux de confirmation, la proportion d’expériences dont le résultat valide l’hypothèse de départ, elle est trois fois moins bonne. Ce que cet écart signifie dépend d’une information que l’indicateur ne donne pas. Les cent soixante expériences non confirmées de la première ont-elles produit des limites d’exclusion écrites et réutilisables, ou se sont-elles refermées sur un constat que personne ne relira ? Dans le premier cas, elle a fabriqué beaucoup de connaissance. Dans le second, elle a dépensé davantage pour laisser moins derrière elle. Un indicateur qui compte l’échec proprement instrumenté pour zéro mesure la conformité et rien d’autre. Celui que je propose doit compter les deux.

Longtemps, on n’en a pas eu besoin. Quand les hypothèses étaient rares et chèrement acquises, elles étaient toutes soigneusement construites, et le taux de confirmation variait peu d’une équipe à l’autre. Un indicateur qui ne varie pas n’apporte pas d’information, on ne le collecte pas.

Il est aussi ambigu. Un taux de confirmation très élevé est un mauvais signe, il indique qu’on ne teste que ce dont on est déjà sûr, c’est-à-dire qu’on n’explore pas. Un taux très bas indique qu’on tire dans le noir. Il existe une zone optimale, elle dépend du domaine, et déterminer où elle se situe demande un travail que personne n’a fait.

Mais la vraie raison est politique. Le taux de confirmation évalue la qualité du jugement de celui qui a proposé l’hypothèse. Il est donc opposable à ceux qui le rendent. C’est le type de mesure qu’une organisation savante refuse de se donner, on l’a vu ailleurs, parce qu’elle rend explicite une hiérarchie de discernement qu’on préfère laisser implicite.

Je crois que c’est cet indicateur, ou un proche parent, qui décidera de la performance des organisations de recherche dans les dix ans qui viennent. Il est imparfait. Il est aussi le seul qui mesure le facteur devenu limitant.

Il y a un test simple pour savoir si votre organisation regarde au bon endroit. Prenez votre tableau de bord R&D. Comptez les indicateurs qui mesurent du volume, nombre de projets, d’essais, de publications, de dépôts, de cas d’usage, d’utilisateurs. Comptez ceux qui mesurent de la justesse, taux de confirmation, taux de décisions non révisées, proportion de programmes arrêtés qui auraient dû l’être plus tôt.

Le rapport est presque toujours d’au moins dix contre un en faveur du volume. Souvent, la seconde colonne est vide.

C’est le reflet exact de ce que ces organisations savaient mesurer à l’époque où leurs tableaux de bord ont été conçus.

VI. L’horloge matérielle accélère aussi

L’objection la plus forte contre ce qui précède repose sur des faits en cours.

L’horloge de la matière accélère, elle aussi.

Les laboratoires automatisés permettent aujourd’hui de mener des séries d’expériences avec une intervention humaine minimale et un débit qui n’a rien à voir avec le travail manuel. Le criblage à haut débit teste des dizaines de milliers de conditions là où l’on en testait quelques dizaines. La simulation numérique remplace une part croissante de l’expérimentation physique, dans la chimie computationnelle, la mécanique des structures, la modélisation des matériaux, la prédiction de repliement des protéines. Les capteurs miniaturisés et l’imagerie automatisée ont fait s’effondrer le coût du phénotypage dans plusieurs domaines biologiques.

Dans certains secteurs, la compression du temps expérimental sur la dernière décennie est d’un ordre de grandeur.

L’objection établit que des parties de l’horloge matérielle accélèrent, pas toutes, et pas les mêmes selon les domaines.

Ce qui accélère est ce qui peut être parallélisé ou simulé. Si l’expérience est courte et qu’on peut en mener mille à la fois, l’automatisation change tout. Si le phénomène est suffisamment bien décrit par un modèle, la simulation le remplace.

Il existe une troisième voie, plus forte que les deux autres et rarement nommée avec elles. On cesse d’avoir à faire l’essai. Un critère précoce corrélé au critère final remplace celui-ci pour l’immense majorité des candidats, et seul le petit lot survivant est conduit jusqu’au bout. La sélection génomique en est le cas le plus documenté. Elle réduit le nombre d’essais au champ en substituant une prédiction sur marqueurs à des générations entières de phénotypage, et sur plusieurs grandes espèces la durée du cycle de sélection a été divisée par deux ou trois en vingt ans. La clinique fait la même chose avec ses critères de substitution et ses analyses intermédiaires. Le choix du critère est un acte de conception expérimentale, et c’est de loin le plus rentable.

Ce qui n’accélère pas est ce qui repose sur un temps de développement irréductible ou sur une validation externe. Une cohorte clinique doit être suivie pendant la durée prévue par son protocole. Un matériau soumis à un vieillissement accéléré donne une indication, et l’homologation exigera le vieillissement réel. Un dossier réglementaire attend derrière les autres devant une autorité dont la capacité ne dépend pas de vous. J’ai longtemps rangé le cycle de reproduction biologique dans cette catégorie, et c’est le plus mauvais exemple que je pouvais choisir. Une génération n’a jamais été raccourcie d’un seul jour, et le cycle de sélection a été divisé par deux ou trois, parce qu’on a cessé d’attendre chaque génération.

On peut multiplier les essais en parallèle. On ne peut pas raccourcir le temps d’un essai dont la durée est le phénomène lui-même.

Voilà pourquoi je crois que l’objection déplace le problème sans le supprimer. Là où la matière accélère, le goulot se déplace vers la validation finale, celle qui reste lente, et qui devient d’autant plus critique qu’elle est le seul point où la réalité a encore droit de parole. Une organisation qui teste dix mille hypothèses en simulation devra toujours en valider quelques dizaines dans le monde réel, et le tri qui décide lesquelles est exactement le même problème que celui décrit plus haut, avec un facteur d’échelle pire.

Ces domaines-là courent un risque particulier. Quand l’amont et une partie de l’aval accélèrent ensemble, on peut faire tourner très longtemps un système entièrement autoréférentiel, des hypothèses générées par modèle, validées par simulation, qui alimentent d’autres hypothèses, sans jamais toucher le réel. Le système produit une quantité impressionnante de connaissance apparente, et il peut dériver pendant des mois avant que quiconque s’en aperçoive, parce que le point de contact avec la matière est devenu si rare qu’il ne corrige plus rien.

Une seconde objection, plus terre à terre. Si le problème est la file, réduisons le flux entrant.

Deux choses se confondent toujours ici. Brider la production d’idées suppose de décider en amont ce qui mérite d’être formulé, c’est-à-dire d’exercer exactement le jugement qu’on n’a pas. Et cela sacrifie ce que l’abondance a de réellement précieux, la possibilité d’explorer des directions qu’on n’aurait jamais explorées, parce qu’elles ne valaient pas trois semaines de travail mais qu’elles valent bien une journée.

Plafonner l’admission est autre chose. Rien n’entre dans la file expérimentale tant que rien n’en sort. C’est le kanban de l’usine, dont il sera question plus loin. Il compte, sans rien juger. On peut explorer deux cent quarante directions dans l’année et n’en admettre que vingt à la frontière des deux horloges. Le bénéfice de l’abondance reste entier. Le plafond coûte une décision de gouvernance et rien d’autre.

Un compteur fixe combien entrent. Il ne dit jamais lesquelles. Quand une place se libère et que deux cents candidates attendent, il faut encore choisir, et un plafond sans critère choisit dans l’ordre d’arrivée, c’est-à-dire par l’un des mécanismes rangés plus haut parmi les défaillants. Le plafond déplace la file d’un cran en amont et rend son coût visible. Il rend le tri obligatoire et datable.

VII. La fracture interne

Une organisation à deux vitesses devient très vite un problème de gens. C’est la dimension qui remonte le plus tard aux dirigeants.

Prenez la configuration décrite au début de ce texte. D’un côté, une équipe qui produit des hypothèses à un rythme qu’elle n’avait jamais connu, qui se sent efficace, qui voit son travail se transformer. De l’autre, une équipe qui exécute, dont le rythme n’a pas changé, et qui reçoit une pression croissante venue de l’amont.

Ce que l’amont ressent, de l’enthousiasme, puis de la frustration. On produit du bon travail qui ne se concrétise pas. On finit par attribuer le blocage à ceux qui exécutent. Trop lents, trop attachés à leurs procédures.

Ce que l’aval ressent, une pression illégitime. On vous demande d’absorber un flux multiplié sans moyens supplémentaires, avec des sollicitations plus nombreuses, plus insistantes, souvent moins bien préparées qu’avant, parce que produire une demande coûte désormais dix minutes. Et l’on vous reproche votre lenteur alors que rien dans votre travail n’a changé sinon la quantité de gens qui attendent après vous.

Les deux ont raison, ce qui rend le conflit insoluble à leur niveau.

Ce conflit est structurel, et c’est presque toujours mal compris. On l’interprète en général comme une opposition entre des profils, les modernes et les conservateurs, ceux qui ont pris le tournant et ceux qui résistent. Cette interprétation est confortable parce qu’elle désigne des coupables et suggère une solution simple, accompagner le changement et convaincre.

Elle est fausse. Vous pouvez remplacer intégralement l’équipe aval par des gens enthousiastes et parfaitement formés, le débit ne bougera pas, parce qu’il est déterminé par le temps physique et non par l’état d’esprit. Le conflit réapparaîtra à l’identique en six mois avec de nouvelles personnes.

Un effet secondaire aggrave tout, la valeur relative perçue des deux moitiés.

Le côté amont est celui qui se montre. Il produit des documents et alimente les comités. Son activité est visible et elle a doublé. Le côté aval est celui qui exécute, dont le travail est peu narratif, et dont l’activité n’a pas bougé.

Devant un comité de direction, ces deux réalités ne pèsent pas le même poids. L’amont paraît dynamique, l’aval paraît statique. Les arbitrages budgétaires suivent. Davantage pour ceux qui bougent, davantage pour les outils qui produisent des résultats visibles, moins pour la capacité expérimentale dont on ne comprend pas pourquoi elle ne suit pas.

On finance donc le côté qui n’est pas le goulot en prélevant sur le côté qui l’est. C’est le pire arbitrage possible, et il est produit par la structure même de ce que les dirigeants observent. Une conséquence plus lente et plus grave en découle, sur les gens eux-mêmes.

Les meilleurs profils du côté aval sont exactement ceux dont la valeur augmente dans le nouveau régime, puisqu’ils portent une compétence qui ne se réplique pas. Ceux qui savent monter une expérience propre, et qui savent avant de l’avoir lancé que tel protocole donnera un résultat ininterprétable. Ils sont aussi ceux qui reçoivent le signal le plus clair que leur métier est considéré comme la partie lente et peu intéressante de la chaîne.

Ils partent. Pas tous, pas tout de suite, mais la corrélation entre qualité et départ est forte dans ces situations parce que les meilleurs ont des options. Et l’organisation constate deux ans plus tard que sa capacité d’exécution s’est dégradée, sans faire le lien avec la manière dont elle a réparti ses investissements et son attention.

La seule chose qui fonctionne, à ma connaissance, est de rendre la contrainte visible et partagée. Afficher le même chiffre devant les deux moitiés, plutôt que d’expliquer aux gens qu’ils doivent mieux se comprendre. Voici le nombre d’hypothèses produites ce trimestre, voici le nombre testées, voici le rapport. Quand ce rapport est sous les yeux de tout le monde, la conversation change de nature. L’amont cesse d’être contre l’aval, et une organisation regarde ensemble un déséquilibre.

C’est aussi la seule manière de faire comprendre à l’amont que produire davantage n’aide pas. Aucun discours n’y parvient, et un chiffre l’établit en une réunion.

Cela suppose de mesurer le rapport. Presque personne ne le mesure. C’est un indicateur qui coûte quelques heures à construire et qui vaut, là où il est adopté, tous les séminaires d’alignement.

VIII. L’industrie a déjà résolu ce problème

Le problème décrit ici a été identifié et résolu il y a quarante ans, dans les usines. C’est un peu frustrant.

L’histoire contient à la fois la solution et la raison pour laquelle la recherche ne se l’est jamais appliquée.

Dans les années soixante-dix et quatre-vingt, l’industrie occidentale fonctionnait sur un principe qui paraissait évident, maximiser l’utilisation de chaque machine. Un équipement à l’arrêt était un capital qui dormait, et la performance d’un atelier se mesurait à son taux d’occupation. Chaque poste produisait autant qu’il pouvait, et ce qu’il produisait s’accumulait devant le poste suivant.

Le résultat était des usines pleines d’en-cours, avec des délais interminables et imprévisibles, une qualité qui se dégradait parce que les défauts n’étaient détectés que très tard, et une trésorerie immobilisée dans des stocks intermédiaires que personne ne comptait comme un coût.

Deux courants ont démonté ce raisonnement, à peu près en même temps et par des chemins différents.

Le premier, japonais, est le système de production Toyota formalisé par Taiichi Ohno. Il a établi qu’un stock intermédiaire est un symptôme plutôt qu’un actif, et qu’il masque tous les problèmes du système. La réponse a consisté à réduire délibérément les stocks pour faire apparaître les dysfonctionnements, puis à ne produire qu’à la demande du poste aval, inversant complètement le sens du flux.

Le second est la théorie des contraintes, qui énonce une règle plus drastique encore. Dans tout système, il existe un goulot, et toute amélioration qui ne porte pas sur ce goulot est sans effet sur la performance globale. Améliorer un poste non contraint ne fait qu’accumuler davantage d’en-cours devant le goulot. C’est du travail perdu, voire nuisible.

La conclusion pratique était contre-intuitive et elle a mis vingt ans à s’imposer. Il faut délibérément sous-utiliser tout ce qui n’est pas le goulot. Un poste amont qui tourne à soixante pour cent est à son réglage correct.

Regardez maintenant ce que fait une organisation de recherche qui déploie massivement l’IA sur son amont.

Elle augmente le débit d’un poste non contraint. Elle accumule des en-cours devant le goulot. Elle mesure sa performance au taux d’occupation de ses ressources plutôt qu’au flux de sortie. Et elle interprète l’accumulation comme un signe de vitalité.

C’est exactement l’usine de 1975.

Ces principes, appliqués depuis longtemps dans la production, la logistique, les services et même le développement logiciel, n’ont jamais franchi la porte des laboratoires.

Trois explications.

La recherche s’est toujours pensée comme un métier de création plutôt que de flux. Parler de goulot, d’en-cours et de débit à propos d’une activité de découverte paraît réducteur, et cette résistance sémantique a suffi à écarter tout un corpus de connaissance opérationnelle. On a préféré considérer que ces catégories ne s’appliquaient pas plutôt que d’examiner si elles s’appliquaient.

Le goulot, ensuite, n’était pas visible. Dans un atelier, l’en-cours est un tas de pièces devant une machine. On le voit, il dérange physiquement. Dans une organisation savante, l’en-cours est un fichier. Il ne dérange personne et il peut croître indéfiniment sans jamais provoquer la gêne qui déclenche l’action.

Et la contrainte se déplaçait. Dans une usine, le goulot est stable et localisable. Dans la recherche, il change de position selon les projets et les phases. Cette variabilité a servi d’argument pour ne pas chercher à l’identifier, alors qu’elle rendait l’identification plus nécessaire encore.

Une partie du transfert ne fonctionne pas. Une usine sait ce qu’elle produit, la valeur d’une pièce conforme est connue à l’avance. Une organisation de recherche ne sait pas ce que vaut ce qu’elle produit avant de l’avoir produit, et souvent longtemps après. Toute la logique du flux tiré suppose une demande aval identifiable, et ici la demande est une hypothèse sur l’avenir.

Cette différence est réelle et elle n’invalide pas le principe central, qui ne dépend pas de la connaissance de la valeur. Améliorer ce qui n’est pas le goulot n’améliore rien. Cette proposition est vraie quoi que vous produisiez.

IX. Les autres files

Je me suis concentré sur la file expérimentale parce qu’elle est la plus visible. Elle n’est pas la seule, et les autres sont probablement pires, parce qu’elles ne sont même pas comptées.

La file des décisions. Une organisation ne peut arbitrer qu’un nombre limité de sujets par période, et ce nombre est déterminé par la disponibilité de ses instances, comités et conseils. Ces instances ont une capacité fixe, réglée par le calendrier et par le temps de gens qui sont eux-mêmes rares.

L’IA n’a pas augmenté cette capacité. Elle a en revanche considérablement augmenté le nombre de sujets qui remontent, et la taille des dossiers qui les accompagnent. Le même comité, avec la même durée, doit traiter davantage de sujets plus documentés. Il traite donc moins bien, ou il reporte, et la file des décisions s’allonge exactement comme l’autre, avec le même effet de péremption et la même dégradation du tri.

C’est une file dont personne ne mesure la longueur, parce qu’un sujet non inscrit à l’ordre du jour n’apparaît nulle part.

La file de la validation. Nous en avons parlé ailleurs, vérifier est devenu plus coûteux que produire. Toute organisation qui augmente sa production sans augmenter sa capacité de vérification construit une file de choses non vérifiées, et cette file a une particularité redoutable. Elle est invisible même à ceux qui la constituent, parce que rien ne distingue extérieurement un document vérifié d’un document qui ne l’a pas été.

La file réglementaire. Dans tous les secteurs soumis à autorisation, la capacité de traitement de l’autorité est une constante extérieure. Elle ne s’ajuste pas à votre productivité. Une industrie entière qui accélère son amont simultanément ne fait qu’allonger la file devant le même guichet, et le délai moyen s’allonge pour tout le monde. Le gain de chacun devient la perte de tous.

Et enfin la file de l’attention. C’est la plus générale, et c’est celle dont dépendent toutes les autres. Le nombre de sujets sur lesquels une organisation peut porter une attention réelle, comprendre une question et s’en former une conviction plutôt que cocher une case, est étroit.

Toutes ces files ont la même structure. Toutes reçoivent un flux qui a été multiplié. Aucune n’a vu sa capacité augmenter. Et aucune n’est mesurée.

On a présenté l’IA comme une technologie qui augmente la capacité des organisations. Je crois qu’elle peut aussi faire l’inverse, augmenter le flux et laisser la capacité inchangée. Elle multiplie ce qui entre dans le système. Elle ne touche pas à ce que le système peut absorber, parce que cette capacité-là est faite de temps physique, de disponibilité d’attention et de capacité de décision.

Une organisation qui ne comprend pas cela investira massivement pour augmenter un flux qu’elle ne peut déjà pas traiter, et appellera cela une transformation.

X. Où placer l’argent

Première conséquence, cessez d’investir dans la capacité de production d’idées. Elle est devenue abondante. Tout euro supplémentaire dépensé pour produire davantage d’hypothèses, de synthèses, de propositions et de dossiers allonge une file déjà ingérable.

C’est pourtant là que va aujourd’hui l’essentiel des budgets d’IA en R&D, parce que c’est là que les gains sont les plus faciles à démontrer.

Le stock, lui, n’est pas gratuit à porter. Il se périme, au taux vu plus haut. Chaque candidat supplémentaire consomme un peu de l’attention dont la section précédente fait la file la plus difficile à desserrer, et lire puis comparer avant d’écarter se paie en temps de gens rares. Sur deux cent quarante hypothèses, quelques-unes paraîtront prometteuses par pur hasard, ce qui fabrique des raisons apparentes de tester. Aucun de ces trois coûts n’est mesuré nulle part. Même s’ils étaient nuls, la recommandation tiendrait. On cesse de payer pour un bénéfice marginal qui ne l’est plus.

Deuxième conséquence, l’investissement en capacité expérimentale doit être arbitré différemment. La question qui compte est désormais celle du goulot irréductible. Dans les domaines où l’expérimentation est parallélisable, l’investissement en automatisation garde tout son sens et il est probablement sous-dimensionné. Dans les domaines où le temps physique est irréductible, augmenter la capacité ne fait qu’augmenter le nombre d’expériences simultanées sans réduire le délai, ce qui peut être utile mais ne résout pas le problème posé. Confondre les deux situations conduit à financer des équipements qui ne changeront rien.

Troisième conséquence, peut-être la principale. Le seul investissement à fort rendement aujourd’hui porte sur le tri. Sur les critères qui déterminent ce qui passe. Sur les gens qui les appliquent. Sur les dispositifs qui permettent de savoir, après coup, si les choix étaient bons. Sur la mémoire des décisions passées, qui est la seule matière première d’une amélioration du tri.

C’est un investissement modeste en euros et considérable en difficulté organisationnelle. Il ne s’achète pas et ne se sous-traite pas. Il ne produit aucun résultat visible avant plusieurs mois. Et il se heurte aux résistances déjà décrites, puisqu’il revient à rendre explicite la qualité du jugement de gens qui ont toujours eu le droit de ne pas la justifier. Voilà pourquoi il n’est presque jamais fait, alors que son rendement est de loin le plus élevé.

Quatrième conséquence, plus inconfortable. Une partie de la file doit être détruite. Une organisation qui produit deux cent quarante hypothèses par an et n’en teste que dix-huit accumule aussi une dette morale envers ceux qui les ont produites. Chacune représente le travail de quelqu’un, et la file fonctionne comme une promesse tacite qu’on y reviendra un jour.

On n’y reviendra pas. Il vaut mieux le dire et purger, plutôt que de laisser croire à une centaine de personnes que leur travail est en attente alors qu’il est mort. Le coût d’une purge annoncée est un moment désagréable. Le coût d’une file fantôme est la démotivation lente de tous ceux qui alimentent quelque chose dont ils finissent par comprendre qu’il ne sert à rien.

XI. La question à poser

Une opération que vous pouvez faire cette semaine suffit à trancher.

Prenez le nombre d’hypothèses, de propositions, de pistes formulées dans votre R&D l’an dernier. Prenez le nombre de celles qui ont été effectivement testées, développées ou instruites jusqu’à une décision.

Faites le rapport. Puis faites le même rapport pour l’année 2019.

Si ce rapport a été divisé par cinq ou par dix pendant que le nombre d’hypothèses formulées explosait, alors vous n’avez pas transformé votre R&D. Vous avez accéléré la moitié qui n’était pas le goulot, et vous avez transféré tout le problème sur la moitié qui l’était.

Une maison qui instruit trois cents pistes jusqu’à une décision et n’en finance que dix passe ce test sans difficulté. Le test compte ce qui est tranché, financé ou non, et conclure à l’absence d’intérêt est une décision comme une autre.

Rien là d’un échec, l’étape est même normale. Il est logique que l’accélération arrive d’abord là où elle est techniquement possible. Ce qui serait un échec, c’est de ne pas voir que le point d’application de l’effort doit maintenant changer complètement.

La question qui vaut, pour un dirigeant, est ce qui, chez lui, ne peut pas accélérer. C’est là que se trouve désormais la valeur, et personne n’y regarde.

Être prévenu de la parution de l’essai suivant.

Votre adresse sert à cet envoi et à rien d’autre. Elle n’est ni cédée ni louée à des tiers, et se retire en un clic. Politique de confidentialité.

Merci. Vous recevrez un message à la parution de l’essai suivant.