L'IA avance bien sur chaque tâche, moins sur le processus complet, article de Henri Ducourtioux

L'IA avance bien sur chaque tâche, moins sur le processus complet

Par Henri Ducourtioux

Le 12 septembre, j’ai confié à mon assistant IA une opération simple : remplacer sept mots-clés sur la fiche d’un de mes guides, dans l’interface d’une plateforme de publication. Il a ouvert la page, saisi les sept nouveaux mots-clés dans les bons champs, et m’a laissé le clic d’enregistrement. La fenêtre a été fermée avant ce clic. Aucun message d’erreur, aucune alerte. Chaque étape avait été bien exécutée, et pourtant rien n’avait changé.

Je ne l’ai su qu’en rouvrant la fiche pour vérifier : les sept anciens mots-clés étaient toujours là. Sans ce contrôle, la journée se serait terminée sur une tâche cochée qui n’avait jamais été faite.

L’incident est minuscule, mais il illustre très bien ce que l’on commence à mesurer sur les outils d’IA les plus avancés.

Un écart qui se mesure

Au début de septembre, Artificial Analysis, un organisme indépendant qui évalue les modèles d’IA, a ajouté à son indice de référence un test de 657 processus métier : finance, ressources humaines, marketing, opérations, ventes et support client. Dans chacun, l’agent doit travailler dans des applications de gestion simulées et atteindre plusieurs objectifs en respectant des règles. Enfreindre une seule règle ramène la note de la tâche à zéro.

Le test publie deux chiffres. Le premier est un score moyen : le meilleur modèle atteint en moyenne 68,5 % des objectifs demandés. Le second compte les processus menés entièrement au bout, tous les objectifs atteints et aucune règle enfreinte : ce même modèle n’y parvient que dans 41,6 % des cas. Les évaluateurs le résument sobrement : atteindre tous les objectifs en respectant toutes les règles reste plus difficile que d’accomplir une partie du processus.

Autrement dit, l’IA avance bien sur chaque morceau du travail, mais moins d’une fois sur deux elle rend un dossier traité correctement de bout en bout. Deux précautions s’imposent : le test est récent, et un score obtenu sur des applications simulées ne dit pas exactement ce qui se passera dans une entreprise réelle. L’écart entre les deux chiffres, lui, ressemble à ce que j’observe tous les jours.

Les erreurs se logent dans l’enchaînement, et elles ne font pas de bruit

Ce qui frappe dans l’épisode des mots-clés, c’est son silence : l’erreur s’est glissée entre deux étapes, et rien dans le compte rendu du travail ne la laissait voir.

J’ai vécu une autre version du même problème en août, pendant une étude de marché. Un outil d’extraction de pages web devait relever les livres concurrents affichés sur une page de résultats. Il a rendu une liste propre, bien structurée, de titres et d’auteurs plausibles. Aucun n’existait. La page s’était mal chargée, et l’outil avait comblé les trous au lieu de signaler qu’il n’avait rien pu lire. La même page, récupérée en texte brut, contenait les vrais livres. Si je m’étais fié à la liste, j’aurais pris une décision sur un marché imaginaire.

Dans les deux cas, l’outil a produit quelque chose qui avait toutes les apparences d’un travail fini, et c’est ce qui rend ces erreurs coûteuses : un résultat faux qui ressemble à un résultat juste ne déclenche aucun réflexe de vérification.

Mon constat, après quelques mois d’usage quotidien, est à peu près celui-ci : mon assistant est parfois remarquablement pertinent et efficace, et il lui arrive aussi des dérives ou des oublis étranges. Je continue à m’en servir, et j’en tire une règle : son travail doit être contrôlé par un humain, en particulier là où une erreur coûterait cher.

Retourner la question

Ethan Mollick, professeur de management à la Wharton School de l’université de Pennsylvanie, qui écrit depuis plusieurs années sur l’usage de l’IA au travail, propose fin août de retourner la question habituelle. Nous avons passé quelques années à nous demander quand une personne doit solliciter l’IA. Il faut maintenant se demander quand l’IA doit solliciter une personne.

Il identifie au moins quatre situations :

  • l’approbation : un agent ne devrait pas décider seul de dépenser de l’argent, de contacter des personnes extérieures, d’accéder à des informations sensibles ou d’engager une action que personne n’a autorisée ;
  • l’expertise : les compétences de l’IA sont très inégales, et sur certaines parties d’un travail un spécialiste humain reste loin devant ;
  • la diversité des idées : les idées produites par l’IA se ressemblent beaucoup entre elles, et l’apport humain élargit l’éventail ;
  • l’intérêt de la décision : si l’agent prend toutes les décisions intéressantes et laisse aux humains les validations, les exceptions et les échecs, on aura automatisé la mauvaise moitié du travail, et les gens cesseront de développer le jugement dont ils auront besoin plus tard.

Le premier point me paraît le plus directement utilisable. Dans un processus confié à l’IA, les étapes qui engagent un tiers (un client, un fournisseur, un partenaire, une publication visible de tous) sont celles où l’agent doit s’arrêter et faire valider. Pas à toutes les étapes pour autant : un contrôle demandé à chaque clic finit validé sans être lu, comme ces bandeaux de cookies que personne ne lit avant de cliquer sur « Accepter », et il ne protège plus rien. Mieux vaut quelques points d’arrêt bien choisis.

Un collaborateur invisible qui doit rendre compte

Dans mon précédent article, je décrivais une façon de répartir les décisions dans une équipe, par niveaux d’autonomie sur une mission précise : recueillir les faits, les analyser, recommander une décision, décider puis informer, agir seul avec une revue espacée. Je crois que c’est la bonne grille pour penser l’IA au travail.

Un assistant IA est un collaborateur supplémentaire, un peu particulier puisqu’il est invisible, capable d’abattre énormément de travail et souvent assez autonome. Comme n’importe quel collaborateur autonome, il peut décider et agir sur son périmètre. Mais il doit rendre compte, systématiquement, à la personne qui en a la responsabilité : les décisions qu’il a prises, les actions qu’il a menées et les résultats qu’il a réellement obtenus, et non ceux qu’il suppose avoir obtenus.

Un collaborateur qui ne remonte jamais rien n’est pas forcément autonome, il est peut-être simplement devenu un électron libre. Avec une personne, on finit par s’en apercevoir : un dossier qui dort, un client qui rappelle, une réunion où la question est posée. Quand j’animais un point hebdomadaire sur les logements vacants, c’est ce rendez-vous qui avait fait apparaître un logement resté plusieurs mois sans action. Avec un outil qui travaille vite et sans bruit, ce moment ne vient pas de lui-même. L’électron libre peut valider des choses qui ne sont pas avérées, qui ne sont pas pertinentes, ou que personne n’a souhaitées, et enchaîner des étapes justes vers un résultat faux sans que personne le voie.

Le rôle de celui qui confie le travail n’a donc pas changé : définir le périmètre, dire ce qui doit être validé avant d’agir, exiger un compte rendu, et vérifier que ce compte rendu correspond à la réalité.

Ce que je garde

De ces premiers mois, je garde une habitude simple : vérifier le résultat là où il est réellement enregistré, plutôt que dans le compte rendu de l’outil : je rouvre la fiche, je relis le mail envoyé, je recoupe une donnée avec sa source.

L’IA fait déjà très bien une grande partie du travail. Mener un processus jusqu’au bout est une responsabilité et, pour l’instant, elle reste la nôtre.


Sources

Henri Ducourtioux a dirigé pendant douze ans une agence de logement social. Il écrit sur le management de proximité, l’organisation du travail et l’usage raisonné de l’intelligence artificielle au quotidien professionnel.

Retour au blog

Laisser un commentaire

Veuillez noter que les commentaires doivent être approuvés avant d'être publiés.