Trois idées séduisantes, une seule hypothèse testable

Dans cette scène fictive située en 2024, un comité reçoit trois propositions d’IA générative : rédiger des réponses au support, rechercher dans des procédures internes et préparer une synthèse commerciale. Les démonstrations produisent des textes convaincants. Le comité doit pourtant choisir où engager un pilote limité. Tous les personnages, volumes, coûts, temps et résultats de cet article sont inventés à des fins pédagogiques. Aucun exemple ne décrit une mission client de CYTIZEN. La question n’est pas de déterminer quelle démonstration impressionne le plus, mais quel usage offre une valeur vérifiable avec des contrôles et un coût acceptables.

Un cas d’usage est une tâche définie dans un flux, avec un utilisateur, une entrée, une sortie et une décision sur cette sortie. « Un assistant pour tous » ne permet ni d’évaluer la valeur ni de borner les risques. Cette analyse revient sur le choix des usages en 2024 avec des sources primaires consultées en octobre 2026. Le NIST AI RMF publié en 2023 et son profil consacré à l’IA générative publié le 26 juillet 2024 constituent des repères datés. Les informations actuelles des pages ne sont pas projetées rétroactivement sur toutes les décisions de 2024.

Écrire la tâche avant de choisir le modèle

Le sponsor demande une fiche par proposition. Pour la recherche documentaire fictive, l’utilisateur est un agent de support ; l’entrée est une question sur une procédure approuvée ; la sortie est une piste de réponse accompagnée de passages vérifiables ; la décision reste humaine. Le pilote n’autorise ni modification de dossier ni réponse automatique à un client. Cette précision permet d’observer un bénéfice concret : trouver une information utilisable plus vite, sans augmenter les erreurs de réponse. Elle évite de confondre génération fluide et réalisation correcte du travail.

Pour chaque tâche, décrire la méthode actuelle et au moins une alternative simple. Une meilleure recherche classique, un formulaire ou une procédure mieux rédigée peuvent offrir une valeur supérieure. Le besoin d’IA ne se déduit pas de la présence de texte. Identifier l’ambiguïté à traiter, la diversité des entrées et la possibilité de vérifier la sortie. Un usage dont les réponses sont difficiles à contrôler coûte souvent davantage à exploiter que ne le suggère la démonstration. Ce coût doit être visible dès la sélection.

Construire une matrice coût, contrôle et valeur

La valeur brute comprend le temps économisé, la qualité améliorée ou la capacité supplémentaire. La valeur nette retire la préparation des données, l’intégration, les licences, les appels au modèle, la revue humaine, le support et la maintenance. Les minutes théoriques ne deviennent pas automatiquement une réduction de dépenses. Le propriétaire précise comment la capacité sera utilisée. La mesure examine les tâches terminées correctement, pas le nombre de réponses générées. Une réponse rapide qui exige ensuite une longue vérification peut réduire la valeur ou déplacer la charge vers des personnes plus coûteuses.

Le coût du contrôle dépend de la vérifiabilité. Une réponse liée à une procédure courte peut être confrontée à un passage approuvé. Une synthèse de sources contradictoires demande davantage de jugement. Une action irréversible exige une frontière de droits et une validation explicite. La présence d’un humain ne constitue pas à elle seule un contrôle efficace : il lui faut du temps, une preuve accessible et l’autorité de refuser. Une revue trop rapide ou routinière peut laisser passer une sortie erronée tout en donnant l’impression que la responsabilité est couverte.

La sélection combine donc trois axes : coût total plausible, contrôle réalisable et valeur opérationnelle. Un score agrégé peut aider à comparer, mais il ne doit pas compenser une condition éliminatoire. Un usage sans droit d’accès aux données, sans propriétaire ou sans moyen de vérifier une sortie importante ne devient pas acceptable parce qu’il promet beaucoup de minutes gagnées. Ces conditions se traitent avant le classement. Le comité peut retenir un usage moins spectaculaire dont la preuve de valeur et le dispositif de contrôle sont plus solides.

Une matrice remplie pour décider

Le tableau suivant est entièrement fictif. Les coûts sont des estimations de pilote pour le scénario, sans valeur de marché ni portée générale. Le statut ne représente pas une recommandation universelle pour le secteur. Chaque choix doit être réévalué selon les données, les conséquences d’erreur et les ressources de l’organisation.

Usage et valeur attendueCoût total fictifContrôle concretDécision et critère d’arrêt
Recherche de procédures ; réduire le temps jusqu’à une réponse vérifiée12 000 euros de préparation et test ; revue incluseCorpus approuvé, passages cités, validation par l’agentPilote limité ; arrêt si les preuves ne permettent pas de vérifier les réponses critiques
Réponse automatique au support ; réduire la charge de rédaction18 000 euros ; coût de revue encore inconnuRisque d’envoi externe et d’engagement non autoriséDifférer l’envoi automatique ; tester uniquement le brouillon humainement validé
Synthèse commerciale ; préparer les réunions8 000 euros ; rapprochement des sources nécessaireVérification des montants et dates dans les documents sourcesTester après clarification des accès ; arrêt si la revue absorbe le gain

Le registre associé nomme un propriétaire de valeur, un propriétaire de contrôle et un responsable technique. Il décrit le périmètre, la période d’observation, les exclusions et l’option de remplacement. Les hypothèses de coûts restent révisables. Un usage peut être attractif à petit volume puis devenir cher si les longues entrées multiplient les appels, si les sources changent ou si les exceptions exigent des experts. Le comité demande donc une sensibilité aux volumes et au temps de revue, plutôt qu’un unique montant présenté comme certain.

Définir le test et les critères d’arrêt avant le pilote

Le jeu d’essai représente les tâches réelles et inclut des cas difficiles : information absente, documents contradictoires, question hors périmètre et instruction malveillante contenue dans une source. Les réponses de référence sont validées par des personnes compétentes. L’évaluation distingue exactitude, qualité des preuves, utilité, refus approprié et temps total. Une moyenne peut cacher une erreur importante ; les catégories critiques sont donc examinées séparément. Le pilote ne doit pas améliorer artificiellement le résultat en retirant les dossiers où la recherche ou la vérification échoue.

Dans le scénario, la recherche de procédures est testée d’abord sur des copies contrôlées, sans action dans un système métier. Les utilisateurs comparent leur méthode actuelle et l’assistance proposée sur des catégories comparables. Ils enregistrent le temps jusqu’à une réponse vérifiée, y compris la lecture des sources et les corrections. Si l’assistant répond vite mais produit une preuve introuvable, le dossier est compté comme non résolu. Le test examine aussi les situations où l’utilisateur devrait s’abstenir et demander une expertise plutôt que retenir un texte plausible.

Les critères d’arrêt combinent des limites de sécurité et une limite de valeur. Une exposition de données hors du périmètre autorisé déclenche une suspension et une analyse. L’impossibilité de contrôler les réponses critiques empêche l’extension. Une charge de revue supérieure au gain attendu conduit à revoir le périmètre ou à arrêter. Ces règles sont choisies localement avant les résultats, puis documentées. Elles évitent de transformer le pilote en engagement permanent parce qu’une équipe s’est attachée à la démonstration ou a déjà investi dans l’intégration.

La décision de sortie comporte trois options : poursuivre sur le périmètre testé, modifier et retester, ou arrêter avec une alternative. Un pilote réussi ne démontre pas automatiquement que l’usage peut fonctionner sur tous les documents, langues, volumes et utilisateurs. Le comité note ce qui a été effectivement testé et ce qui reste inconnu. Une extension demande une nouvelle évaluation des données et des contrôles. Les améliorations du modèle ou du fournisseur ne dispensent pas de vérifier le comportement de l’usage dans son contexte opérationnel.

Préparer l’exploitation dès la sélection

Le service doit pouvoir savoir quelle version du modèle, du corpus et des règles a produit une sortie. Les journaux utiles sont choisis selon le besoin de preuve et les contraintes de données ; on ne conserve pas tout sans raison. Le propriétaire du corpus organise la mise à jour des procédures et le retrait des versions obsolètes. Le support connaît le traitement d’une réponse contestée. Sans ces responsabilités, un pilote qui fonctionne sur des documents stables peut se dégrader rapidement lorsque l’organisation change ses règles.

Le contrôle d’accès concerne les documents sources et les réponses. Un assistant ne doit pas donner à un utilisateur une information qu’il ne pourrait pas consulter directement. Le test vérifie les différences de droits et les changements d’accès. La sortie reste une proposition tant que le flux ne donne pas explicitement une autre autorité. Si l’usage doit un jour modifier un dossier ou envoyer un message, cette capacité est évaluée séparément avec des limites, une preuve de validation et un moyen de suspension. Le passage de conseil à action change matériellement le dispositif de contrôle.

Choisir selon les conséquences d’erreur

Dans l’industrie, une aide documentaire peut être utile, mais les consignes opérationnelles demandent des sources approuvées et un contrôle compétent. Dans les services financiers, une synthèse doit préserver la traçabilité des montants et éviter qu’un texte généré devienne une autorisation implicite. Dans le secteur public, les réponses doivent rester explicables et les usagers doivent pouvoir obtenir une correction ou une revue. Dans les services professionnels, les brouillons peuvent réduire une charge de préparation si la vérification ne consomme pas tout le gain et si les données sont utilisées dans un périmètre autorisé.

Ces exemples ne sont pas des résultats observés ni des règles universelles. La matrice sert à relier une valeur concrète aux moyens de contrôle et à leur coût. Le meilleur premier pilote est celui qui peut répondre à une question utile et permettre une décision d’arrêt crédible. Un usage mérite un essai lorsque l’organisation sait ce qu’elle veut apprendre, quelle preuve elle recueillera et ce qu’elle fera si la valeur attendue n’apparaît pas.

Sources primaires et chronologie

Références vérifiées en octobre 2026. Le NIST AI RMF 1.0 date du 26 janvier 2023 ; le profil IA générative date du 26 juillet 2024. Ils proposent un cadre volontaire de gestion des risques. Les matrices, coûts et règles d’arrêt présentés ici sont des exemples pédagogiques indépendants, sans valeur de seuil réglementaire.