Le pilote commence par la décision qu'il doit éclairer
Ce guide revient sur les pilotes IA de 2024 depuis une perspective de 2026. Le scénario et les valeurs sont illustratifs et ne représentent pas un résultat client CYTIZEN. Un pilote n'est ni une démonstration commerciale ni une première phase de déploiement devenue irréversible. Il doit lever une incertitude précise : un usage améliore-t-il suffisamment un parcours pour justifier son coût et ses contrôles ? La possibilité de conclure non est une condition de qualité du pilote.
Le dossier de lancement tient en quelques décisions : tâche concernée, utilisateurs, données autorisées, comparaison, critères de réussite, plafond de dépenses et responsable d'arrêt. Une équipe qui ne peut pas expliquer comment elle évaluera le résultat n'est pas prête à tester, même si elle a déjà accès au modèle. La qualité d'une réponse impressionnante n'est pas la preuve d'un service utilisable.
Scénario illustratif : retrouver la bonne procédure qualité
Inès, responsable qualité, souhaite aider les équipes à retrouver des procédures approuvées. Hugo, chef de projet applications, propose un assistant qui répond aux questions à partir d'un corpus autorisé. La démonstration donne une réponse claire en quelques secondes. Inès pose une autre question : que se passe-t-il lorsque deux procédures se ressemblent, mais que l'une appartient à un autre site ?
L'équipe limite l'essai à la recherche documentaire. L'assistant ne crée pas d'instruction approuvée, ne modifie pas le corpus et n'autorise aucune opération. Pour chaque réponse, l'utilisateur doit pouvoir ouvrir le document, vérifier la version et identifier le site. L'issue du parcours n'est pas « une réponse générée », mais « une source pertinente retrouvée et vérifiée ».
Le pilote comprend douze utilisateurs et deux cents questions préparées. Les nombres sont pédagogiques. Quatre-vingts questions couvrent les demandes fréquentes, soixante les ambiguïtés, quarante les documents absents ou périmés et vingt des tentatives contrôlées d'utiliser une source non autorisée. Une réponse assurée sur une question sans source devient un échec ; une abstention explicite peut être le bon résultat.
Le mandat rempli avant le premier test
| Décision | Exemple de mandat |
|---|---|
| Périmètre | Recherche de procédures approuvées pour le site A, langue française |
| Exclusions | Conseil réglementaire, instruction nouvelle, décision qualité et document non approuvé |
| Données | Corpus identifié et versions gelées pour l'évaluation ; pas de dossier individuel sensible |
| Comparaison | Recherche actuelle et moteur documentaire existant sur les mêmes catégories |
| Critères | Source correcte, version correcte, abstention appropriée, temps jusqu'à vérification |
| Décision | Inès accepte le résultat métier ; Hugo confirme la supportabilité ; sponsor décide l'extension |
| Limite | Enveloppe illustrative de 15 000 euros ; aucun accès ou site supplémentaire sans revue |
Le mandat doit être connu des testeurs. Ils ne doivent pas élargir discrètement le corpus pour améliorer une réponse ni utiliser des données réelles exclues sous prétexte que l'essai est interne. Toute modification est enregistrée ; elle peut nécessiter une nouvelle comparaison. Sans cette discipline, le pilote mélange l'évaluation du produit et l'ajustement continu de son périmètre.
Le responsable métier décrit les réponses acceptables, mais l'équipe technique doit expliquer les limites du système. Un engagement sur l'absence d'erreur n'est pas réaliste. Des contrôles et restrictions peuvent, en revanche, rendre certaines actions impossibles et certains résultats vérifiables.
Préparer le lot de recette et une vérité de référence
Les experts documentaires établissent pour chaque question la source attendue, les variantes admises et les cas sans réponse. Un second relecteur examine les cas ambigus. Le lot doit représenter les difficultés du parcours, pas seulement les questions que le sponsor pose en démonstration. Conserver un sous-ensemble qui ne sert pas aux réglages afin de limiter l'optimisme lié à la répétition des mêmes exemples.
Une ligne remplie peut être : « Q-084 : conditions de révision d'une procédure du site A ; sources admises P-17 version 4 et annexe A ; source interdite P-17 site B ; résultat acceptable cite la version 4 et ouvre le document ; résultat refusé fusionne les deux sites. » Cette ligne permet au testeur de juger sans décider à l'avance que tout texte convaincant est correct.
La vérité de référence peut être discutée. Si deux experts ne s'accordent pas, le problème documentaire doit être traité avant de compter la réponse de l'outil comme juste ou fausse. Le pilote révèle parfois un corpus contradictoire ; ce résultat est utile, mais différent d'une amélioration de performance de l'IA.
Mesurer le parcours entier
Le taux de source correcte divise les réponses ayant identifié une source pertinente et approuvée par les questions pour lesquelles une telle source existe. Le taux d'abstention correcte concerne les questions sans source autorisée. Les mélanger dans un taux global peut masquer une tendance à répondre à tout prix. Mesurer aussi les versions incorrectes et les franchissements de droits, qui ont une conséquence différente d'une formulation maladroite.
Le temps commence à la lecture de la question et se termine lorsque l'utilisateur a vérifié la source. Le test compare des tâches de complexité comparable entre recherche actuelle et assistant. Le temps de génération n'est qu'un composant. Si l'assistant répond en cinq secondes mais demande cinq minutes de vérification, il peut perdre face à un moteur documentaire moins spectaculaire.
Dans un résultat illustratif, 133 réponses sur 140 questions disposant d'une source sont correctes, soit 95 %. Sur quarante cas de document absent ou périmé, trente-six abstentions sont appropriées. Les vingt cas de droits ne produisent aucun accès interdit. Ces chiffres décrivent un échantillon ; ils ne prouvent ni une précision universelle ni une sécurité absolue.
Décider avec les erreurs, pas seulement avec la moyenne
Le comité examine les erreurs selon leur conséquence. Une réponse trop longue se corrige différemment d'une procédure d'un autre site présentée comme applicable. Un franchissement de droits bloque l'extension, même si le gain de temps moyen est élevé. Le propriétaire documentaire décide quelles erreurs exigent modification du corpus, de la recherche ou de l'interface.
Le mandat peut prévoir un gain net médian d'au moins une minute, une source correcte sur au moins 95 % du lot avec source, une abstention appropriée sur au moins 90 % du lot sans source et aucune divulgation interdite observée. Ces seuils illustratifs sont choisis pour expliquer une décision ; ils doivent être adaptés au risque et à la taille de l'échantillon. L'absence d'événement interdit observé reste accompagnée de permissions techniques et de surveillance.
Si la qualité est acceptable mais le temps net ne s'améliore pas, l'équipe peut garder l'outil pour un besoin spécifique ou arrêter. Si le temps est bon mais la version documentaire incertaine, elle corrige ce point avant extension. Une moyenne unique ne dit pas laquelle de ces situations existe.
Une séquence courte sans engagement caché
La première semaine formalise la tâche, les données et les réponses de référence. La suivante prépare l'environnement et vérifie les accès. Les deux semaines d'essai observent les utilisateurs et collectent les résultats. Une dernière revue décide arrêt, correction limitée ou extension. Cette séquence de cinq semaines est un exemple cohérent avec ce pilote documentaire, pas une durée obligatoire pour toute IA.
Le registre de changements indique ce qui a été modifié entre essais. Si un ajustement intervient au milieu du lot, ne pas fusionner les résultats comme si une seule version avait été évaluée. Retester un sous-ensemble stable et identifier la nouvelle version dans le relevé de décision.
Un budget maximal ne suffit pas si personne n'a compté les heures métier. Inès réserve le temps d'experts pour préparer et relire les cas. Hugo prévoit la configuration, les incidents et les opérations de fin d'essai. Le fournisseur précise les limites de consommation et l'export des résultats. Le coût inclut la fermeture du pilote si aucune suite n'est décidée.
Ce qu'il faut transférer si l'essai devient un service
Un service nécessite un propriétaire du corpus, un responsable des droits, une surveillance, un support et une procédure de retrait. Chaque nouvelle version de procédure doit remplacer l'ancienne dans les sources utilisées. Une réponse fiable sur un corpus gelé ne démontre pas que cette maintenance existe.
Le support doit savoir identifier la question, la version du système et les sources récupérées sans copier excessivement des informations sensibles. Le métier doit pouvoir signaler une réponse incorrecte et retrouver son traitement. Une mise à jour du modèle ou de la recherche déclenche une recette proportionnée, avec les cas de référence pertinents.
Le relevé de sortie du scénario peut autoriser une extension limitée au site A, en conservant la vérification de source obligatoire et en excluant les instructions générées. Les écarts ouverts restent nommés et datés. Une démonstration réussie ne devient pas une autorisation tacite d'étendre à tous les sites et toutes les langues.
Adapter le pilote au type de décision
Dans le juridique, un résumé contractuel se juge sur les omissions matérielles, les sources et le coût de relecture ; sa fluidité ne constitue pas la qualité principale. Dans les achats, une recherche de clause ne doit pas se transformer en engagement fournisseur automatique. Dans la qualité industrielle, l'identification de la version approuvée et du site est souvent plus importante qu'une réponse longue.
Un pilote traitant des données personnelles ajoute les analyses et informations pertinentes avec les responsables compétents. Un essai interne n'est pas une exemption générale. Les recommandations publiées depuis 2024 doivent être distinguées des informations disponibles à l'époque étudiée.
Sources, méthode et limites
Sources primaires consultées le 4 octobre 2026 : NIST AI RMF Playbook, mesure ; CNIL, protection des données dans la conception ; CNIL, sécurité du développement des systèmes IA. Elles éclairent l'évaluation et la conception ; leur consultation en 2026 ne signifie pas que chaque recommandation était disponible en 2024.
La méthode part d'une tâche vérifiable, compare une alternative et conserve les erreurs et limites. Les cas, seuils et montants sont pédagogiques. La taille du lot, les conditions de données et les exigences de validation doivent être adaptées à l'usage réel. Le guide fournit un mandat et des exemples de recette, sans certifier un système ni garantir l'absence future d'erreur.