Le service commence quand la démonstration s’arrête

Dans ce scénario illustratif, qui ne décrit ni une mission ni un résultat client de CYTIZEN, Claire dirige les opérations d’un groupe industriel. Une équipe lui montre un assistant capable de retrouver une procédure dans une documentation volumineuse. La réponse est convaincante, la citation semble précise, et l’enthousiasme gagne la salle. Marc, responsable du service informatique, pose une question moins spectaculaire : que se passe-t-il quand une procédure change, quand un collaborateur quitte le groupe, ou quand la réponse contredit le document approuvé ? Le prototype ne sait pas encore répondre à ces questions.

Le passage à l’échelle n’est donc pas une multiplication des utilisateurs du prototype. C’est la transformation d’un usage en service : une finalité délimitée, des données autorisées, un responsable identifiable, un niveau de qualité vérifiable et un dispositif de retrait. Une direction peut financer un apprentissage imparfait ; elle doit savoir ce qu’elle expose avant de financer une dépendance opérationnelle. Le critère de maturité devient la capacité à expliquer une mauvaise réponse et à empêcher sa répétition, pas la beauté d’une bonne démonstration.

Un inventaire qui sert vraiment à décider

Claire refuse le recensement limité au nom des outils. Son inventaire contient une ligne par usage métier : recherche de procédures, préparation de clauses contractuelles, extraction de données de factures. Pour chaque ligne, le propriétaire du processus décrit les utilisateurs, les décisions influencées, les données consommées, les interfaces, les personnes affectées et la solution de secours. Une même plateforme peut héberger des usages de criticités très différentes ; un classement unique de la plateforme masquerait cette différence.

La fiche de l’assistant documentaire est remplie ainsi : propriétaire, direction qualité ; consommateurs, personnel autorisé du site ; sortie, réponse accompagnée de passages sources ; décision autorisée, retrouver une information ; décision interdite, approuver une déviation qualité ; données, procédures approuvées dans le référentiel désigné ; secours, recherche documentaire existante. La fiche indique aussi qui peut changer le modèle, publier un nouveau corpus et suspendre le service. Un document dont toutes les responsabilités portent seulement le nom de l’équipe projet n’est pas prêt pour l’exploitation.

La qualification réglementaire suit cet inventaire au lieu de le remplacer. La Commission européenne indique un calendrier différencié pour l’AI Act, actualisé par l’AI Omnibus entré en vigueur en juillet 2026. Il faut qualifier le rôle de l’entreprise, l’usage et le régime applicable avec les fonctions compétentes. Le fait qu’un usage soit autorisé dans un pilote ne démontre ni sa conformité juridique ni son aptitude à prendre seul une décision. Cet article propose une organisation de travail, pas une qualification juridique individuelle.

Évaluer les erreurs qui ont une conséquence

Marc constitue un jeu d’évaluation à partir de questions réellement rencontrées, désidentifiées et autorisées. Les experts métier produisent les réponses attendues avant de regarder celles du système. L’échantillon comprend des documents obsolètes, des procédures contradictoires, des questions sans réponse, des changements de version et des requêtes portant sur un autre site. Il conserve les cas difficiles au lieu de les retirer pour améliorer la moyenne. Le jeu de développement sert à régler le service ; un lot séparé sert à décider de sa mise en service.

Trois mesures restent distinctes. Le taux de réponse étayée est le nombre de réponses dont chaque affirmation utile est soutenue par une source correcte, divisé par le nombre de réponses évaluées. Le taux d’abstention pertinente est le nombre de cas où le système refuse correctement de répondre faute de preuve, divisé par le nombre de cas évalués qui nécessitent cette abstention. Le taux d’erreur critique est le nombre de sorties évaluées susceptibles d’entraîner une action dangereuse ou interdite, divisé par le nombre total de sorties évaluées, selon une définition validée par le métier. Ces taux sont indéfinis si leur dénominateur est nul ; les volumes correspondants restent affichés. Un score global de satisfaction ne doit pas compenser une erreur critique par de nombreuses réponses faciles.

Pour l’exemple, la direction fixe avant le test une règle de décision : toute erreur permettant l’accès à un document non autorisé entraîne une suspension ; toute instruction opérationnelle non étayée bloque le déploiement ; les erreurs restantes font l’objet d’une analyse de fréquence et d’impact. Ces seuils sont des choix du scénario, pas des normes universelles. Le dossier précise le volume testé, les populations absentes de l’échantillon et l’incertitude. Zéro erreur dans un petit test n’équivaut pas à une garantie de sûreté.

Les droits d’accès ne se négocient pas avec le modèle

L’autorisation doit être appliquée aux documents avant leur transmission au modèle. Si l’assistant reçoit un document confidentiel puis reçoit la consigne de ne pas le révéler, le contrôle est situé au mauvais endroit. Marc vérifie la propagation des droits entre le référentiel, l’index, la recherche et la session utilisateur. Il teste une révocation de compte, un changement de groupe et une suppression de document. Les caches, index secondaires et journaux sont inclus dans la vérification.

Les agents capables d’agir ajoutent un autre niveau de risque. Un compte technique disposant des droits d’un administrateur n’est pas acceptable simplement parce que les tâches habituelles sont modestes. Chaque outil autorisé doit avoir un périmètre, une durée de droit, une journalisation et, pour les actions sensibles, une approbation humaine explicite. Dans l’exemple, l’assistant peut préparer une demande de modification, mais ne peut ni approuver une procédure ni changer un droit. Une instruction malveillante trouvée dans un document ne doit pas pouvoir élargir ce mandat.

Exploiter le service et compter son vrai coût

Le coût d’une réponse utile inclut davantage que l’appel au modèle. Claire additionne les dépenses d’inférence, d’indexation, de stockage, de supervision, d’évaluation, de support et de revue humaine. Elle divise ce total par les demandes achevées avec une qualité jugée acceptable. Les tentatives rejetées et les corrections restent dans le numérateur : les ignorer reviendrait à faire disparaître le coût des erreurs. Les charges fixes et variables sont distinguées pour simuler un volume faible comme un pic d’activité.

Le bénéfice n’est pas le temps théorique gagné à chaque question. Un agent peut répondre plus vite tout en imposant une vérification plus longue. La mesure retenue compare le temps complet d’un parcours, recherche et contrôle inclus, sur des tâches comparables. Le métier indique ensuite ce qu’il fera de la capacité récupérée : traiter une file d’attente, renforcer les contrôles ou réduire une prestation externe. Sans cette décision, des minutes économisées ne deviennent pas automatiquement une économie budgétaire.

Le support reçoit un arbre d’escalade simple : incident d’accès, réponse non étayée, indisponibilité, dérive de coût. Un opérateur peut désactiver une source ou revenir à la version précédente sans attendre le développeur du prototype. Les changements de modèle ou de corpus déclenchent une évaluation proportionnée, avec comparaison sur le lot de référence. L’historique doit permettre de retrouver la configuration associée à une réponse contestée, sans conserver inutilement les données sensibles de l’utilisateur.

Dans la vraie vie : le désaccord utile

Claire souhaite ouvrir le service à plusieurs pays. Marc présente deux options : étendre le pilote à tous les documents, ou ouvrir un seul parcours dont les droits et les versions sont maîtrisés. L’équipe qualité relève que les procédures locales portent parfois le même titre avec des consignes différentes. La direction choisit le second chemin, accepte une couverture plus faible et exige que le site et la version soient affichés avec chaque réponse. Ce choix réduit la promesse commerciale du pilote, mais augmente la compréhension de ce qui sera effectivement livré.

La décision est consignée avec quatre éléments : population autorisée, corpus retenu, tests restant à effectuer et personne habilitée à interrompre l’usage. La prochaine extension dépendra de la résolution des écarts de droits et de la disponibilité d’un propriétaire local. Le comité ne demande pas un statut vert ; il demande quelle dépendance l’empêche encore d’assumer le service. C’est cette question qui sépare une gouvernance de démonstration d’une gouvernance d’exploitation.

Ce qui change selon le secteur

En industrie réglementée, l’assistant doit distinguer document approuvé et document de travail, et laisser intacte l’autorité de la fonction qualité. Dans un service juridique, une clause proposée reste une proposition ; les droits sur les dossiers et la traçabilité de la validation priment sur la fluidité de rédaction. Dans une équipe de support IT, la priorité est le périmètre d’action : consulter une base de connaissances, ouvrir un ticket et redémarrer une application ne présentent pas le même risque. Chaque déclinaison change les tests et les responsabilités, pas seulement le vocabulaire du dossier.

Une entreprise trop petite pour financer une exploitation autonome peut choisir un service acheté avec des limites explicites. Une grande organisation peut disposer d’une plateforme commune tout en laissant aux métiers la responsabilité des usages. La décision centrale reste identique : qui assumera la qualité, les conséquences et le retrait du service lorsque l’équipe pilote aura quitté la scène ?

Sources, méthode et limites

Consultation des sources primaires le 4 octobre 2026. Le NIST fournit un cadre volontaire de gestion des risques ; il ne certifie pas le service décrit. Les propositions d’organisation, les seuils illustratifs et le scénario sont une analyse pédagogique. Ils doivent être adaptés au contexte, aux contrats et aux textes applicables.