Évaluer les acquis d’une formation ChatGPT au travail

Un protocole de mise en situation pour mesurer ce qu'une équipe sait vraiment faire avec ChatGPT après une formation, sans confondre satisfaction et compétence.

Un cas pratique passe par trois étapes : expliquer le contexte, essayer puis vérifier le résultat avec un retour pédagogique.

Une formation ChatGPT peut être appréciée par les participants sans changer leur façon de travailler. À l’inverse, une personne peut sortir d’une séance moins enthousiaste parce qu’elle a découvert ses limites, tout en étant devenue plus prudente et plus compétente. Pour juger l’apprentissage, il faut regarder une tâche réalisée, la décision prise devant une réponse incertaine et la capacité à refaire le travail plus tard.

Ce guide s’adresse à un responsable formation, un manager ou un formateur qui doit décider si une session a produit des gestes utiles. Il propose une évaluation courte sur deux tâches proches du travail, menée avant la formation, à la fin, puis après quelques semaines. Aucun score universel n’est promis : la grille et les seuils sont à adapter au poste, au niveau initial et aux risques. Le guide sur la conception d’une formation ChatGPT en entreprise traite le programme ; ici, la question est ce qu’une personne peut démontrer après l’avoir suivi.

Réponse en bref

Choisissez une tâche autorisée et observable, par exemple préparer une synthèse de trois notes fictives pour une réunion. Faites produire un livrable avant la formation, puis un autre de difficulté comparable après la séance. Évaluez séparément la formulation de la demande, le choix des données, le contrôle des faits, la correction d’une erreur, la décision de publication et l’explication de la méthode. Refaites une variante sans accompagnement quelques semaines plus tard. La prochaine action consiste à écrire les deux scénarios et leurs critères de réussite avant d’envoyer une convocation.

Une satisfaction déclarée, un quiz de vocabulaire et une démonstration du formateur répondent à d’autres questions. Ils peuvent être utiles, mais ne prouvent pas qu’un participant sait utiliser l’assistant dans un dossier réel. Les six gestes ci-dessous constituent une grille éditoriale proposée sur ce site, pas une certification, un diplôme ou une méthode imposée par une autorité.

Définir ce qui doit changer dans le travail

Le point de départ n’est pas « connaître ChatGPT ». Cette formule mélange compréhension de l’outil, aisance à écrire une consigne, jugement professionnel et droit de traiter certaines données. Décrivez plutôt une action que l’équipe devra accomplir après la session : préparer un brouillon de courriel à partir de faits approuvés, extraire les points de désaccord d’un dossier autorisé ou comparer deux versions d’un texte avant validation.

La tâche doit être assez proche de l’activité quotidienne pour que l’essai ait un sens, mais assez bornée pour être corrigée. « Faire gagner du temps au service » est trop large. « Produire une note de 180 mots qui distingue trois décisions déjà prises de deux questions ouvertes » peut être observé. Ajoutez le destinataire du livrable, la source des faits, le degré de sensibilité des données et la personne qui approuve la sortie. Un exercice déconnecté des permissions réelles pourrait récompenser un comportement que l’organisation interdit ensuite.

La Commission européenne, dans ses questions et réponses sur la maîtrise de l’IA, demande de tenir compte du niveau technique, de l’expérience, de l’éducation et du contexte d’usage des personnes. Cette référence éclaire le cadrage ; elle ne fournit pas un examen ChatGPT obligatoire ni une note de passage. Une équipe de support qui reformule des réponses et une équipe juridique qui vérifie des citations n’ont pas le même seuil de tolérance aux erreurs.

Avant de construire la grille, interrogez donc le propriétaire métier : qu’est-ce qu’une erreur grave ici ? Une attribution inventée, un chiffre modifié, une donnée confidentielle collée dans un outil non autorisé, un ton inadapté ou une décision présentée comme validée ? Les réponses détermineront les critères éliminatoires. Si personne ne peut répondre, l’évaluation de la formation est prématurée : il manque un contrat d’usage.

Trois moments, trois questions différentes

Avant : connaître le point de départ

La première mise en situation montre ce que les participants savent déjà faire, pas ce qu’ils « valent ». Elle permet d’éviter une classe unique où certains apprennent à ouvrir l’outil tandis que d’autres corrigent des sorties complexes. Gardez le même temps disponible pour tous et annoncez clairement si une aide écrite est autorisée. Une personne peut réussir en appliquant une méthode déjà acquise ; c’est une donnée utile, pas un échec de la formation.

Recueillez peu d’informations : le résultat, les contrôles observés et les obstacles rencontrés suffisent souvent. Ne conservez pas par défaut le contenu complet de conversations de travail. Un exemple inventé permet de regarder les gestes sans collecter de données personnelles de clients ou de collaborateurs. Si l’employeur utilise le résultat comme donnée individuelle d’évaluation professionnelle, le traitement, l’information des personnes et l’accès aux résultats demandent un cadrage propre. La CNIL rappelle la nécessité de critères objectifs, d’une information préalable et d’une collecte limitée. Le référentiel CNIL de gestion du personnel mentionne aussi l’organisation des formations et l’évaluation des connaissances.

À chaud : voir les gestes acquis

À la fin de la session, donnez un second dossier qui exige les mêmes compétences mais ne reprend ni les mêmes phrases ni la même réponse attendue. Le participant peut consulter sa fiche méthode, comme il le ferait au bureau. Une bonne évaluation ne teste pas la mémoire d’une formule de prompt ; elle teste la capacité à repérer ce qui manque, à choisir un outil autorisé, à vérifier puis à assumer la version finale.

Faites annoncer la décision avant la note : « utilisable après correction », « à refaire » ou « à transmettre à un expert ». Une personne qui refuse de diffuser une réponse incertaine peut avoir mieux appris qu’une personne qui livre vite un texte fluide. La correction doit montrer pourquoi un choix était risqué et quel geste l’aurait rendu acceptable.

À distance : vérifier le transfert

Quelques semaines plus tard, proposez une variante sans aide du formateur et, si possible, dans le flux de travail habituel. Il ne s’agit pas de surveiller continuellement les salariés. Un échantillon volontaire de livrables autorisés, corrigés avec la même grille, peut suffire à repérer si la méthode tient. Notez les changements de contexte : accès différent à l’outil, nouvelles consignes internes, charge de travail ou absence de responsable pour valider.

Le transfert ne se réduit pas à une différence de points. Si la qualité baisse parce que les documents sources ne sont plus disponibles, une nouvelle formation n’est pas forcément la réponse. Si l’équipe retrouve les critères mais oublie de les appliquer sous pression, un rappel au moment de produire le livrable peut être plus utile qu’une seconde conférence. Le guide sur les rituels d’adoption après la formation développe cet environnement de travail ; l’épreuve à distance sert ici à décider quel soutien reste nécessaire.

Une grille de six gestes observables

La grille ci-dessous attribue à chaque geste trois états : absent, présent mais incomplet, maîtrisé dans le scénario. Elle évite de compenser une fuite de données ou un fait inventé par une belle mise en forme. Les poids éventuels appartiennent au métier ; un service de communication et un service de santé ne devraient pas reprendre le même barème sans examen.

GesteCe qu’on observeErreur qui change la décision
CadrerBut, public, format et source attendue sont nommésLa consigne demande une décision que l’outil ne doit pas prendre
Choisir les donnéesEntrée autorisée et limitée au nécessaireUne donnée sensible ou inutile est transmise sans cadre
Examiner la sortieFaits, citations et absences sont comparés aux sourcesUne affirmation non sourcée est reprise comme certaine
CorrigerL’erreur est reformulée ou retirée avec raisonLe texte reste faux après une simple amélioration du style
DéciderLe statut du livrable et le valideur sont explicitesLe brouillon est diffusé comme version approuvée
TransmettreLa méthode et la limite sont compréhensibles par un collèguePersonne ne peut refaire ou contester le résultat

Sur téléphone, faites défiler le tableau horizontalement si nécessaire. Pour chaque ligne, écrivez à l’avance un indice observable. « Vérifie bien » est une instruction vague ; « compare les deux chiffres de la réponse aux lignes 4 et 7 du dossier » produit une vérification reproductible. Le sixième geste compte parce qu’une compétence enfermée dans une conversation privée est difficile à maintenir dans une équipe.

Ne transformez pas la grille en examen de longueur des prompts. Une courte demande peut être excellente si le contexte est préparé autrement. À l’inverse, un prompt détaillé peut produire une note fausse que personne ne relit. Le critère porte sur le résultat et sur les décisions contrôlables. Un participant peut choisir de ne pas utiliser l’IA pour un cas donné, et ce choix peut être le bon si les données, le risque ou le temps de vérification le justifient.

Deux scénarios parallèles à préparer

Imaginez une équipe qui prépare des comptes rendus de projet. Le scénario A fournit trois notes fictives : une décision confirmée, une date encore discutée et un chiffre explicitement provisoire. Le participant doit rédiger une synthèse destinée à un manager, puis signaler ce qui ne peut pas être annoncé. Le scénario B, remis après la formation, change les noms fictifs et le sujet ; il conserve la même structure de difficulté : une décision, une incertitude et une valeur non stabilisée.

Dans les deux cas, l’assistant peut proposer une phrase trop affirmative. La compétence à observer est de la corriger, pas de deviner la phrase exacte attendue par le formateur. Le dossier contient une « feuille de vérité » séparée avec les passages sources, les erreurs à détecter et les décisions possibles. Deux évaluateurs peuvent alors comparer leur lecture. S’ils divergent, ils doivent préciser le critère avant de noter les autres participants.

Un deuxième exemple convient à une équipe éditoriale : préparer une fiche d’information à partir de deux sources officielles datées et d’une note interne fictive. La variante finale introduit une source plus ancienne que l’autre. On observe si le participant sépare date de publication, date de consultation et validité d’une affirmation. L’exercice se distingue d’un quiz du type « que signifie hallucination ? » : connaître le mot ne dit pas comment traiter une phrase douteuse.

Pour une équipe commerciale, évitez de réutiliser de vraies données de prospect dans l’exercice. Donnez un jeu synthétique et dites clairement qu’il est inventé. Pour une équipe ayant déjà l’autorisation d’utiliser ses données opérationnelles, une évaluation en situation réelle demande une décision spécifique sur les accès et la conservation. L’article sur les données synthétiques dans les tests d’assistant explique comment garder cette frontière lisible.

Lire les résultats sans produire un faux chiffre de progrès

Supposons que huit personnes passent l’exercice. Six livrent une note correcte après la session, contre trois avant. Ce constat seul ne prouve pas que la formation a causé l’écart : les scénarios peuvent être de difficulté différente, les participants ont pu s’entraîner ailleurs, et un évaluateur peut avoir changé de sévérité. Rapportez donc le nombre de personnes, la définition d’une note « correcte », la date, la méthode et les écarts observés. Une petite équipe n’a pas besoin d’un pourcentage spectaculaire.

Séparez trois lectures. L’apprentissage immédiat indique si le geste a été compris dans l’exercice. Le transfert indique s’il réapparaît sans accompagnement. L’effet métier demande encore autre chose : qualité du livrable, délai complet incluant la vérification, erreurs récupérées et acceptation par le destinataire. Aucun de ces niveaux ne se substitue aux autres. La grille de six gestes sert surtout à identifier la prochaine correction : exercice supplémentaire, règle de données clarifiée ou validation humaine mieux placée.

Pour éviter un score trompeur, conservez les motifs de refus. Une note peut gagner en style et perdre en fiabilité ; une moyenne masquerait ce déplacement. Les critères critiques peuvent être des conditions de passage indépendantes. Par exemple, un livrable n’est pas diffusé si une donnée non autorisée est entrée ou si une décision non validée est annoncée. Ce sont des règles de travail choisies par l’organisation, pas des seuils réglementaires universels.

Une fiche de restitution utilisable

La restitution à l’équipe peut tenir sur une page : tâche testée, version des scénarios, conditions de passation, grille utilisée, nombre de participants, résultats par geste, erreurs critiques, limites de l’essai et action décidée. Pour chaque personne, fournissez un retour concret : « les trois faits étaient reliés aux notes ; la date provisoire a été présentée comme acquise ; reprenez l’exercice sur la distinction confirmé/en attente ». Cette phrase aide à progresser davantage qu’une note globale.

Prévoyez aussi un retour sur le dispositif. Si presque tout le groupe échoue au même endroit, trois hypothèses existent au moins : le cours n’a pas entraîné ce geste, l’exercice est ambigu, ou le processus réel ne donne pas aux personnes les moyens de vérifier. Réunissez formateur et propriétaire métier pour trancher. Modifier seulement le prompt conseillé ne corrigera pas nécessairement une source inaccessible.

Si le résultat sert exclusivement à améliorer la formation, évitez d’en faire implicitement une mesure individuelle de performance. Si l’employeur décide d’une autre finalité, il faut l’annoncer et l’encadrer en conséquence. Dans tous les cas, la correction doit être accessible à la personne évaluée, et les éléments conservés doivent rester proportionnés à la finalité. Une captation complète de l’écran ou des conversations n’est pas nécessaire pour noter les six gestes d’un exercice fictif.

Limites

Les scénarios d’exercice montrent comment construire une évaluation ; ils ne fixent ni seuil de réussite universel ni progression attendue pour une équipe. Le cadre UNESCO cité concerne les enseignants : ses compétences observables doivent être adaptées aux tâches de l’entreprise. La maîtrise de l’IA prévue par le règlement européen dépend du système et du contexte ; une grille pédagogique ne suffit pas à établir la conformité.

Un exercice bref ne mesure ni toutes les situations professionnelles ni l’effet à long terme. Les résultats dépendent du niveau initial, de l’accès aux sources, des outils autorisés et de la façon dont les évaluateurs appliquent la grille. Si une évaluation individuelle entre dans les décisions RH, la protection des données et l’information des salariés doivent être examinées avec les responsables compétents.

Historique des mises à jour

  • 26 septembre 2026 : Précision des limites d’une évaluation courte.
  • 25 septembre 2026 : première publication du protocole, de la grille de six gestes et des deux scénarios parallèles.

Articles liés

Sources vérifiées

Rechercher

La recherche porte uniquement sur les contenus publiés. Entrée ouvre le premier résultat ; les flèches permettent de choisir.