Créer une base de connaissances IA pour son entreprise
Réunir, trier et structurer les documents de l'entreprise pour que l'IA y trouve la bonne réponse, la cite et ne l'invente pas.
Pour qui
Responsables de la documentation, du support, de la qualité, des RH ou de la formation, chefs de projet et référents IA chargés de rendre les connaissances de l'entreprise accessibles aux équipes.
Durée
14 h
Format
Présentiel · Distanciel · Hybride
Niveau
Avancé
Résultat visé
Votre base de connaissances interrogable, testée sur votre corpus ou sur le corpus fourni
À propos de cette formation
Deux jours pour construire une base de connaissances que les équipes interrogent en langage courant : procédures, offres, documentation, règles internes. Le travail porte d'abord sur les documents — ce qui entre, dans quel état, avec quels droits — puis sur l'outil, les tests et la mise à jour.
Charger un dossier partagé dans un outil d'IA prend quelques minutes ; obtenir des réponses justes demande autre chose. Deux versions d'une même procédure, un scan illisible, un tableau mal découpé, un brouillon jamais validé : l'outil ne fait pas la différence et répond avec la même assurance. Sans règles d'accès ni de mise à jour, la base vieillit, se contredit et finit par montrer ce qu'elle ne devait pas montrer.
Le premier jour explique simplement comment un outil retrouve un passage — découpage des documents, recherche par le sens, principe du RAG : chercher d'abord, rédiger ensuite à partir de ce qui a été trouvé — et en tire des règles de préparation du corpus. Le second jour, chaque participant construit sa base dans l'outil autorisé (NotebookLM, projet Claude, GPT avec fichiers, Copilot sur SharePoint…), la soumet à une batterie de questions de test, contrôle les citations et fixe sa gouvernance : propriétaire, droits, versions, rythme de revue.
Le problème traité
Trois bénéfices clés
Des réponses tirées des documents validés de l'entreprise, avec le document et la section cités, vérifiables par l'utilisateur.
Un corpus assaini : une source de référence par sujet, des versions à jour, des documents lisibles par l'IA comme par les salariés.
Une base qui reste juste dans le temps : un propriétaire, des droits d'accès définis, un rythme de mise à jour.
Quand cette formation est pertinente
Les mêmes questions reviennent sans cesse au support, aux RH ou à l'administration des ventes, alors que les réponses existent déjà dans des documents.
L'entreprise a ouvert un outil capable d'interroger des fichiers — Copilot, NotebookLM, projets Claude, GPT avec fichiers — et veut éviter une base qui répond faux.
Un projet d'assistant interne ou d'IA branchée sur la documentation se prépare, et le corpus n'a jamais été audité.
Les problématiques auxquelles elle répond
« L'IA m'a cité une procédure qui n'est plus en vigueur depuis un an. »
« Nos documents sont partout, en trois versions, et personne ne sait laquelle est la bonne. »
« Je ne comprends pas pourquoi l'outil ne trouve pas une information qui est pourtant dans le fichier. »
« Si on branche l'IA sur nos dossiers, qui pourra voir quoi ? »
« On a créé une base il y a six mois ; plus personne ne la met à jour. »
Prérequis
Utiliser régulièrement un outil d'IA générative. Disposer d'un accès, autorisé par l'entreprise, à un outil capable d'interroger des documents (NotebookLM, projet Claude, GPT avec fichiers, Copilot sur SharePoint…). Apporter si possible un corpus de 10 à 30 documents sur un même domaine, anonymisé et validé pour cet usage ; à défaut, un corpus fictif est fourni. Aucune compétence en programmation n'est requise.
Programme détaillé
Jour 1
Module 1 — Interroger ses documents plutôt que la mémoire de l'IA
1 h 15Interroger l'IA « de mémoire » ou sur ses documents : deux usages, deux niveaux de fiabilité
Le RAG en une phrase : l'outil cherche d'abord les passages utiles dans vos documents, puis rédige sa réponse à partir d'eux
Les formes courantes : carnet de sources, projet avec fichiers, assistant avec fichiers, copilote branché sur l'espace documentaire
Ce que la base change — réponses citées, périmètre maîtrisé — et ce qu'elle ne change pas : un document faux donne une réponse fausse
- Méthodes
- Démonstration comparée en direct, puis échange sur les besoins documentaires des participants.
- Outils
- Outil d'IA autorisé ; trois documents d'une PME fictive fournis.
- Activité
- Exercice 1 — cinq questions posées sans, puis avec les documents.
- Résultat attendu
- Chaque participant sait expliquer le principe du RAG avec ses propres mots et situer le besoin de son service.
Module 2 — Comment l'outil retrouve un passage : découpage, recherche et embeddings
1 h 30Le découpage des documents en passages, et ce qu'il casse : tableaux, listes, renvois « voir ci-dessus »
Recherche par mots-clés et recherche par le sens : ce que chacune trouve (référence exacte, formulation différente)
Les embeddings sans jargon : chaque passage reçoit des coordonnées de sens, et l'outil ramène les passages les plus proches de la question
Proche ne veut pas dire juste : un passage obsolète ou hors sujet peut être ramené avec les autres
L'outil ne relit pas tout le corpus à chaque question : pourquoi une information présente peut rester introuvable
- Méthodes
- Activité débranchée sur cartes-passages, puis vérification des mêmes questions dans l'outil.
- Outils
- Cartes-passages imprimées ou tableau blanc partagé ; outil d'IA autorisé.
- Activité
- Exercice 2 — jouer le moteur de recherche à la main sur une procédure découpée.
- Résultat attendu
- Le participant sait diagnostiquer pourquoi une base ne trouve pas une information pourtant présente dans ses documents.
Module 3 — Cartographier et auditer ses sources
2 hDéfinir le périmètre : quelles questions, pour quels utilisateurs, avec quels droits
Inventaire : où sont les documents, qui les rédige, qui les valide
Qualité d'une source : auteur, date, statut (validé, brouillon, obsolète), propriétaire
Doublons, versions concurrentes, contradictions : une information, une source de référence
Ce qui n'entre pas : données personnelles, documents confidentiels, documents hors du périmètre de droits
- Méthodes
- Apport court, puis atelier en sous-groupes sur un corpus fictif ; ceux qui ont apporté leur corpus y appliquent la même grille.
- Outils
- Grille d'audit des sources fournie (tableur) ; corpus fictif de vingt documents.
- Activité
- Exercice 3 — auditer un dossier partagé de vingt documents.
- Résultat attendu
- Un corpus trié — documents retenus, à mettre à jour ou exclus — et une source de référence désignée par sujet.
Module 4 — Structurer des documents lisibles par l'IA
2 h 15Un document, un sujet ; des titres qui disent ce que contient la section
En-tête normalisé : titre, version, date, propriétaire, public visé
Convertir ce que l'outil lit mal : tableaux en image, scans, diaporamas, schémas
Glossaire des acronymes et du vocabulaire interne
Fiches questions-réponses pour les demandes les plus fréquentes, et conventions de nommage des fichiers
- Méthodes
- Démonstration avant/après, puis production individuelle accompagnée et test dans l'outil.
- Outils
- Traitement de texte ; outil d'IA autorisé ; guide de structuration fourni.
- Activité
- Exercice 4 — restructurer une procédure et comparer les réponses obtenues avant et après.
- Résultat attendu
- Une procédure restructurée qui obtient des réponses exactes et citées là où la version d'origine échouait.
Jour 2
Module 5 — Construire la base dans l'outil autorisé
1 h 30Choisir la forme selon le besoin et l'outil : carnet de sources, projet, GPT avec fichiers, Copilot sur l'espace documentaire
Instructions de réponse : s'en tenir aux documents, citer document et section, répondre « non documenté » sinon
Signaler les contradictions entre documents plutôt que d'en choisir une
Charger par lots et contrôler que chaque document est réellement exploité
Préparer les questions d'exemple proposées aux utilisateurs
- Méthodes
- Démonstration sur deux outils, puis construction individuelle ou en binôme.
- Outils
- NotebookLM, projet Claude, GPT avec fichiers ou Copilot sur SharePoint, selon l'outil autorisé ; modèle d'instructions fourni.
- Activité
- Exercice 5 — créer la base, rédiger ses instructions et contrôler la lecture de chaque document.
- Résultat attendu
- Une première base interrogable, paramétrée et contrôlée document par document.
Module 6 — Citations, hallucinations et tests
2 hExiger la citation, puis vérifier qu'elle dit bien ce que la réponse affirme
Les erreurs typiques d'une base : invention, versions mélangées, passage sorti de son contexte, trou comblé de mémoire
Construire une batterie de questions de test avec réponses attendues et sources
Questions hors périmètre et questions pièges : ce que la base doit refuser
Corriger à la bonne place : le document, sa structure ou les instructions
Fixer un seuil d'acceptation avant d'ouvrir la base aux utilisateurs
- Méthodes
- Tests croisés en binôme, classement collectif des erreurs, correction guidée.
- Outils
- La base construite au module 5 ; grille de tests et de classement des erreurs (tableur).
- Activité
- Exercice 6 — batterie de quinze questions de test, correction et second passage.
- Résultat attendu
- Une base testée, dont la part de bonnes réponses citées est mesurée et dont les erreurs sont corrigées à la source.
Module 7 — Permissions, versioning et mise à jour
1 h 30Qui peut interroger la base peut en lire tout le contenu : une base par périmètre de droits
Outils branchés sur un espace documentaire : ils s'appuient en principe sur les droits existants, dont les erreurs deviennent visibles — à vérifier avec l'administrateur
Versioning : remplacer un document, ne jamais empiler les versions ; tenir un journal des modifications
Propriétaire de la base, référents par domaine, rythme de revue, date de péremption des documents
Faire vivre la base : recueillir les questions restées sans réponse pour compléter le corpus
- Méthodes
- Étude de cas collective, mise en situation sur trois événements, rédaction guidée.
- Outils
- Modèle de fiche de gouvernance fourni ; la base construite au module 5.
- Activité
- Exercice 7 — traiter trois événements dans la vie de la base et rédiger sa fiche de gouvernance.
- Résultat attendu
- Une fiche de gouvernance d'une page : propriétaire, droits, versions, rythme de mise à jour.
Module 8 — Projet final : une base interrogable, testée et gouvernée
2 hAssembler corpus audité, documents structurés, instructions, tests et gouvernance
Passer la batterie de tests finale et en documenter les résultats
Démonstration devant le groupe et réponses à des questions imprévues
Plan de lancement : annonce aux utilisateurs, questions d'exemple, première revue datée
- Méthodes
- Production accompagnée, démonstration de cinq minutes par participant ou binôme, feedback du formateur et du groupe.
- Outils
- Outil d'IA autorisé ; gabarit de dossier de projet fourni.
- Activité
- Projet final — livrer une base de connaissances interrogable pour son service.
- Résultat attendu
- Une base opérationnelle et son dossier, prêts à être ouverts à un premier groupe d'utilisateurs.
Vous ne savez pas si cette formation correspond à votre niveau ? Le diagnostic le dit en trois minutes.
Diagnostiquer mon niveauObjectifs pédagogiques
- 01
Expliquer simplement comment un outil retrouve un passage dans des documents et s'en sert pour répondre (recherche par le sens, RAG)
- 02
Évaluer la qualité d'un corpus : sources, versions, doublons, contradictions, données sensibles
- 03
Structurer des documents pour qu'ils soient retrouvés et compris par l'IA
- 04
Construire une base de connaissances interrogable dans l'outil autorisé par l'entreprise
- 05
Rédiger des instructions de réponse qui imposent la citation des sources et le refus de répondre hors du corpus
- 06
Tester la base avec une batterie de questions et analyser les erreurs obtenues
- 07
Organiser les droits d'accès, le versioning et la mise à jour de la base
Compétences acquises
À l'issue de la formation, vous serez capable de…
Décider quels documents entrent dans la base, lesquels en sortent, et le justifier
Réécrire une procédure pour qu'une IA la retrouve et la cite correctement
Paramétrer une base dans NotebookLM, un projet Claude, un GPT avec fichiers ou Copilot, selon l'outil disponible
Vérifier qu'une citation soutient bien la réponse qu'elle accompagne
Distinguer une réponse tirée des documents d'une réponse complétée de mémoire par l'outil
Mettre à jour la base sans laisser d'anciennes versions en circulation
Exercices & cas pratiques
7 exercices tirés de situations professionnelles réelles, puis un projet final. Chaque production est commentée par le formateur.
01Avec ou sans les documents30 min
- Contexte
- Une PME fictive : son livret d'accueil, sa procédure de notes de frais et sa charte de télétravail sont fournis. Cinq questions de salariés portent sur ces règles.
- Consigne
- Poser les cinq questions à l'outil sans document, puis avec les trois documents chargés. Pour chaque réponse, indiquer d'où elle vient : des documents, de la mémoire générale de l'outil, ou de nulle part.
- Production attendue
- Un tableau cinq questions × deux modes : réponse, source citée, exacte ou non.
- Critère de réussite
- Pour chaque réponse, l'origine est identifiée et justifiée, et toute règle générique présentée comme une règle de l'entreprise est signalée.
02Le moteur de recherche à la main40 min
- Contexte
- Une procédure d'achat de six pages, découpée en vingt cartes-passages, dont une coupe un tableau de seuils de validation en deux. Six questions d'utilisateurs, dont deux formulées avec des mots absents du texte.
- Consigne
- En sous-groupes, retrouver pour chaque question les trois passages les plus utiles, d'abord par mots-clés, puis par le sens. Poser ensuite les mêmes questions à l'outil et comparer.
- Production attendue
- Pour chaque question : les passages retenus, la méthode qui les a trouvés, le passage manquant éventuel et sa cause.
- Critère de réussite
- Le groupe identifie au moins une question ratée par la recherche par mots-clés et explique pourquoi le tableau coupé produit une réponse incomplète.
03Auditer un dossier partagé1 h
- Contexte
- Un dossier partagé fictif de vingt documents du service support : deux versions d'une même procédure, un brouillon jamais validé, un scan de mauvaise qualité, une présentation sans date, un tableau contenant des noms et coordonnées de clients.
- Consigne
- Remplir la grille d'audit pour chaque document (auteur, date, statut, propriétaire, doublon, données sensibles), décider « garder », « mettre à jour » ou « exclure », puis désigner une source de référence par sujet.
- Production attendue
- La grille d'audit des vingt documents et la liste des documents retenus pour la base.
- Critère de réussite
- Le doublon, le brouillon et le fichier contenant des données personnelles sont tous exclus ou traités, et chaque décision est justifiée en une ligne.
04Rendre une procédure lisible par l'IA1 h 15
- Contexte
- Une procédure interne de huit pages : titres vagues (« Divers », « Point 3 »), tableau des seuils de validation inséré en image, acronymes non expliqués, aucune date ni version.
- Consigne
- Poser six questions à l'outil sur la version d'origine et noter les réponses. Restructurer le document (titres explicites, un sujet par section, tableau converti en texte, glossaire, en-tête normalisé, cinq questions-réponses), le recharger et reposer les six questions.
- Production attendue
- La procédure restructurée et le tableau des réponses avant et après.
- Critère de réussite
- Après restructuration, au moins cinq des six questions reçoivent une réponse exacte, citant la bonne section.
05Charger, paramétrer, contrôler50 min
- Contexte
- Le corpus retenu à l'exercice 3, ou le corpus anonymisé apporté par le participant.
- Consigne
- Créer la base dans l'outil autorisé, rédiger ses instructions de réponse (s'appuyer uniquement sur les documents, citer document et section, répondre « non documenté » sinon, signaler les contradictions), puis poser pour chaque document une question dont la réponse ne se trouve que dans ce document.
- Production attendue
- La base créée, ses instructions et la liste de contrôle de lecture document par document.
- Critère de réussite
- Chaque document répond à sa question de contrôle, et une question hors périmètre reçoit « non documenté » sans réponse inventée.
06Batterie de tests1 h 15
- Contexte
- La base construite à l'exercice 5, testée par un autre binôme qui ne l'a pas construite.
- Consigne
- Rédiger quinze questions de test avec réponse attendue et source : huit simples, trois dont la réponse est répartie sur deux documents, deux hors corpus, deux pièges portant sur une ancienne version. Soumettre, classer les erreurs (invention, mauvaise version, citation qui ne soutient pas la réponse, oubli), corriger le corpus ou les instructions, puis relancer.
- Production attendue
- La grille de tests avec les résultats du premier et du second passage et la correction apportée pour chaque erreur.
- Critère de réussite
- Les questions hors corpus ne reçoivent aucune réponse inventée au second passage, et chaque citation retenue comme juste a été vérifiée dans le document source.
07Trois événements dans la vie de la base45 min
- Contexte
- La procédure de notes de frais est révisée ; un fichier contenant des salaires a été déposé par erreur dans la base ; l'équipe commerciale demande l'accès, alors que trois documents sont réservés à la direction.
- Consigne
- Pour chaque événement, décrire les actions : qui agit, quoi, dans quel délai, comment vérifier. Retirer effectivement un document de la base et contrôler qu'il n'est plus cité. Rédiger la fiche de gouvernance de la base.
- Production attendue
- Les trois scénarios traités et la fiche de gouvernance d'une page : propriétaire, référents, droits, règles d'ajout et de retrait, journal des modifications, rythme de revue.
- Critère de réussite
- Le document retiré n'est plus cité par la base, test à l'appui, et l'organisation proposée ne donne à aucun utilisateur accès à un document hors de ses droits.
FINALUne base de connaissances pour mon service1 h 45
- Contexte
- Le corpus de chaque participant ou binôme — procédures, FAQ, offres, documentation produit, règles internes — anonymisé et validé pour cet usage, ou le corpus fictif complet fourni par le formateur.
- Consigne
- Assembler le travail des deux jours : corpus audité et structuré, base créée dans l'outil autorisé, instructions de réponse, batterie finale de dix questions de test, fiche de gouvernance et plan de lancement. Démonstration de cinq minutes au groupe, qui pose deux questions imprévues.
- Production attendue
- La base interrogable et son dossier : périmètre, liste des sources avec version, instructions, résultats des tests, fiche de gouvernance, plan de lancement.
- Critère de réussite
- Au moins neuf des dix questions de test reçoivent une réponse exacte et citée, aucune question hors périmètre ne reçoit de réponse inventée, et un propriétaire et une date de première revue sont désignés.
Méthodes pédagogiques
Explications sans jargon, appuyées sur des démonstrations en direct et une activité débranchée pour comprendre la recherche documentaire
Fil rouge sur deux jours : de l'audit du corpus à la base testée, sur les documents de chaque participant ou sur un corpus fictif fourni
Plus de la moitié du temps en pratique : ateliers en sous-groupes, exercices individuels, tests réels dans l'outil
Analyse critique des réponses obtenues : citations contrôlées, erreurs classées, corrections apportées au corpus
Démonstration finale devant le groupe et feedback du formateur sur la base et sa gouvernance
Chaque exercice se fait avec l'outil autorisé dans l'entreprise ; à défaut, avec les versions gratuites de ChatGPT, Claude ou Copilot et des cas fictifs fournis par le formateur.
Vous repartez avec
Votre base de connaissances interrogable, testée sur votre corpus ou sur le corpus fourni
La grille d'audit des sources : statut, version, propriétaire, données sensibles
Le guide de structuration des documents pour l'IA : titres, en-têtes, glossaire, questions-réponses
Le modèle d'instructions de réponse : s'en tenir aux documents, citer, dire « non documenté »
La batterie de questions de test et la grille de classement des erreurs
La fiche de gouvernance : propriétaire, droits, versioning, rythme de mise à jour
Outils utilisés
NotebookLM, projets Claude, GPT avec fichiers, Copilot sur SharePoint — selon l'outil autorisé dans l'entreprise et les licences dont elle dispose
L'espace documentaire existant (SharePoint, Google Drive, serveur de fichiers) comme source de référence
Un tableur pour la grille d'audit et la batterie de tests
Un traitement de texte pour restructurer les documents
Confidentialité & bonnes pratiques
Ne jamais transférer de données confidentielles dans un outil que l'entreprise n'a pas autorisé.
Anonymiser les données personnelles et sensibles avant tout usage — noms, coordonnées, montants, identifiants.
Respecter la politique interne d'usage de l'IA et les règles de son service.
Vérifier chaque production avant de la diffuser : une réponse fluide n'est pas une réponse juste.
Garder une validation humaine sur toute décision, tout envoi et tout document engageant.
Une base de connaissances rend tout son contenu accessible à chacun de ses utilisateurs : n'y déposer que des documents que tous ont le droit de lire.
Exclure les données personnelles (dossiers de salariés, données clients) sauf décision explicite du responsable des données, dans le cadre du RGPD.
Retirer un document de la base dès qu'il est obsolète ou que son accès est restreint, puis vérifier qu'il n'est plus cité.
Évaluation & attestation
- Avant la formation
- Diagnostic préalable : outils autorisés, documents disponibles, usages actuels de l'IA sur des documents, besoin visé. Chaque participant ou binôme identifie son corpus et ses futurs utilisateurs avant la formation.
- Pendant
- Chaque exercice produit un livrable contrôlé — grille d'audit, procédure restructurée, résultats de tests — commenté par le formateur. Quiz en fin de premier jour sur le découpage, la recherche par le sens et les limites d'une base.
- En fin de formation
- Démonstration de la base et remise du dossier, évaluées sur cinq critères : qualité du corpus, structure des documents, bonnes réponses citées sur la batterie de tests, absence d'invention hors périmètre, gouvernance définie. Auto-positionnement de sortie comparé au diagnostic.
- Attestation
- Attestation de formation remise à l'issue du parcours.
Questions fréquentes
Faut-il savoir coder ?
Non. Tout se fait dans des outils existants, sans développement. Les notions de recherche par le sens et de RAG sont expliquées avec des exemples, pour comprendre pourquoi une base répond bien ou mal — pas pour la programmer.
Quel outil sera utilisé ?
Celui que votre entreprise autorise : NotebookLM, un projet Claude, un GPT avec fichiers, Copilot branché sur SharePoint ou un outil interne. Certaines de ces fonctions dépendent des licences dont dispose l'entreprise ; le formateur adapte le projet à l'outil disponible. La méthode — audit, structuration, tests, gouvernance — reste la même.
Peut-on travailler sur nos propres documents ?
Oui, et c'est recommandé : le projet final gagne à porter sur un vrai corpus de votre service. Il doit être validé par l'entreprise et débarrassé de ses données personnelles et confidentielles. Sinon, un corpus fictif complet est fourni.
Quelle différence avec la formation « Créer des assistants IA internes sans coder » ?
Celle-ci porte sur les connaissances : quels documents, dans quel état, avec quels droits et quelles mises à jour. La formation sur les assistants porte sur leur comportement : rôle, instructions, garde-fous, utilisateurs. Les deux se complètent.
Et si nous envisageons une solution développée sur mesure ?
La formation ne couvre pas le développement. Elle donne les critères pour cadrer un tel projet avec votre DSI ou un prestataire : corpus, droits d'accès, tests d'acceptation, maintenance.
La formation peut-elle être organisée en intra-entreprise ?
Oui, c'est le format le plus adapté : chaque participant ou binôme construit la base d'un service réel, sur l'outil déployé chez vous.