Aller au contenu
← Catalogue
IA & TechnologiesAssistants, agents & automatisation

Créer une base de connaissances IA pour son entreprise

Réunir, trier et structurer les documents de l'entreprise pour que l'IA y trouve la bonne réponse, la cite et ne l'invente pas.

Pour qui

Responsables de la documentation, du support, de la qualité, des RH ou de la formation, chefs de projet et référents IA chargés de rendre les connaissances de l'entreprise accessibles aux équipes.

Durée

14 h

Format

Présentiel · Distanciel · Hybride

Niveau

Avancé

Résultat visé

Votre base de connaissances interrogable, testée sur votre corpus ou sur le corpus fourni

Vous cherchez une formation…

À propos de cette formation

Deux jours pour construire une base de connaissances que les équipes interrogent en langage courant : procédures, offres, documentation, règles internes. Le travail porte d'abord sur les documents — ce qui entre, dans quel état, avec quels droits — puis sur l'outil, les tests et la mise à jour.

Charger un dossier partagé dans un outil d'IA prend quelques minutes ; obtenir des réponses justes demande autre chose. Deux versions d'une même procédure, un scan illisible, un tableau mal découpé, un brouillon jamais validé : l'outil ne fait pas la différence et répond avec la même assurance. Sans règles d'accès ni de mise à jour, la base vieillit, se contredit et finit par montrer ce qu'elle ne devait pas montrer.

Le premier jour explique simplement comment un outil retrouve un passage — découpage des documents, recherche par le sens, principe du RAG : chercher d'abord, rédiger ensuite à partir de ce qui a été trouvé — et en tire des règles de préparation du corpus. Le second jour, chaque participant construit sa base dans l'outil autorisé (NotebookLM, projet Claude, GPT avec fichiers, Copilot sur SharePoint…), la soumet à une batterie de questions de test, contrôle les citations et fixe sa gouvernance : propriétaire, droits, versions, rythme de revue.

Le problème traité

Les connaissances de l'entreprise sont dispersées dans des dossiers partagés, en plusieurs versions, et les outils d'IA branchés dessus répondent sans distinguer le document validé du brouillon obsolète. Les réponses fausses paraissent fiables, et des documents sensibles deviennent accessibles à qui interroge la base.

Trois bénéfices clés

01

Des réponses tirées des documents validés de l'entreprise, avec le document et la section cités, vérifiables par l'utilisateur.

02

Un corpus assaini : une source de référence par sujet, des versions à jour, des documents lisibles par l'IA comme par les salariés.

03

Une base qui reste juste dans le temps : un propriétaire, des droits d'accès définis, un rythme de mise à jour.

Quand cette formation est pertinente

  • Les mêmes questions reviennent sans cesse au support, aux RH ou à l'administration des ventes, alors que les réponses existent déjà dans des documents.

  • L'entreprise a ouvert un outil capable d'interroger des fichiers — Copilot, NotebookLM, projets Claude, GPT avec fichiers — et veut éviter une base qui répond faux.

  • Un projet d'assistant interne ou d'IA branchée sur la documentation se prépare, et le corpus n'a jamais été audité.

Les problématiques auxquelles elle répond

  • « L'IA m'a cité une procédure qui n'est plus en vigueur depuis un an. »

  • « Nos documents sont partout, en trois versions, et personne ne sait laquelle est la bonne. »

  • « Je ne comprends pas pourquoi l'outil ne trouve pas une information qui est pourtant dans le fichier. »

  • « Si on branche l'IA sur nos dossiers, qui pourra voir quoi ? »

  • « On a créé une base il y a six mois ; plus personne ne la met à jour. »

Prérequis

Utiliser régulièrement un outil d'IA générative. Disposer d'un accès, autorisé par l'entreprise, à un outil capable d'interroger des documents (NotebookLM, projet Claude, GPT avec fichiers, Copilot sur SharePoint…). Apporter si possible un corpus de 10 à 30 documents sur un même domaine, anonymisé et validé pour cet usage ; à défaut, un corpus fictif est fourni. Aucune compétence en programmation n'est requise.

Programme détaillé

Jour 1

01

Module 1 — Interroger ses documents plutôt que la mémoire de l'IA

1 h 15
  • Interroger l'IA « de mémoire » ou sur ses documents : deux usages, deux niveaux de fiabilité

  • Le RAG en une phrase : l'outil cherche d'abord les passages utiles dans vos documents, puis rédige sa réponse à partir d'eux

  • Les formes courantes : carnet de sources, projet avec fichiers, assistant avec fichiers, copilote branché sur l'espace documentaire

  • Ce que la base change — réponses citées, périmètre maîtrisé — et ce qu'elle ne change pas : un document faux donne une réponse fausse

Méthodes
Démonstration comparée en direct, puis échange sur les besoins documentaires des participants.
Outils
Outil d'IA autorisé ; trois documents d'une PME fictive fournis.
Activité
Exercice 1 — cinq questions posées sans, puis avec les documents.
Résultat attendu
Chaque participant sait expliquer le principe du RAG avec ses propres mots et situer le besoin de son service.
02

Module 2 — Comment l'outil retrouve un passage : découpage, recherche et embeddings

1 h 30
  • Le découpage des documents en passages, et ce qu'il casse : tableaux, listes, renvois « voir ci-dessus »

  • Recherche par mots-clés et recherche par le sens : ce que chacune trouve (référence exacte, formulation différente)

  • Les embeddings sans jargon : chaque passage reçoit des coordonnées de sens, et l'outil ramène les passages les plus proches de la question

  • Proche ne veut pas dire juste : un passage obsolète ou hors sujet peut être ramené avec les autres

  • L'outil ne relit pas tout le corpus à chaque question : pourquoi une information présente peut rester introuvable

Méthodes
Activité débranchée sur cartes-passages, puis vérification des mêmes questions dans l'outil.
Outils
Cartes-passages imprimées ou tableau blanc partagé ; outil d'IA autorisé.
Activité
Exercice 2 — jouer le moteur de recherche à la main sur une procédure découpée.
Résultat attendu
Le participant sait diagnostiquer pourquoi une base ne trouve pas une information pourtant présente dans ses documents.
03

Module 3 — Cartographier et auditer ses sources

2 h
  • Définir le périmètre : quelles questions, pour quels utilisateurs, avec quels droits

  • Inventaire : où sont les documents, qui les rédige, qui les valide

  • Qualité d'une source : auteur, date, statut (validé, brouillon, obsolète), propriétaire

  • Doublons, versions concurrentes, contradictions : une information, une source de référence

  • Ce qui n'entre pas : données personnelles, documents confidentiels, documents hors du périmètre de droits

Méthodes
Apport court, puis atelier en sous-groupes sur un corpus fictif ; ceux qui ont apporté leur corpus y appliquent la même grille.
Outils
Grille d'audit des sources fournie (tableur) ; corpus fictif de vingt documents.
Activité
Exercice 3 — auditer un dossier partagé de vingt documents.
Résultat attendu
Un corpus trié — documents retenus, à mettre à jour ou exclus — et une source de référence désignée par sujet.
04

Module 4 — Structurer des documents lisibles par l'IA

2 h 15
  • Un document, un sujet ; des titres qui disent ce que contient la section

  • En-tête normalisé : titre, version, date, propriétaire, public visé

  • Convertir ce que l'outil lit mal : tableaux en image, scans, diaporamas, schémas

  • Glossaire des acronymes et du vocabulaire interne

  • Fiches questions-réponses pour les demandes les plus fréquentes, et conventions de nommage des fichiers

Méthodes
Démonstration avant/après, puis production individuelle accompagnée et test dans l'outil.
Outils
Traitement de texte ; outil d'IA autorisé ; guide de structuration fourni.
Activité
Exercice 4 — restructurer une procédure et comparer les réponses obtenues avant et après.
Résultat attendu
Une procédure restructurée qui obtient des réponses exactes et citées là où la version d'origine échouait.

Jour 2

05

Module 5 — Construire la base dans l'outil autorisé

1 h 30
  • Choisir la forme selon le besoin et l'outil : carnet de sources, projet, GPT avec fichiers, Copilot sur l'espace documentaire

  • Instructions de réponse : s'en tenir aux documents, citer document et section, répondre « non documenté » sinon

  • Signaler les contradictions entre documents plutôt que d'en choisir une

  • Charger par lots et contrôler que chaque document est réellement exploité

  • Préparer les questions d'exemple proposées aux utilisateurs

Méthodes
Démonstration sur deux outils, puis construction individuelle ou en binôme.
Outils
NotebookLM, projet Claude, GPT avec fichiers ou Copilot sur SharePoint, selon l'outil autorisé ; modèle d'instructions fourni.
Activité
Exercice 5 — créer la base, rédiger ses instructions et contrôler la lecture de chaque document.
Résultat attendu
Une première base interrogable, paramétrée et contrôlée document par document.
06

Module 6 — Citations, hallucinations et tests

2 h
  • Exiger la citation, puis vérifier qu'elle dit bien ce que la réponse affirme

  • Les erreurs typiques d'une base : invention, versions mélangées, passage sorti de son contexte, trou comblé de mémoire

  • Construire une batterie de questions de test avec réponses attendues et sources

  • Questions hors périmètre et questions pièges : ce que la base doit refuser

  • Corriger à la bonne place : le document, sa structure ou les instructions

  • Fixer un seuil d'acceptation avant d'ouvrir la base aux utilisateurs

Méthodes
Tests croisés en binôme, classement collectif des erreurs, correction guidée.
Outils
La base construite au module 5 ; grille de tests et de classement des erreurs (tableur).
Activité
Exercice 6 — batterie de quinze questions de test, correction et second passage.
Résultat attendu
Une base testée, dont la part de bonnes réponses citées est mesurée et dont les erreurs sont corrigées à la source.
07

Module 7 — Permissions, versioning et mise à jour

1 h 30
  • Qui peut interroger la base peut en lire tout le contenu : une base par périmètre de droits

  • Outils branchés sur un espace documentaire : ils s'appuient en principe sur les droits existants, dont les erreurs deviennent visibles — à vérifier avec l'administrateur

  • Versioning : remplacer un document, ne jamais empiler les versions ; tenir un journal des modifications

  • Propriétaire de la base, référents par domaine, rythme de revue, date de péremption des documents

  • Faire vivre la base : recueillir les questions restées sans réponse pour compléter le corpus

Méthodes
Étude de cas collective, mise en situation sur trois événements, rédaction guidée.
Outils
Modèle de fiche de gouvernance fourni ; la base construite au module 5.
Activité
Exercice 7 — traiter trois événements dans la vie de la base et rédiger sa fiche de gouvernance.
Résultat attendu
Une fiche de gouvernance d'une page : propriétaire, droits, versions, rythme de mise à jour.
08

Module 8 — Projet final : une base interrogable, testée et gouvernée

2 h
  • Assembler corpus audité, documents structurés, instructions, tests et gouvernance

  • Passer la batterie de tests finale et en documenter les résultats

  • Démonstration devant le groupe et réponses à des questions imprévues

  • Plan de lancement : annonce aux utilisateurs, questions d'exemple, première revue datée

Méthodes
Production accompagnée, démonstration de cinq minutes par participant ou binôme, feedback du formateur et du groupe.
Outils
Outil d'IA autorisé ; gabarit de dossier de projet fourni.
Activité
Projet final — livrer une base de connaissances interrogable pour son service.
Résultat attendu
Une base opérationnelle et son dossier, prêts à être ouverts à un premier groupe d'utilisateurs.

Vous ne savez pas si cette formation correspond à votre niveau ? Le diagnostic le dit en trois minutes.

Diagnostiquer mon niveau

Objectifs pédagogiques

  • 01

    Expliquer simplement comment un outil retrouve un passage dans des documents et s'en sert pour répondre (recherche par le sens, RAG)

  • 02

    Évaluer la qualité d'un corpus : sources, versions, doublons, contradictions, données sensibles

  • 03

    Structurer des documents pour qu'ils soient retrouvés et compris par l'IA

  • 04

    Construire une base de connaissances interrogable dans l'outil autorisé par l'entreprise

  • 05

    Rédiger des instructions de réponse qui imposent la citation des sources et le refus de répondre hors du corpus

  • 06

    Tester la base avec une batterie de questions et analyser les erreurs obtenues

  • 07

    Organiser les droits d'accès, le versioning et la mise à jour de la base

Compétences acquises

À l'issue de la formation, vous serez capable de…

  • Décider quels documents entrent dans la base, lesquels en sortent, et le justifier

  • Réécrire une procédure pour qu'une IA la retrouve et la cite correctement

  • Paramétrer une base dans NotebookLM, un projet Claude, un GPT avec fichiers ou Copilot, selon l'outil disponible

  • Vérifier qu'une citation soutient bien la réponse qu'elle accompagne

  • Distinguer une réponse tirée des documents d'une réponse complétée de mémoire par l'outil

  • Mettre à jour la base sans laisser d'anciennes versions en circulation

Exercices & cas pratiques

7 exercices tirés de situations professionnelles réelles, puis un projet final. Chaque production est commentée par le formateur.

01Avec ou sans les documents30 min
Contexte
Une PME fictive : son livret d'accueil, sa procédure de notes de frais et sa charte de télétravail sont fournis. Cinq questions de salariés portent sur ces règles.
Consigne
Poser les cinq questions à l'outil sans document, puis avec les trois documents chargés. Pour chaque réponse, indiquer d'où elle vient : des documents, de la mémoire générale de l'outil, ou de nulle part.
Production attendue
Un tableau cinq questions × deux modes : réponse, source citée, exacte ou non.
Critère de réussite
Pour chaque réponse, l'origine est identifiée et justifiée, et toute règle générique présentée comme une règle de l'entreprise est signalée.
02Le moteur de recherche à la main40 min
Contexte
Une procédure d'achat de six pages, découpée en vingt cartes-passages, dont une coupe un tableau de seuils de validation en deux. Six questions d'utilisateurs, dont deux formulées avec des mots absents du texte.
Consigne
En sous-groupes, retrouver pour chaque question les trois passages les plus utiles, d'abord par mots-clés, puis par le sens. Poser ensuite les mêmes questions à l'outil et comparer.
Production attendue
Pour chaque question : les passages retenus, la méthode qui les a trouvés, le passage manquant éventuel et sa cause.
Critère de réussite
Le groupe identifie au moins une question ratée par la recherche par mots-clés et explique pourquoi le tableau coupé produit une réponse incomplète.
03Auditer un dossier partagé1 h
Contexte
Un dossier partagé fictif de vingt documents du service support : deux versions d'une même procédure, un brouillon jamais validé, un scan de mauvaise qualité, une présentation sans date, un tableau contenant des noms et coordonnées de clients.
Consigne
Remplir la grille d'audit pour chaque document (auteur, date, statut, propriétaire, doublon, données sensibles), décider « garder », « mettre à jour » ou « exclure », puis désigner une source de référence par sujet.
Production attendue
La grille d'audit des vingt documents et la liste des documents retenus pour la base.
Critère de réussite
Le doublon, le brouillon et le fichier contenant des données personnelles sont tous exclus ou traités, et chaque décision est justifiée en une ligne.
04Rendre une procédure lisible par l'IA1 h 15
Contexte
Une procédure interne de huit pages : titres vagues (« Divers », « Point 3 »), tableau des seuils de validation inséré en image, acronymes non expliqués, aucune date ni version.
Consigne
Poser six questions à l'outil sur la version d'origine et noter les réponses. Restructurer le document (titres explicites, un sujet par section, tableau converti en texte, glossaire, en-tête normalisé, cinq questions-réponses), le recharger et reposer les six questions.
Production attendue
La procédure restructurée et le tableau des réponses avant et après.
Critère de réussite
Après restructuration, au moins cinq des six questions reçoivent une réponse exacte, citant la bonne section.
05Charger, paramétrer, contrôler50 min
Contexte
Le corpus retenu à l'exercice 3, ou le corpus anonymisé apporté par le participant.
Consigne
Créer la base dans l'outil autorisé, rédiger ses instructions de réponse (s'appuyer uniquement sur les documents, citer document et section, répondre « non documenté » sinon, signaler les contradictions), puis poser pour chaque document une question dont la réponse ne se trouve que dans ce document.
Production attendue
La base créée, ses instructions et la liste de contrôle de lecture document par document.
Critère de réussite
Chaque document répond à sa question de contrôle, et une question hors périmètre reçoit « non documenté » sans réponse inventée.
06Batterie de tests1 h 15
Contexte
La base construite à l'exercice 5, testée par un autre binôme qui ne l'a pas construite.
Consigne
Rédiger quinze questions de test avec réponse attendue et source : huit simples, trois dont la réponse est répartie sur deux documents, deux hors corpus, deux pièges portant sur une ancienne version. Soumettre, classer les erreurs (invention, mauvaise version, citation qui ne soutient pas la réponse, oubli), corriger le corpus ou les instructions, puis relancer.
Production attendue
La grille de tests avec les résultats du premier et du second passage et la correction apportée pour chaque erreur.
Critère de réussite
Les questions hors corpus ne reçoivent aucune réponse inventée au second passage, et chaque citation retenue comme juste a été vérifiée dans le document source.
07Trois événements dans la vie de la base45 min
Contexte
La procédure de notes de frais est révisée ; un fichier contenant des salaires a été déposé par erreur dans la base ; l'équipe commerciale demande l'accès, alors que trois documents sont réservés à la direction.
Consigne
Pour chaque événement, décrire les actions : qui agit, quoi, dans quel délai, comment vérifier. Retirer effectivement un document de la base et contrôler qu'il n'est plus cité. Rédiger la fiche de gouvernance de la base.
Production attendue
Les trois scénarios traités et la fiche de gouvernance d'une page : propriétaire, référents, droits, règles d'ajout et de retrait, journal des modifications, rythme de revue.
Critère de réussite
Le document retiré n'est plus cité par la base, test à l'appui, et l'organisation proposée ne donne à aucun utilisateur accès à un document hors de ses droits.
FINALUne base de connaissances pour mon service1 h 45
Contexte
Le corpus de chaque participant ou binôme — procédures, FAQ, offres, documentation produit, règles internes — anonymisé et validé pour cet usage, ou le corpus fictif complet fourni par le formateur.
Consigne
Assembler le travail des deux jours : corpus audité et structuré, base créée dans l'outil autorisé, instructions de réponse, batterie finale de dix questions de test, fiche de gouvernance et plan de lancement. Démonstration de cinq minutes au groupe, qui pose deux questions imprévues.
Production attendue
La base interrogable et son dossier : périmètre, liste des sources avec version, instructions, résultats des tests, fiche de gouvernance, plan de lancement.
Critère de réussite
Au moins neuf des dix questions de test reçoivent une réponse exacte et citée, aucune question hors périmètre ne reçoit de réponse inventée, et un propriétaire et une date de première revue sont désignés.

Méthodes pédagogiques

Explications sans jargon, appuyées sur des démonstrations en direct et une activité débranchée pour comprendre la recherche documentaire

Fil rouge sur deux jours : de l'audit du corpus à la base testée, sur les documents de chaque participant ou sur un corpus fictif fourni

Plus de la moitié du temps en pratique : ateliers en sous-groupes, exercices individuels, tests réels dans l'outil

Analyse critique des réponses obtenues : citations contrôlées, erreurs classées, corrections apportées au corpus

Démonstration finale devant le groupe et feedback du formateur sur la base et sa gouvernance

Chaque exercice se fait avec l'outil autorisé dans l'entreprise ; à défaut, avec les versions gratuites de ChatGPT, Claude ou Copilot et des cas fictifs fournis par le formateur.

Vous repartez avec

  • Votre base de connaissances interrogable, testée sur votre corpus ou sur le corpus fourni

  • La grille d'audit des sources : statut, version, propriétaire, données sensibles

  • Le guide de structuration des documents pour l'IA : titres, en-têtes, glossaire, questions-réponses

  • Le modèle d'instructions de réponse : s'en tenir aux documents, citer, dire « non documenté »

  • La batterie de questions de test et la grille de classement des erreurs

  • La fiche de gouvernance : propriétaire, droits, versioning, rythme de mise à jour

Outils utilisés

  • NotebookLM, projets Claude, GPT avec fichiers, Copilot sur SharePoint — selon l'outil autorisé dans l'entreprise et les licences dont elle dispose

  • L'espace documentaire existant (SharePoint, Google Drive, serveur de fichiers) comme source de référence

  • Un tableur pour la grille d'audit et la batterie de tests

  • Un traitement de texte pour restructurer les documents

Confidentialité & bonnes pratiques

  • Ne jamais transférer de données confidentielles dans un outil que l'entreprise n'a pas autorisé.

  • Anonymiser les données personnelles et sensibles avant tout usage — noms, coordonnées, montants, identifiants.

  • Respecter la politique interne d'usage de l'IA et les règles de son service.

  • Vérifier chaque production avant de la diffuser : une réponse fluide n'est pas une réponse juste.

  • Garder une validation humaine sur toute décision, tout envoi et tout document engageant.

  • Une base de connaissances rend tout son contenu accessible à chacun de ses utilisateurs : n'y déposer que des documents que tous ont le droit de lire.

  • Exclure les données personnelles (dossiers de salariés, données clients) sauf décision explicite du responsable des données, dans le cadre du RGPD.

  • Retirer un document de la base dès qu'il est obsolète ou que son accès est restreint, puis vérifier qu'il n'est plus cité.

Évaluation & attestation

Avant la formation
Diagnostic préalable : outils autorisés, documents disponibles, usages actuels de l'IA sur des documents, besoin visé. Chaque participant ou binôme identifie son corpus et ses futurs utilisateurs avant la formation.
Pendant
Chaque exercice produit un livrable contrôlé — grille d'audit, procédure restructurée, résultats de tests — commenté par le formateur. Quiz en fin de premier jour sur le découpage, la recherche par le sens et les limites d'une base.
En fin de formation
Démonstration de la base et remise du dossier, évaluées sur cinq critères : qualité du corpus, structure des documents, bonnes réponses citées sur la batterie de tests, absence d'invention hors périmètre, gouvernance définie. Auto-positionnement de sortie comparé au diagnostic.
Attestation
Attestation de formation remise à l'issue du parcours.

Questions fréquentes

Faut-il savoir coder ?

Non. Tout se fait dans des outils existants, sans développement. Les notions de recherche par le sens et de RAG sont expliquées avec des exemples, pour comprendre pourquoi une base répond bien ou mal — pas pour la programmer.

Quel outil sera utilisé ?

Celui que votre entreprise autorise : NotebookLM, un projet Claude, un GPT avec fichiers, Copilot branché sur SharePoint ou un outil interne. Certaines de ces fonctions dépendent des licences dont dispose l'entreprise ; le formateur adapte le projet à l'outil disponible. La méthode — audit, structuration, tests, gouvernance — reste la même.

Peut-on travailler sur nos propres documents ?

Oui, et c'est recommandé : le projet final gagne à porter sur un vrai corpus de votre service. Il doit être validé par l'entreprise et débarrassé de ses données personnelles et confidentielles. Sinon, un corpus fictif complet est fourni.

Quelle différence avec la formation « Créer des assistants IA internes sans coder » ?

Celle-ci porte sur les connaissances : quels documents, dans quel état, avec quels droits et quelles mises à jour. La formation sur les assistants porte sur leur comportement : rôle, instructions, garde-fous, utilisateurs. Les deux se complètent.

Et si nous envisageons une solution développée sur mesure ?

La formation ne couvre pas le développement. Elle donne les critères pour cadrer un tel projet avec votre DSI ou un prestataire : corpus, droits d'accès, tests d'acceptation, maintenance.

La formation peut-elle être organisée en intra-entreprise ?

Oui, c'est le format le plus adapté : chaque participant ou binôme construit la base d'un service réel, sur l'outil déployé chez vous.

Et maintenant ?

Construisons votre parcours.