Aller au contenu
LeLinter

RAG en entreprise : connecter vos données aux LLM sans fuite

RAG en entreprise : connecter vos données aux LLM sans fuite

RAG : le marché doit être multiplié par 5 d'ici 2030. Comment interroger vos documents internes avec l'IA d'entreprise, sans les envoyer dans le cloud.

Franck Boué
Franck Boué

11 min de lecture

Un dirigeant de PME qui veut faire analyser ses contrats ou son historique de devis par une IA se heurte vite à deux options mal comprises : réentraîner un modèle sur ses propres documents (le fine-tuning), ou coller des extraits dans une conversation et espérer que le modèle s'en souvienne. Il existe une troisième voie, aujourd'hui la plus utilisée en entreprise : le RAG, ou génération augmentée par récupération. Le marché mondial de cette technique doit passer de 1,94 milliard de dollars en 2025 à 9,86 milliards en 2030, soit une croissance annuelle de 38,4 % (MarketsandMarkets). Concrètement, le RAG permet d'interroger une base documentaire privée en langage naturel, sans réentraîner le modèle et, si l'architecture est bien choisie, sans qu'aucun document ne quitte l'entreprise.

À Retenir

  • Le marché mondial du RAG doit être multiplié par 5 entre 2025 et 2030 (1,94 à 9,86 milliards de dollars), signe d'une adoption qui dépasse largement les grands groupes
  • Le RAG évite l'écueil du fine-tuning : la base documentaire se met à jour en continu sans ré-entraînement périodique, contrairement au fine-tuning qui impose ce cycle tous les 3 à 6 mois
  • Combiné à un LLM local, le RAG garantit qu'aucun document interne ne transite par une API tierce
  • Trois cas d'usage concrets pour une PME : recherche documentaire juridique, support technique interne, onboarding de nouveaux collaborateurs

Pourquoi pas simplement du prompt engineering ou du fine-tuning ?

La première tentation, quand on veut faire répondre une IA sur ses propres documents, est de copier-coller des extraits directement dans la conversation. Cette approche fonctionne pour un besoin ponctuel, mais elle a une limite stricte : la fenêtre de contexte du modèle. Au-delà de quelques dizaines de pages, il devient impossible de tout injecter dans un seul échange, et le modèle finit par perdre le fil ou ignorer une partie des informations fournies.

La deuxième option, le fine-tuning, consiste à réentraîner le modèle sur un corpus de documents pour qu'il « apprenne » le contenu. Le problème est structurel : chaque mise à jour de la base documentaire, chaque nouveau contrat ou chaque procédure modifiée impose, à terme, de relancer un cycle de ré-entraînement. Selon une analyse détaillée de Forgit, un fine-tuning demande entre 5 000 et 15 000 € de préparation de dataset puis 2 000 à 8 000 € d'entraînement managé, avec un ré-entraînement périodique tous les 3 à 6 mois représentant 30 à 50 % du coût initial. Un RAG représente lui aussi un investissement de départ, entre 15 000 et 25 000 € pour une version basique, jusqu'à 30 000-60 000 € pour une version avancée avec reranking et évaluation, mais ses coûts récurrents sont ensuite bien plus légers : quelques centaines d'euros par mois de base vectorielle et d'embeddings, sans cycle de ré-entraînement à chaque mise à jour documentaire. C'est cette différence de coûts récurrents, plus que le coût de départ, qui explique pourquoi Forgit recommande de commencer par le prompt engineering, puis de passer au RAG dès que le besoin porte sur une connaissance métier précise — le RAG couvrant, selon cette analyse, environ 80 % des cas d'usage rencontrés en entreprise, le fine-tuning restant réservé aux besoins les plus spécifiques.

Comment fonctionne le RAG, concrètement ?

Le RAG repose sur un principe simple : au lieu de tout demander au modèle de langage, on lui donne d'abord les bons extraits de documents à lire, puis on lui demande de rédiger une réponse à partir de ces extraits précis. Le processus se déroule en trois étapes.

Serveur de données et câblage réseau symbolisant une base documentaire d'entreprise

La vectorisation. Chaque document de l'entreprise (contrat, procédure, fiche produit, historique de devis) est découpé en fragments, puis transformé en une représentation numérique appelée vecteur, qui capture le sens du texte plutôt que ses mots exacts. Cette conversion est réalisée par un modèle d'embedding, généralement peu coûteux à faire tourner comparé à un modèle de génération.

La base vectorielle. Ces vecteurs sont stockés dans une base de données spécialisée, conçue pour retrouver rapidement les fragments dont le sens est le plus proche d'une requête donnée, même si la formulation diffère des mots utilisés dans le document d'origine.

La récupération et la génération. Quand un collaborateur pose une question, celle-ci est elle-même vectorisée, comparée au contenu de la base, et les fragments les plus pertinents sont extraits. Ils sont ensuite transmis au LLM avec la question initiale, à charge pour le modèle de rédiger une réponse fondée sur ces extraits précis, généralement avec une citation de la source d'où provient l'information.

Cette mécanique explique pourquoi le RAG limite fortement le risque d'invention de faits par le modèle : la réponse s'appuie sur des documents réels, identifiables, et non sur la seule mémoire statistique du modèle constituée pendant son entraînement.

RAG local ou RAG cloud : où sont vos données ?

Cette question devient d'autant plus pressante que l'usage de l'IA générative progresse vite dans les PME françaises : 26 % des TPE-PME l'utilisaient déjà en 2025, contre 13 % un an plus tôt (France Num, baromètre 2025). Le RAG en lui-même ne garantit pas la confidentialité : c'est l'endroit où tournent le modèle d'embedding, la base vectorielle et le LLM qui en décide. Un RAG entièrement cloud (base vectorielle hébergée chez un tiers, modèle de génération appelé via une API américaine) expose les mêmes risques qu'un usage classique de ChatGPT ou Copilot en entreprise : une étude Gartner relayée par IA Cyber Sécurité indique que 41 % des employés utilisent des outils d'IA non validés par leur entreprise, et une étude Cyberhaven citée par la même source établit que 11 % des données collées dans ChatGPT en contexte professionnel sont de nature confidentielle.

Un RAG combiné à un LLM local change la donne : la base vectorielle et le modèle de génération tournent tous deux sur l'infrastructure de l'entreprise, aucun document ni aucune requête ne transite par un serveur externe. C'est cette architecture qui rend le RAG particulièrement adapté aux PME manipulant des données sensibles, dossiers clients, contrats couverts par un secret professionnel ou données RH, sans les exposer au Cloud Act américain ni complexifier leur conformité RGPD par des transferts hors UE.

Trois cas d'usage concrets pour une PME

Le RAG n'a de valeur que s'il répond à un besoin métier précis. Trois cas d'usage reviennent le plus souvent dans les PME.

Recherche documentaire juridique. Une base de plusieurs dizaines de contrats fournisseurs ou clients devient interrogeable en langage naturel : « quelles sont nos clauses de résiliation avec tel prestataire ? » ou « quels contrats arrivent à échéance ce trimestre ? », avec citation de la clause exacte plutôt qu'une réponse générique.

Documents contractuels et classeurs organisés sur une étagère de bureau

Support technique interne. Une équipe qui documente ses procédures, ses incidents résolus et sa documentation produit peut transformer cette base en assistant consultable par tous les collaborateurs, réduisant le temps passé à chercher une information déjà écrite quelque part dans un wiki ou un dossier partagé.

Onboarding des nouveaux collaborateurs. Plutôt que de multiplier les documents de référence à lire en arrivant, un nouvel employé peut poser directement ses questions sur les process internes, l'organisation ou les outils de l'entreprise, avec des réponses sourcées sur la documentation réelle plutôt que sur la mémoire d'un collègue.

Ces trois cas partagent un point commun : ils s'appuient sur une base documentaire déjà existante dans l'entreprise. Le RAG n'invente rien, il rend accessible ce qui est déjà écrit mais difficile à retrouver.

Comment démarrer un projet RAG en PME

Se lancer ne nécessite pas une équipe de data scientists, mais une préparation en amont conditionne la qualité des résultats.

  1. Faire l'inventaire de la base documentaire à connecter. Un RAG performant demande des documents à jour et structurés ; une base documentaire désordonnée ou obsolète produira des réponses de mauvaise qualité, quelle que soit la technique utilisée.
  2. Choisir une base vectorielle adaptée au volume. Des solutions open source comme Chroma ou Qdrant conviennent à une PME pour quelques milliers de documents, sans nécessiter d'infrastructure lourde.
  3. Sélectionner un modèle d'embedding et un LLM de génération cohérents avec la langue principale de l'entreprise, en priorisant les modèles capables de bien traiter le français si la documentation est majoritairement rédigée dans cette langue.
  4. Tester sur un périmètre restreint avant de généraliser : une seule base documentaire (les contrats, par exemple) permet de valider la pertinence des réponses avant d'étendre le système à l'ensemble des documents de l'entreprise.

Équipe de collaborateurs travaillant ensemble autour d'un ordinateur en PME

RAG ou LLM local seul : comment choisir ?

Le RAG et le LLM local répondent à deux besoins différents, mais complémentaires. Un LLM local sans RAG reste utile pour des tâches génériques, rédaction, résumé, reformulation, qui ne demandent pas de connaissance précise de documents internes. Dès que le besoin porte sur l'exploitation d'une base documentaire spécifique à l'entreprise, contrats, procédures, historique client, le RAG devient nécessaire : c'est lui qui connecte le modèle à la réalité documentaire de l'entreprise, là où le LLM seul ne peut s'appuyer que sur ses connaissances générales acquises pendant l'entraînement.

Nous détaillons dans notre article sur le LLM local en entreprise les questions de matériel, de coûts et de sécurité liées à l'hébergement du modèle lui-même. Cette réflexion s'inscrit aussi dans une démarche plus large d'adoption raisonnée de l'IA, détaillée dans notre guide d'évaluation en 5 étapes et dans notre guide sur l'IA pour les PME.

Chez Le Linter, la question que nous posons systématiquement à un client qui souhaite exploiter l'IA sur ses documents internes porte d'abord sur la base documentaire elle-même : quel volume, quelle sensibilité, quel niveau de mise à jour. Un projet RAG mal préparé sur une base documentaire désorganisée donne des résultats décevants, indépendamment de la qualité technique de l'architecture choisie.

Vous vous interrogez sur la faisabilité d'un projet RAG pour exploiter vos propres documents ? Parlons-en, 15 minutes suffisent pour clarifier votre besoin et votre base documentaire.

En résumé

  • Le marché mondial du RAG doit être multiplié par 5 entre 2025 et 2030, porté par des entreprises de toute taille, PME comprises
  • Le RAG évite la rigidité du fine-tuning : la base documentaire se met à jour sans cycle de ré-entraînement périodique
  • Vectorisation des documents, base vectorielle et génération contextuelle sont les trois briques techniques du RAG
  • Combiné à un LLM local, le RAG garantit que les documents internes ne quittent jamais l'infrastructure de l'entreprise
  • Recherche documentaire juridique, support technique interne et onboarding sont les trois cas d'usage les plus fréquents en PME

Questions fréquentes

Les réponses courtes aux questions que ces sujets soulèvent le plus souvent.