Aller au contenu

RAG en IA : comment une IA répond à partir de vos documents

Par la rédaction de E-Solutions Web. Publié le , mis à jour le . Notre méthode

La réponse courte

Le RAG (retrieval-augmented generation, ou génération augmentée par la recherche) fait répondre une IA à partir d’un corpus choisi plutôt que de sa seule mémoire. Avant d’écrire, le système cherche dans vos documents les passages qui correspondent à la question, les transmet au modèle de langage et lui demande de répondre à partir d’eux, en citant la source. La réponse vaut donc ce que valent vos documents.

Qu’est-ce que le RAG en IA ? La définition en une idée

Le RAG oblige l’IA à chercher avant de répondre. Un modèle de langage seul écrit à partir de ce qu’il a absorbé pendant son entraînement. Ce savoir s’arrête à une date, n’a jamais contenu vos contrats ni vos procédures, et le modèle est incapable de dire d’où vient telle phrase. Le RAG place une étape de recherche devant le modèle : trouver les passages utiles dans un corpus que vous choisissez, puis rédiger la réponse à partir d’eux.

Le terme vient d’un article de recherche déposé en mai 2020 et accepté la même année à la conférence NeurIPS. Ses auteurs y posaient le problème sans détour : pour les modèles de langage, indiquer la provenance de leurs réponses et mettre à jour leurs connaissances restaient des problèmes de recherche non résolus. Leur solution : adjoindre au modèle une mémoire externe, interrogeable. Les entreprises utilisent aujourd’hui ce même principe pour faire travailler l’IA sur leurs propres documents, parce qu’il règle les deux problèmes d’un coup : mettre à jour un fait revient à remplacer un document, et chaque réponse peut renvoyer à sa source.

L’image la plus parlante pour un dirigeant : un nouveau collaborateur très à l’aise avec la langue, qui ne connaît rien de votre entreprise, assis à côté d’archives bien rangées. Le RAG, c’est la règle qui l’oblige à consulter les archives avant de parler.

Ce qui se passe quand on pose une question

Tout système RAG enchaîne quatre étapes, et chacune conditionne la qualité de la réponse. La première a lieu avant toute question ; les trois autres, dans les secondes qui suivent la question.

  1. Préparer les documents. Les fichiers sont collectés là où ils vivent (serveur de fichiers, intranet, outil de tickets, base produits), convertis en texte, découpés en passages de quelques paragraphes. Chaque passage devient un vecteur, une suite de nombres qui en capture le sens, rangé dans un index.
  2. Chercher par le sens. La question subit la même conversion et se compare à tous les passages. Les plus proches remontent, même s’ils emploient d’autres mots : « combien pour une chambre d’hôtel » trouve le passage intitulé « plafonds d’hébergement ».
  3. Répondre à partir des passages. Le modèle reçoit la question et les passages retrouvés, avec la consigne de n’utiliser qu’eux et de le dire quand la réponse n’y figure pas.
  4. Montrer les sources. Chaque affirmation renvoie au passage d’où elle vient : le lecteur peut ouvrir l’original et vérifier.

Ces quatre étapes sont visibles dans notre démonstration d’assistant documentaire, qui a lu les huit procédures internes d’un distributeur fictif et affiche, sous chaque réponse, les passages numérotés utilisés. Posez-lui une question que ces procédures ne couvrent pas : sa réaction compte plus que n’importe quelle réponse bien tournée.

Pourquoi ne pas tout coller dans la question ? Les modèles acceptent désormais des entrées très longues, mais une étude de 2023 a montré que leurs performances se dégradent nettement quand l’information utile se trouve au milieu d’un long contexte. Sélectionner les quelques passages pertinents reste plus fiable, et chaque requête reste plus légère.

RAG, fine-tuning ou long prompt : lequel choisir

Pour obtenir des réponses fondées sur vos documents, le RAG est en général le bon point de départ ; les deux autres techniques donnent leur meilleur à ses côtés. Les propositions commerciales les confondent souvent. Voici ce que chacune modifie réellement.

CritèreRAGFine-tuning (réentraînement)Tout dans le prompt
Ce qui changeCe que le modèle lit avant de répondreSa manière d’écrire et de se comporterCe que le modèle lit, en une fois
Où vivent les faitsDans vos documents, hors du modèleFondus dans les poids du modèleDans chaque requête
Mettre à jour un faitRemplacer le documentRéentraînerModifier le prompt
Citer la sourceOui, passage par passageNonPossible, moins précis sur un long texte
Restreindre selon l’utilisateurOui, en filtrant la rechercheNonSeulement avec un prompt par profil
Bon usageProcédures, contrats, fiches produits, historique du supportUn style maison, un format imposé, un vocabulaire métierQuelques documents courts et stables

En pratique, un assistant solide combine les trois : le RAG pour les faits, une consigne soignée pour le ton et le format, et, plus rarement, un réentraînement léger quand un vocabulaire ou un format de sortie doit être respecté à la lettre.

Les trois limites à vérifier avant de choisir

Le RAG ne rend pas une IA fiable à lui seul. Trois limites décident si l’assistant aide vos équipes ou les induit en erreur, et un modèle plus gros n’en règle aucune.

Vos documents fixent le plafond

Un assistant qui répond à partir de vos documents ne fera jamais mieux qu’eux. Si trois versions de la politique de déplacement traînent dans trois dossiers, il risque de citer la plus ancienne. Si une procédure clé n’existe qu’en PDF scanné sans couche texte, il ne peut pas la lire. Si la réponse à une question fréquente n’est écrite nulle part, aucune recherche ne la trouvera.

Un projet sérieux commence donc par le corpus : désigner la source qui fait foi sur chaque sujet, archiver les versions périmées, extraire le texte des scans, ajouter les métadonnées (propriétaire, date, public visé) qui permettent de privilégier le document à jour. Ce travail profite aussi à ceux qui cherchent aujourd’hui ces fichiers à la main.

Les droits d’accès suivent la personne qui demande

Peu d’entreprises veulent que chaque salarié lise chaque document. Un dossier RH, une note de comité de direction ou un contrat client ne doivent apparaître dans une réponse que pour ceux qui pouvaient déjà l’ouvrir. La recherche doit appliquer, à chaque question, les mêmes permissions que vos outils documentaires.

Le risque est réel. L’OWASP Gen AI Security Project range les faiblesses des vecteurs et des embeddings parmi les dix principaux risques des applications LLM en 2025 : des contrôles d’accès insuffisants ou mal alignés peuvent donner accès à des données sensibles contenues dans l’index. Sa recommandation : des bases vectorielles qui tiennent compte des permissions. Demandez à tout prestataire comment son architecture y répond, et exigez de le voir fonctionner avec deux utilisateurs aux droits différents.

Les hallucinations diminuent sans disparaître

Le NIST, l’institut américain de normalisation, parle de « confabulation » : la production d’un contenu erroné ou faux, énoncé avec assurance. Le RAG la réduit, parce que le modèle a le bon texte sous les yeux. Il ne l’élimine pas. Le modèle peut encore mal lire un passage, en combiner deux à tort, ou combler un vide par une supposition plausible.

La mesure publique la plus parlante vient du droit, où chaque référence se vérifie. Une étude préenregistrée publiée en mai 2024 a testé des outils commerciaux de recherche juridique dont les éditeurs présentaient le RAG comme un rempart contre les hallucinations. Résultat : des réponses hallucinées dans 17 % à 33 % des cas selon l’outil, moins qu’un assistant généraliste, mais loin de zéro. La leçon vaut pour toute entreprise : concevoir en partant du principe que des erreurs resteront. Sources visibles, droit pour l’assistant de répondre « je ne sais pas », et une personne dans la boucle dès qu’une réponse déclenche une décision.

Évaluer un assistant RAG avant de s’engager

On le juge sur vos propres questions, avec des réponses vérifiées dans vos documents, avant de parler de déploiement. Une démonstration léchée sur les fichiers d’exemple du prestataire dit peu de chose de vos propres documents ; un test court et structuré comble ce manque.

  • Réunir 30 à 50 vraies questions auprès des futurs utilisateurs, y compris les plus pénibles : formulations floues, questions à cheval sur deux documents, questions dont la réponse n’est pas dans le corpus.
  • Écrire la réponse attendue et sa source pour chacune, avec les propriétaires des documents. C’est votre jeu de référence, à rejouer à chaque évolution.
  • Noter quatre points par réponse : est-elle juste, cite-t-elle le bon passage, l’assistant a-t-il refusé quand il le fallait, a-t-il laissé filer une information que le testeur n’avait pas le droit de voir.
  • Rejouer le test après chaque changement de modèle, de corpus ou de consigne. Un assistant fiable en juin peut dériver après une mise à jour.

Deux signaux justifient un arrêt net : des réponses sans source, et un assistant qui ne dit jamais qu’il ne sait pas. Dans les deux cas, les erreurs atteindront vos équipes sans que personne ne s’en aperçoive.

À quoi ressemble un premier projet

Les projets qui marchent commencent petit : une équipe, un corpus bien délimité, un endroit où les questions se posent déjà. Le service client qui répond à partir des fiches produits et des conditions de garantie, les commerciaux qui vérifient une clause de contrat, les nouveaux arrivants qui cherchent une procédure interne. Chaque cas a un propriétaire clair pour les documents et une manière simple de vérifier que les réponses sont justes.

La suite suit un chemin assez constant. Le corpus est nettoyé et connecté pour rester à jour automatiquement. Les droits d’accès sont repris de vos outils existants. L’assistant s’installe là où les gens travaillent déjà : messagerie, intranet ou outil de support. Chaque réponse est journalisée, pour qu’une erreur puisse être rattachée à un document ou à un défaut de recherche, et corrigée à la source. Notre offre d’assistant IA pour l’entreprise couvre ce parcours de bout en bout. Quand les documents sont trop sensibles pour un service d’IA public, la même architecture tourne sur un LLM privé hébergé en Europe, et quand le public est votre clientèle, la même recherche alimente un chatbot d’entreprise qui répond à partir de vos documents publics.

Deux points réglementaires entrent dans le plan dès le premier jour. Les données personnelles présentes dans les documents restent soumises au RGPD, droits de rectification et d’effacement compris (articles 16 et 17), ce qui est plus simple quand les faits vivent dans des documents plutôt que dans un modèle. Et quand des personnes dialoguent avec l’assistant, l’article 50 de l’AI Act impose qu’elles sachent qu’elles interagissent avec un système d’IA, sauf si c’est évident : notre guide de l’AI Act pour l’entreprise détaille ce que cela implique pour celle qui le déploie. Si l’assistant doit aussi agir dans vos outils, on passe du RAG à l’agent IA, et les questions de conception changent.

Le meilleur moyen de juger tout cela, c’est d’essayer. Posez une question difficile à notre démonstration d’assistant documentaire et regardez comment elle cite ses sources, puis une question que ses documents ne couvrent pas, pour la voir le reconnaître. Rien de ce que vous tapez n’est conservé. Si vous voulez la même chose sur vos propres fichiers, réservez votre audit gratuit de 30 minutes : on regarde votre corpus, les droits d’accès qu’il demande et les questions que vos équipes posent le plus, et on vous dit ce que demanderait un premier assistant. On vous répond sous un jour ouvré.

Questions fréquentes

C’est quoi un RAG en IA ?

C’est une architecture qui relie un modèle de langage à une base de documents interrogeable. À chaque question, le système retrouve d’abord les passages les plus pertinents, puis demande au modèle de rédiger sa réponse à partir de ces passages et de les citer. Le modèle garde sa maîtrise de la langue, mais les faits viennent de vos sources.

Quelle est la différence entre un LLM et un RAG ?

Le LLM est le modèle de langage lui-même : il écrit à partir de ce qu’il a appris à l’entraînement, qui s’arrête à une date et n’a jamais inclus vos fichiers internes. Le RAG est un dispositif construit autour du LLM : il ajoute une recherche dans vos documents, pour que le modèle réponde à partir d’informations à jour et propres à votre entreprise.

Le RAG supprime-t-il les hallucinations ?

Il les réduit sans les supprimer. Une étude préenregistrée publiée en 2024 sur des outils commerciaux de recherche juridique fondés sur le RAG a mesuré des réponses erronées dans 17 % à 33 % des cas. Afficher les sources, tester sur de vraies questions et autoriser l’assistant à dire qu’il ne sait pas gardent ces erreurs visibles.

Un assistant RAG peut-il respecter les droits d’accès ?

Oui, s’il est conçu pour. La recherche doit filtrer les passages selon les droits de la personne qui pose la question, en reprenant les permissions de vos outils documentaires. L’OWASP classe la faiblesse des contrôles d’accès dans les bases vectorielles parmi les principaux risques des applications RAG : c’est un point à vérifier avant tout déploiement.

Faut-il faire un RAG ou réentraîner un modèle ?

Pour répondre à partir des documents de l’entreprise, le RAG est en général le bon départ. Le réentraînement (fine-tuning) modifie la manière d’écrire d’un modèle, mais conserve mal des faits qui changent et ne montre jamais d’où vient une réponse. Avec le RAG, les faits restent dans des documents que vous pouvez corriger, supprimer ou restreindre.

Sources

  1. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, arXiv (article accepté à NeurIPS 2020), première version du 22 mai 2020, consulté le 2026-10-01.
  2. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, arXiv, version du 30 mai 2024, consulté le 2026-10-01.
  3. Lost in the Middle: How Language Models Use Long Contexts, arXiv (accepté dans Transactions of the Association for Computational Linguistics), première version du 6 juillet 2023, consulté le 2026-10-01.
  4. LLM08:2025 Vector and Embedding Weaknesses, OWASP Gen AI Security Project, consulté le 2026-10-01.
  5. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1), National Institute of Standards and Technology (États-Unis), juillet 2024, consulté le 2026-10-01.
  6. Règlement (UE) 2016/679 (règlement général sur la protection des données), EUR-Lex, Office des publications de l’Union européenne, publié le 4 mai 2016, consulté le 2026-10-01.
  7. Règlement (UE) 2024/1689 (règlement sur l’intelligence artificielle), EUR-Lex, Office des publications de l’Union européenne, publié le 12 juillet 2024, consulté le 2026-10-01.

Et chez vous ?

Décrivez le travail que vous voulez récupérer. On vous répond sous un jour ouvré.

Réponse sous un jour ouvré. Votre message sert uniquement à vous répondre. Confidentialité