Définition courte
Le RAG (Retrieval-Augmented Generation) est une architecture IA qui combine un moteur de recherche sur une base documentaire privée avec un grand modèle de langage. Le LLM répond à partir des documents internes de l'entreprise, ce qui réduit les hallucinations et préserve la confidentialité des données.
Définition détaillée
Le RAG est la réponse standard aux deux faiblesses des LLM en entreprise : ils inventent (hallucinations) et ils ne connaissent pas les données privées. Son principe : avant de répondre, le système recherche les documents pertinents dans une base interne (vectorisée pour la recherche sémantique), puis transmet ces extraits au LLM avec la question. Le modèle répond à partir de ces sources, et cite ses références. Le RAG préserve la confidentialité (les documents ne quittent pas l'infrastructure de l'entreprise) et améliore drastiquement la fiabilité des réponses. Cas d'usage typiques : assistant interne de documentation, recherche réglementaire, support client de niveau 1, recherche jurisprudentielle, onboarding collaborateurs. Le RAG demande un travail de qualification des données souvent sous-estimé : 70 % de l'effort est sur les documents, pas sur le modèle.
Exemple terrain
Un cabinet d'expertise a déployé un RAG sur 12 000 documents internes. L'équipe junior gagne en moyenne 1 h 30 par jour sur la recherche documentaire.
Erreur fréquente
Croire que le RAG résout tout sans nettoyer la base documentaire. Données sales = réponses inutiles.