Qu'est-ce qu'un RAG, expliqué simplement
Imaginez un assistant qui, à chaque question, va d'abord chercher les bons documents dans votre base interne, lit les passages pertinents, puis vous formule une réponse en s'appuyant explicitement sur ces passages. C'est exactement ce que fait un RAG.
Sous le capot, deux étapes : la recherche (retrieval) qui sélectionne les passages les plus proches de la question dans une base vectorielle, et la génération (generation) qui demande au LLM de produire une réponse en utilisant uniquement ces passages comme contexte. La sortie peut inclure les sources, ce qui rend la réponse vérifiable.
Le RAG répond à un problème concret : un LLM seul ne connaît pas vos documents internes, ne peut pas les apprendre sans entraînement coûteux, et hallucine quand on lui pose des questions sur un sujet qu'il ne connaît pas. Le RAG résout les trois problèmes en injectant la connaissance fraîche au moment de la requête.