La génération augmentée par récupération, plus connue sous son sigle anglais RAG (retrieval-augmented generation), est une façon de faire répondre une IA à partir de vos informations plutôt que de sa mémoire. Avant que le modèle rédige sa réponse, une étape de recherche retrouve les passages les plus pertinents dans vos documents (politique de livraison, guide des tailles, caractéristiques produits) et les lui transmet avec la question.
Vous rencontrerez surtout le RAG en tant qu'acheteur. Les outils de service client, les widgets de chat sur site et les applications du type « discutez avec vos documents » s'en servent pour répondre aux clients. Comprendre son fonctionnement vous aide à évaluer ces outils, à préparer vos contenus pour que les réponses soient justes, et à repérer les éditeurs qui promettent plus que la technique ne permet.
Qu'est-ce que le RAG ?
Un grand modèle de langage livré à lui-même écrit à partir de ce qu'il a appris pendant son entraînement. Il n'a jamais lu votre politique de retour : si une cliente demande « puis-je retourner un article soldé ? », il devine. Le RAG corrige cela en ajoutant deux étapes avant la réponse. La récupération retrouve les passages utiles de vos contenus, l'augmentation les insère dans le prompt. La génération rédige ensuite une réponse fondée sur eux.
Une image simple : sans RAG, le modèle passe un examen sans documents. Avec le RAG, il passe un examen à livre ouvert, et quelqu'un a déjà marqué les bonnes pages.
Ce que le RAG n'est pas :
- Pas un entraînement. Vos documents ne modifient pas le modèle. Ils sont consultés au moment de la question, ce qui veut dire qu'une politique mise à jour se reflète dès la réponse suivante.
- Pas du fine-tuning. Le fine-tuning réentraîne un modèle sur des exemples pour changer son style ou ses compétences. Le RAG change ce qu'il sait le temps d'une réponse. Pour des questions factuelles de service client, il est en général moins cher et plus facile à tenir à jour.
- Pas une garantie d'exactitude. Si la recherche remonte le mauvais passage, ou si vos documents se contredisent, la réponse peut rester fausse.
Vocabulaire associé : un embedding (ou plongement) est une suite de nombres qui représente le sens d'un texte ; une base vectorielle stocke ces embeddings et retrouve vite les plus proches ; un chunk est un court passage découpé dans un document plus long ; l'ancrage consiste à rattacher une réponse à une source. Des frameworks comme LangChain fournissent des briques toutes prêtes aux développeurs qui assemblent des systèmes RAG.
Pourquoi c'est important
Le RAG fait la différence entre un outil de support IA utile et un outil risqué. Un chatbot qui répond de mémoire inventera un délai de retour de 30 jours alors que le vôtre est de 14. Un outil fondé sur le RAG cite vos 14 jours, et les bons affichent la source.
Prenons une marque de cosmétiques qui reçoit 400 messages clients par mois. La moitié environ sont des questions récurrentes dont la réponse existe déjà quelque part : délais de livraison, ingrédients, mode d'emploi d'un sérum, utilisation d'un code promo. Chaque réponse prend environ 6 minutes, donc ces 200 messages représentent 20 heures par mois.
La marque branche un outil de service client qui applique le RAG sur sa FAQ, ses pages produits et ses conditions. L'outil règle 150 de ces 200 messages sans intervention humaine, et beaucoup d'outils de ce type facturent autour de 1 € par conversation résolue. Cela fait 150 € par mois pour 15 heures gagnées, soit 10 € de l'heure. Les 50 autres messages passent toujours par une personne, souvent avec un brouillon suggéré. Le calcul vaut le coup ou non selon la valeur que vous donnez à votre temps et la fréquence des erreurs de l'outil.
La qualité de vos documents devient la qualité de votre service client. Une page de livraison floue donne des réponses floues.
Comment ça marche
Un système RAG classique fonctionne en deux temps.
La préparation se fait une fois, puis à chaque modification de vos contenus :
- Rassembler les sources. Pages de FAQ, conditions, descriptions produits, PDF, anciennes réponses clients.
- Les découper en chunks de quelques centaines de mots, chacun centré sur un sujet.
- Transformer chaque chunk en embedding à l'aide d'un modèle dédié.
- Stocker ces embeddings dans une base vectorielle ou un index de recherche, avec un lien vers le texte d'origine.
La réponse se déroule à chaque question posée :
- Convertir la question en embedding avec le même modèle.
- Récupérer les chunks les plus proches, en général les 3 à 10 meilleurs. Beaucoup de systèmes combinent cette recherche par le sens avec une recherche classique par mots-clés, pour attraper les termes exacts comme un SKU ou un nom de produit.
- Construire le prompt : consignes, passages récupérés et question, souvent avec une règle du type « réponds uniquement à partir des sources ci-dessous, sinon dis que tu ne sais pas ».
- Générer la réponse et, dans les bons outils, indiquer les sources utilisées.
La forme la plus simple du RAG ne demande aucun développeur. Déposer vos conditions dans un projet ChatGPT ou dans un outil de prise de notes qui répond à partir de vos fichiers, c'est déjà un petit système RAG géré pour vous.
Repères et exemples
Quelques ordres de grandeur :
- Taux de résolution annoncés par les outils de support IA : généralement entre 30 % et 70 % des conversations entrantes. Les boutiques avec une FAQ claire et complète se situent en haut de la fourchette, celles dont la documentation est pauvre en bas.
- Tarification : par utilisateur, par conversation résolue (souvent 0,50 € à 1,50 €) ou incluse dans une offre supérieure.
- Temps de préparation pour une petite boutique : quelques heures pour nettoyer la FAQ, supprimer les conditions périmées et rédiger les réponses aux 20 questions les plus fréquentes si elles n'existent pas encore.
- Fraîcheur : elle dépend de la fréquence à laquelle l'outil relit vos contenus. Une fois par jour est courant. Vérifiez-le avant de modifier une politique.
Situations typiques : un créateur qui vend une formation à 149 € installe un widget de chat ancré sur le programme et les conditions de remboursement, pour que les prospects obtiennent une réponse à deux heures du matin. Une petite boutique de meubles fournit ses notices de montage en PDF à un outil qui répond aux questions de vis et de chevilles. Un vendeur avec 1 500 références utilise le RAG pour répondre aux questions techniques à partir de son catalogue, bien plus efficacement qu'un chatbot générique face à « le grand cabas est-il imperméable ? ».
Erreurs fréquentes
- Fournir des documents périmés ou contradictoires. Si l'ancienne politique dit 30 jours et la nouvelle 14, l'outil peut citer l'une ou l'autre.
- Croire que l'outil connaît les données en direct. La plupart des systèmes RAG cherchent dans des documents, pas dans votre stock ou le statut des commandes, sauf connexion spécifique prévue par l'éditeur.
- Oublier la règle du « je ne sais pas ». Sans elle, le modèle comble les trous par des inventions plausibles.
- Ne jamais lire les conversations. Le premier mois montre précisément quelles réponses sont fausses et quels documents manquent.
- Laisser le bot prendre des engagements. Remboursements, exceptions et gestes commerciaux doivent rester entre les mains d'une personne.
Bonnes pratiques
- Une source claire par sujet. Une seule page de livraison avec zones, tarifs et délais vaut mieux que trois pages partielles.
- Adoptez le format question-réponse. Des entrées de FAQ formulées comme vos clients posent leurs questions sont mieux retrouvées que de longs paragraphes.
- Écrivez les noms et codes exacts. Noms de produits, de variantes et SKU dans vos contenus facilitent la recherche par mots-clés.
- Exigez des sources citées. Choisissez des outils qui indiquent de quel document vient une réponse, pour que vous et vos clients puissiez vérifier.
- Définissez un relais humain. Listez les sujets qui passent toujours à une personne : colis abîmés, remboursements, réclamations.
- Relisez un échantillon chaque semaine. Lisez 20 conversations, corrigez les documents à l'origine des mauvaises réponses, et recommencez.
Dans Roctify
Roctify n'intègre ni assistant IA ni chatbot RAG. Ce que Roctify vous apporte, c'est la matière première dont un outil RAG a besoin : des descriptions produits claires, des variantes et des SKU réunis dans un catalogue partagé. Ajoutez vos conditions de livraison, de retour et vos questions fréquentes dans un document tenu à jour, et l'outil de support IA externe que vous choisissez dispose de bonnes sources. Les exports du plan Pro vous fournissent une liste de produits propre si l'outil vous demande d'importer votre catalogue.
Les emails clients se traitent dans la boîte de réception email de Roctify (à partir du plan Creator), où vous pouvez coller des réponses préparées avec un outil d'IA après les avoir vérifiées. Si vous avez besoin d'une connexion sur mesure entre les données de votre boutique et un système externe, ce type d'intégration se discute dans le cadre du plan Enterprise.
FAQ
Faut-il un développeur pour utiliser le RAG ?
Pas pour la plupart des petites boutiques. Beaucoup d'outils de service client et de chat intègrent le RAG et vous demandent seulement de pointer vers vos pages de FAQ ou de déposer vos documents. Un développeur devient utile si vous voulez connecter des données en direct, comme le stock ou le suivi des commandes, ou construire un assistant sur mesure.
Le RAG vaut-il mieux qu'un fine-tuning sur mes produits ?
Pour des questions factuelles sur vos conditions et vos produits, oui dans la plupart des cas. Le RAG coûte moins cher, se met à jour dès que vos documents changent et peut citer ses sources. Le fine-tuning sert plutôt à apprendre un style ou un format à un modèle, pas à garder des faits à jour.
Un chatbot RAG peut-il encore se tromper ?
Oui. Il peut remonter le mauvais passage, mal lire un passage correct ou répondre alors qu'aucune source ne couvre la question. Des documents clairs, une règle explicite du « je ne sais pas » et une relecture régulière des conversations limitent les erreurs, sans jamais les supprimer.