Qu’est-ce que le RAG, et quand le préférer à l’affinage ?

Questions d’entrevue LLM et IA générative

Intermédiaireragarchitecture

La génération augmentée par récupération consiste à chercher les passages pertinents dans une base documentaire, puis à les fournir au modèle avec la question. Le modèle ne se souvient pas : il lit.

La chaîne, étape par étape

  1. Indexation, hors ligne : découper les documents en passages, calculer un plongement pour chacun, les stocker dans un index vectoriel.
  2. Récupération : plonger la question, retrouver les k passages les plus proches.
  3. Réordonnancement, souvent : repasser ces k candidats dans un modèle plus précis pour garder les trois ou cinq meilleurs.
  4. Génération : composer une invite contenant les passages retenus et la question, avec la consigne de s’y limiter et de citer.

Pourquoi c’est la réponse par défaut à un besoin de connaissance

  • La base se met à jour sans réentraîner. Un document corrigé ce matin est utilisé cet après-midi.
  • Les réponses sont citables, donc vérifiables par l’utilisateur. C’est souvent la vraie exigence métier.
  • Les droits d’accès restent applicables : on filtre l’index selon l’utilisateur. Impossible à faire avec un modèle qui a mémorisé les documents.
  • On peut retirer un document. Un modèle affiné sur des données qu’il faut effacer est un problème juridique ; un index, on le purge.

Ce que l’affinage fait mieux

  • La forme et le format : un ton, une structure de sortie, un style de rédaction maison.
  • Le vocabulaire spécialisé que le modèle segmente mal.
  • Une tâche répétitive et étroite, où l’on veut supprimer une longue invite d’instructions : c’est un gain de latence et de coût réel.
  • Un comportement qu’aucune consigne n’obtient de façon stable.

La formule qui répond à la question

Le RAG pour ce que le modèle doit savoir ; l’affinage pour la façon dont il doit se comporter. Et les deux se combinent : un modèle affiné sur le format des réponses, alimenté par un index à jour, est une architecture courante.

L’erreur classique en entretien

Proposer l’affinage pour « apprendre la documentation interne à l’assistant ». Ça ne fonctionne pas de façon fiable : l’affinage ne construit pas un rappel factuel interrogeable, il ne permet pas de citer, il périme à chaque mise à jour, et il coûte cher à répéter. C’est le cas d’usage type du RAG, et se tromper ici est disqualifiant sur un poste d’ingénierie.

Là où le RAG échoue

Il faut savoir le dire, sinon la réponse paraît naïve. Le RAG répond mal aux questions agrégatives — « combien de contrats mentionnent cette clause » — parce que la récupération ramène quelques passages, pas un décompte : cela relève d’une requête structurée. Il échoue aussi quand la réponse exige de recouper des dizaines de documents, et quand la question est mal formulée au point que la recherche part dans la mauvaise direction. Sa qualité est bornée par celle de la récupération, et c’est là que se passe la majorité du travail réel.

Toutes les questions LLM et IA générative