Comment gérez-vous la mémoire d’un agent ?

Questions d’entrevue Agents IA

Intermédiairememoirearchitecture

« Mémoire » désigne trois choses distinctes qu’il faut séparer avant de répondre, sinon la réponse est confuse.

1. La mémoire de travail : l’historique du tour

C’est le contexte de l’exécution en cours : objectif, appels d’outils, observations. Elle est reconstruite à chaque appel du modèle, qui est sans état.

Son problème est la croissance. Chaque tour ajoute une demande et un résultat, et les résultats d’outils sont souvent volumineux — une réponse d’API, le contenu d’un fichier. Au dixième tour, le contexte peut avoir décuplé, avec le coût et la latence qui suivent.

Les remèdes, du plus simple au plus élaboré :

  • Tronquer les résultats d’outils à l’essentiel avant de les insérer. Un outil qui renvoie 200 lignes doit en renvoyer 10 et signaler qu’il y en a plus.
  • Résumer les tours anciens en gardant les trois ou quatre derniers en clair.
  • Externaliser : écrire le résultat volumineux dans un fichier ou un stockage, ne garder qu’une référence, et laisser l’agent le relire s’il en a besoin. C’est la technique la plus efficace sur les tâches longues.

2. La mémoire persistante : ce qu’on retient entre sessions

Les préférences de l’utilisateur, les décisions prises, les faits appris. Elle ne vit pas dans le contexte mais dans une base, et on l’injecte au démarrage.

Les deux questions à trancher, et c’est là qu’un candidat montre son expérience :

Qu’écrit-on ? Tout enregistrer produit du bruit qui dégrade les sessions suivantes. Il faut un critère explicite — une préférence exprimée, une correction apportée par l’utilisateur, une contrainte durable — et non « tout ce qui a été dit ».

Comment corrige-t-on ? Une mémoire fausse est pire que pas de mémoire : elle se propage à toutes les sessions suivantes et devient invisible. Il faut pouvoir la lire, la modifier et l’effacer — donc l’exposer à l’utilisateur, pas la cacher dans une table.

3. La mémoire de récupération : ce qu’on va chercher

Les documents, les tickets passés, l’historique des conversations, interrogés à la demande par un outil de recherche. C’est du RAG, exposé à l’agent comme un outil parmi d’autres.

L’avantage sur l’injection au démarrage : le volume est illimité et le coût ne se paie que sur ce qui sert réellement.

Comment répondre en une phrase

Le contexte pour le tour en cours, une base pour ce qui doit survivre, un outil de recherche pour tout le reste. Et un principe : le contexte est une ressource rare et payante, pas un lieu de stockage. Tout ce qui peut être relu à la demande n’a pas à y séjourner.

Le piège que je signale

La tentation d’injecter la mémoire persistante entière à chaque démarrage. Après quelques semaines d’usage, cela représente des milliers de jetons payés à chaque session, dont l’essentiel est hors sujet — et le milieu de contexte étant mal exploité, une partie n’est même pas utilisée.

Toutes les questions Agents IA