Une boucle de rétroaction, c’est quand la prédiction change les données qui serviront à la prochaine prédiction. Le modèle n’observe plus le monde. Il observe le monde après s’être mêlé du monde.
Un moteur de recommandation ne voit que ce qu’il a montré : les clics confirment ses choix, les contenus non montrés n’existent plus dans l’historique. Un modèle antifraude bloque des transactions : on ne saura jamais ce qu’elles seraient devenues, et les suivantes ressemblent à ce qu’on a laissé passer. Un score d’appétence décide qui est relancé : la conversion de ceux qu’on relance n’est plus comparable à celle du passé, où la relance était autre.
Ce n’est pas « le modèle se trompe ». C’est plus gênant : il peut avoir raison selon ses propres traces, et se tromper sur le phénomène.
Que vous voyez le piège avant le réentraînement. Beaucoup de systèmes pourrissent proprement : chaque cycle apprend la politique précédente, le score technique reste stable, le métier a l’impression que « ça tient ». En réalité, l’exploration a disparu.
La question à poser au cadrage : si nous suivons le modèle à 100 %, que cesserons-nous d’observer ? Si la réponse est « l’autre moitié du catalogue », « les dossiers qu’on refuse », « les clients qu’on ne contacte pas », vous avez une boucle.
« Donc il ne faut jamais réentraîner sur la production ? »
Si, souvent. Mais pas comme si c’était un échantillon innocent. Vous documentez comment les cas sont arrivés dans le fichier — sélectionnés par qui, bloqués par quoi — et vous gardez une fenêtre où le modèle ne décide pas seul.
La phrase qui reste : un modèle qui réussit trop à gouverner ses données n’apprend plus le monde, il s’apprend lui-même.