Qu’est-ce qu’une boucle de rétroaction en ML ?

Questions d’entrevue Machine learning

Seniormethodologieproduction

La réponse courte

Une boucle de rétroaction, c’est quand la prédiction change les données qui serviront à la prochaine prédiction. Le modèle n’observe plus le monde. Il observe le monde après s’être mêlé du monde.

Un moteur de recommandation ne voit que ce qu’il a montré : les clics confirment ses choix, les contenus non montrés n’existent plus dans l’historique. Un modèle antifraude bloque des transactions : on ne saura jamais ce qu’elles seraient devenues, et les suivantes ressemblent à ce qu’on a laissé passer. Un score d’appétence décide qui est relancé : la conversion de ceux qu’on relance n’est plus comparable à celle du passé, où la relance était autre.

Ce n’est pas « le modèle se trompe ». C’est plus gênant : il peut avoir raison selon ses propres traces, et se tromper sur le phénomène.

Ce que l’intervieweur vérifie

Que vous voyez le piège avant le réentraînement. Beaucoup de systèmes pourrissent proprement : chaque cycle apprend la politique précédente, le score technique reste stable, le métier a l’impression que « ça tient ». En réalité, l’exploration a disparu.

La question à poser au cadrage : si nous suivons le modèle à 100 %, que cesserons-nous d’observer ? Si la réponse est « l’autre moitié du catalogue », « les dossiers qu’on refuse », « les clients qu’on ne contacte pas », vous avez une boucle.

Ce qu’on met en face, sans recette unique

  • Réserver du hasard. Une petite part du trafic reçoit une décision neutre, ancienne, ou tirée. C’est cher. C’est le prix pour continuer à voir le monde.
  • Séparer prédiction et politique. Le score peut être partout ; l’action, non. On journalise ce qu’on aurait fait, y compris quand on n’a pas agi.
  • Ne pas réentraîner aveuglément sur le journal de production. Ce journal est déjà un effet du modèle. L’utiliser tel quel, c’est distiller sa propre politique.

La relance probable

« Donc il ne faut jamais réentraîner sur la production ? »

Si, souvent. Mais pas comme si c’était un échantillon innocent. Vous documentez comment les cas sont arrivés dans le fichier — sélectionnés par qui, bloqués par quoi — et vous gardez une fenêtre où le modèle ne décide pas seul.

La phrase qui reste : un modèle qui réussit trop à gouverner ses données n’apprend plus le monde, il s’apprend lui-même.

Toutes les questions Machine learning