Une étiquette proxy est une cible de substitution : ce que vous pouvez observer à la place de ce que vous vouliez décider. Le modèle l’optimise sincèrement. Le danger n’est pas qu’il échoue : c’est qu’il réussisse, et que cette réussite ne soit pas le succès métier.
Vous prédisiez « client satisfait ». Vous avez étiqueté « a laissé cinq étoiles », parce que c’était dans la table. Le modèle devient excellent à détecter les gens qui écrivent un avis. Ce n’est pas la satisfaction.
Vous prédisiez « candidat qui réussira au poste ». Vous avez étiqueté « a été embauché par le passé ». Le modèle apprend les habitudes de recrutement, y compris les biais. Ce n’est pas la réussite en poste.
Vous prédisiez « contenu utile ». Vous avez étiqueté « a été cliqué ». Le modèle apprend à capter l’attention, pas à informer.
Parce que le proxy est rarement une erreur de code. C’est une erreur de traduction entre le métier et le fichier. Elle survit à toutes les revues techniques : le score monte, les graphiques sont propres, personne n’a l’air incompétent. Elle se révèle quand quelqu’un agit sur la prédiction et que le monde ne s’améliore pas.
La question à poser au cadrage, avant tout entraînement : si le modèle était parfait sur cette étiquette, serions-nous contents ? Si la réponse hésite, vous n’avez pas encore la cible.
« On n’a pas le choix, la vraie étiquette arrive dans six mois. »
C’est fréquent, et ce n’est pas une autorisation de faire semblant. Vous entraînez sur le proxy, vous le dites, et vous prévoyez dès le premier jour le raccord avec la vérité quand elle arrivera. Sinon vous aurez un modèle champion d’une question que plus personne ne pose.
La formulation honnête : un bon score sur une mauvaise cible est une dette, pas une victoire.