Variables explicatives et variable cible

44 min
Bloc 1 — Le vocabulaire fondamental
Objectif
savoir définir rigoureusement la variable explicative et la variable cible, maîtriser leurs synonymes concurrents et la discipline dont chacun provient, formaliser une observation comme un vecteur de caractéristiques dans un espace de dimension p, et appliquer les critères professionnels qui déterminent si une colonne disponible peut légitimement être soumise à un modèle.
Durée estimée
40 minutes
Prérequis
chapitres 001 à 005
Quiz associés
006.1-quiz-relation-features-target.md à 006.7-quiz-etudes-de-cas.md

1. La structure d'un problème supervisé : FEATURES → MODÈLE → TARGET

1.1 La formule mentale

Tout problème d'apprentissage supervisé, quel que soit le domaine applicatif, l'algorithme retenu ou le volume de données, se ramène à une structure unique :

Cette formule est à retenir littéralement. Elle porte trois engagements méthodologiques :

  1. Ce qui est à gauche est connu au moment de la prédiction. Une variable placée en entrée qui ne sera pas disponible à l'instant où la prédiction doit être produite invalide le dispositif entier. Ce point constitue le critère de sélection premier, développé au point 6.
  2. Ce qui est à droite est ce que l'on cherche à obtenir. La variable cible n'est jamais fournie au modèle en phase de prédiction : c'est précisément sa valeur qui est demandée.
  3. La flèche n'est pas une relation causale. Elle exprime une association statistique exploitée à des fins de prédiction. La distinction entre corrélation et causalité est traitée au chapitre 016.

1.2 Les deux régimes de fonctionnement

La même structure se lit différemment selon la phase. C'est la source de confusion la plus fréquente chez les débutants.

PhaseVariables explicativesVariable cibleCe qui est produit
ApprentissageConnues, fourniesConnue, fournieLe modèle
ValidationConnues, fourniesConnue mais masquée au modèle, utilisée pour comparerUne mesure de performance
Prédiction en productionConnues, fourniesInconnueUne estimation ŷ
Surveillance a posterioriConnuesObservée après coup, avec délaiUne mesure de dérive

Point de vigilance : en phase d'apprentissage, la cible est présente dans le jeu de données au même titre que les autres colonnes. Elle n'en est pas moins d'une nature fonctionnelle radicalement différente. La confondre avec une colonne ordinaire, ou omettre de la retirer des entrées, produit un modèle qui prédit parfaitement en apprentissage et qui est inutilisable en production.

ANALOGIE — Le détective et ses indices

Un enquêteur ne dispose jamais de la réponse. Il dispose d'indices : une empreinte, un horaire, un témoignage, une trace bancaire. Chaque indice est une information partielle, incomplète, parfois trompeuse. L'enquêteur ne peut raisonner que sur ce qu'il a collecté.

Les variables explicatives sont exactement ces indices : ce sont les seules informations que le modèle possède pour se prononcer. La variable cible est l'identité du coupable, c'est-à-dire ce que l'enquête doit établir.

Trois conséquences de cette analogie, toutes exactes techniquement :

  • Un indice indisponible n'existe pas. Un enquêteur ne peut pas fonder sa déduction sur une vidéosurveillance qui n'a jamais été installée. Un modèle ne peut pas utiliser une variable qui ne sera pas renseignée au moment de la prédiction.
  • Un indice postérieur au crime n'est pas un indice, c'est un aveu. Si l'enquêteur « déduit » l'identité du coupable à partir de la confession signée, il ne déduit rien. C'est le mécanisme de la fuite de données, traité au chapitre 028.
  • La qualité des indices détermine la qualité de l'enquête, davantage que la méthode d'interrogatoire. Ce point est développé au point 6.8.

2. La variable explicative

2.1 Définition

DÉFINITION — Variable explicative (feature, caractéristique)

Définition rigoureuse

Grandeur mesurée ou construite, associée à chaque observation d'un jeu de données, dont les valeurs sont soumises au modèle en entrée et à partir desquelles celui-ci produit une estimation de la variable cible.

Formulation équivalente en théorie de l'apprentissage

Composante du vecteur d'entrée x appartenant à l'espace des caractéristiques 𝒳, sur lequel est définie la fonction de prédiction f : 𝒳 → 𝒴 que l'algorithme d'apprentissage sélectionne dans une classe d'hypothèses.

Traduction en langage courant

Une information que l'on donne à la machine pour l'aider à répondre.

Nature du concept

La variable explicative désigne un rôle fonctionnel, non un type de donnée. Une colonne n'est pas une variable explicative par nature : elle le devient par une décision de conception, révocable. La même colonne peut être explicative dans un projet, cible dans un autre, exclue dans un troisième. Ce point est développé au point 4.4.

Point de vigilance

Le terme explicative est trompeur pris au pied de la lettre. Une variable explicative n'explique rien au sens causal : elle apporte une information statistiquement associée à la cible. Une variable fortement prédictive peut n'entretenir aucun lien causal avec la cible et n'être qu'un indicateur indirect d'une cause commune non observée.

2.2 Ce qu'une variable explicative n'est pas

Énoncé courantStatutJustification
« Toute colonne du fichier est une feature »IncorrectLes identifiants, la cible et les variables de fuite en sont exclus (chapitre 005, point 3.2)
« Une feature explique la cible »Incorrect au sens strictElle est associée à la cible ; l'explication causale relève d'un autre cadre méthodologique (chapitre 016)
« Une feature doit être numérique »IncorrectElle peut être catégorielle, temporelle ou textuelle ; l'encodage numérique est une étape ultérieure (chapitres 022 et 023)
« Plus il y a de features, meilleur est le modèle »IncorrectAu-delà d'un seuil, l'ajout de variables dégrade la performance en généralisation (chapitres 025 et 031)
« Une feature est fournie par les données »Partiellement inexactUne part importante des variables les plus prédictives est construite, non relevée (chapitre 024)

2.3 La taxonomie des synonymes

Le domaine agrège du vocabulaire issu de disciplines distinctes, chacune ayant forgé son propre terme pour le même objet. Les dénominations ci-dessous sont strictement équivalentes en pratique ; elles diffèrent par leur origine, leur registre et les connotations qu'elles véhiculent.

TermeDiscipline d'origineConnotation propreRegistre d'usage actuel
FeatureReconnaissance de formes et vision par ordinateurGrandeur extraite du signal brut, éventuellement construiteDominant en Machine Learning, y compris en français professionnel
CaractéristiqueTraduction française de featureIdentique à featureRecommandé à l'écrit en français ; usage oral minoritaire
Variable explicativeStatistique appliquée, modélisationSuggère une contribution à l'explication du phénomèneStandard académique francophone
Variable indépendanteStatistique expérimentale, plan d'expérience, psychologie expérimentale (héritage de Fisher, 1935)Suggère une variable manipulée par l'expérimentateurFréquent mais problématique en ML (point 4)
Variable d'entrée, inputAutomatique, théorie des systèmes, ingénierieNeutre : ce qui entre dans la boîteTrès courant, sans ambiguïté
Prédicteur, predictorStatistique appliquée, littérature de la régressionSouligne la finalité prédictive plutôt qu'explicativeCourant, particulièrement adapté au cadre du ML
RégresseurÉconométrieTerme du modèle de régression, associé à un coefficientRéservé aux modèles paramétriques linéaires
Covariable, covariateBiostatistique, épidémiologie, essais cliniquesVariable dont on ajuste l'effet pour isoler celui d'un traitementStandard en recherche clinique
AttributApprentissage symbolique, fouille de données, bases de données relationnelles (Quinlan, 1986)Propriété descriptive d'une entitéVieilli en ML, vivant en bases de données
DescripteurChimiométrie, chémoinformatiqueGrandeur calculée décrivant une structureSpécialisé
Variable exogèneÉconométrie structurelleDéterminée hors du système modéliséSpécialisé, à forte charge théorique
FacteurPlans d'expérience, analyse de la varianceVariable catégorielle contrôléeAmbigu : signifie autre chose en analyse factorielle

Recommandation professionnelle. À l'écrit en français, employer variable explicative ou caractéristique. À l'oral et dans le code, feature est l'usage établi et n'a pas à être évité. En contexte de communication avec des interlocuteurs métier, variable d'entrée ou information fournie au modèle sont les formulations les plus immédiatement comprises. Éviter variable indépendante pour les raisons exposées au point 4.

DÉFINITION — Prédicteur (predictor)

Définition rigoureuse

Variable dont les valeurs sont utilisées pour estimer celles d'une autre variable, indépendamment de toute prétention explicative ou causale.

Intérêt du terme

C'est le terme le plus honnête épistémologiquement pour le Machine Learning : il nomme exactement ce qui est recherché, à savoir un pouvoir prédictif, sans suggérer une compréhension du mécanisme sous-jacent.

Point de vigilance

Ne pas confondre prédicteur au sens de variable d'entrée, et prédicteur au sens de modèle entier, acception rencontrée dans la littérature anglophone où a predictor désigne parfois le système de prédiction complet. Le contexte lève l'ambiguïté ; en français, réserver le terme à la variable.

DÉFINITION — Régresseur et covariable

Régresseur (économétrie)

Variable figurant au membre droit d'une équation de régression, associée à un coefficient estimé. Dans le modèle y = β₀ + β₁x₁ + … + βp\beta_p xpx_p + ε, les xjx_j sont les régresseurs et la variable expliquée y est le régressande.

Le terme est indissociable d'un modèle paramétrique explicite. Parler de « régresseurs » à propos d'une forêt aléatoire est un abus de langage : aucun coefficient n'y est associé à une variable.

Covariable (biostatistique)

Variable mesurée dont l'effet est pris en compte dans le modèle afin d'isoler l'effet d'une variable d'intérêt, typiquement un traitement. Dans un essai clinique évaluant un médicament, l'âge et le sexe des patients sont des covariables : ils ne sont pas l'objet de l'étude mais influencent l'issue.

Point de vigilance

Le vocabulaire de la covariable présuppose une hiérarchie entre variables : une variable d'intérêt, des variables d'ajustement. Cette hiérarchie n'existe pas en Machine Learning prédictif, où toutes les variables explicatives ont le même statut fonctionnel. Reprendre ce vocabulaire dans un projet de ML importe une structure conceptuelle sans objet.

2.4 Les deux acceptions du mot feature

Le terme est employé dans la littérature avec deux portées différentes, dont la confusion est une source d'erreur réelle.

AcceptionCe qu'elle désigneExemple
Acception largeToute colonne descriptive du jeu de données, indépendamment de son usagedate_souscription est une « feature du dataset »
Acception stricteToute entrée effectivement soumise au modèle après préparationanciennete_jours, dérivée de date_souscription, est une feature du modèle

L'écart entre les deux acceptions est exactement le périmètre du feature engineering (chapitre 024) et de la feature selection (chapitre 025).

Conséquence de notation : le nombre de variables explicatives p d'un modèle n'est presque jamais égal au nombre de colonnes du fichier d'origine. Formuler « mon jeu de données a 14 features » sans préciser l'acception est une source d'incompréhension entre praticiens.


3. La variable cible

3.1 Définition

DÉFINITION — Variable cible (target, variable à prédire)

Définition rigoureuse

Grandeur dont la valeur est inconnue au moment où le système doit se prononcer, et dont l'estimation constitue la finalité du modèle. En apprentissage supervisé, sa valeur observée est disponible pour les observations du jeu d'entraînement, ce qui autorise la constitution d'un signal d'erreur et donc l'apprentissage.

Position dans le formalisme

Élément y de l'espace de sortie 𝒴. Le couple (x, y) constitue un exemple étiqueté ; l'ensemble d'entraînement est une collection de tels couples supposés issus d'une distribution jointe P(X, Y) inconnue et fixe.

Traduction en langage courant

Ce que l'on veut que la machine devine.

Le critère discriminant de l'apprentissage supervisé

C'est l'existence d'une variable cible observée qui définit l'apprentissage supervisé et le sépare de l'apprentissage non supervisé (chapitre 003). En l'absence de cible, il n'existe aucun signal d'erreur, donc rien à minimiser, donc aucun apprentissage supervisé possible.

Point de vigilance

La variable cible n'est pas donnée par la nature. Elle est construite par une décision de conception qui fixe ce qui compte comme le phénomène à prédire et à quel horizon. Ce point est développé au point 3.4.

3.2 La taxonomie des synonymes

TermeDiscipline d'originePortée particulièreRegistre d'usage
Target, cibleMachine Learning anglophoneNeutre, tout type de cibleDominant
Variable cibleTraduction françaiseIdentiqueStandard francophone
Variable dépendanteStatistique expérimentale, psychologie expérimentaleSuggère une dépendance causale envers les variables manipuléesFréquent, problématique en ML (point 4)
Variable réponse, response variableStatistique, méthodologie des plans d'expérienceCe qui répond à une variation contrôlée des entréesStandard académique
Variable expliquée, variable à expliquerStatistique et économétrie francophonesSymétrique de « variable explicative »Courant en français
Variable endogène, régressandeÉconométrie structurelleDéterminée à l'intérieur du système modéliséSpécialisé
Sortie, outputAutomatique, théorie des systèmesNeutre : ce qui sort de la boîteTrès courant
Label, étiquetteApprentissage supervisé, annotation de donnéesRestreint aux cibles catégoriellesDominant en classification
ClasseReconnaissance de formes, classificationUne modalité particulière du labelDominant en classification
Vérité terrain, ground truthTélédétection, puis vision par ordinateurLa valeur de référence tenue pour vraie, par opposition à la prédictionStandard en annotation
Étalon de référence, gold standardBiostatistique, diagnostic médicalLa procédure de référence servant à établir la valeur vraieStandard en médecine
Variable critèrePsychométrie, sélection du personnelLe résultat que le dispositif cherche à prédireSpécialisé
DÉFINITION — Label (étiquette)

Définition rigoureuse

Valeur catégorielle attribuée à une observation, désignant son appartenance à l'une des modalités d'un ensemble fini de classes prédéfinies.

Le point discriminant

Label n'est pas un synonyme exact de target. Tout label est une cible, toute cible n'est pas un label.

Type de problèmeCiblePeut-on dire « label »
Classification binaire : fraude / normalCatégorielle à 2 modalitésOui
Classification multiclasse : chat / chien / chevalCatégorielle à k modalitésOui
Régression : prix en eurosNumérique continueNon, par convention d'usage

Traduction en langage courant

L'étiquette collée sur l'exemple : « ceci est un spam », « ceci est une fraude ».

Point de vigilance

L'expression données étiquetées (labeled data) est employée dans la littérature pour désigner tout jeu de données comportant une cible observée, y compris en régression. L'usage est donc plus large que la définition stricte du label. Le chapitre 007 précise l'articulation entre label, classe et codage numérique.

DÉFINITION — Vérité terrain (ground truth)

Définition rigoureuse

Valeur de la variable cible tenue pour exacte, établie par une procédure de référence indépendante du modèle, et servant de référentiel pour l'apprentissage et l'évaluation.

Origine du terme

L'expression provient de la télédétection : la validation des interprétations d'images satellitaires exigeait des relevés effectués sur le terrain, au sol.

Point de vigilance majeur

La vérité terrain n'est pas la vérité. C'est une mesure, produite par un protocole faillible : annotation humaine sujette à désaccord, diagnostic médical imparfait, transaction frauduleuse non détectée et donc étiquetée « normale ». La performance mesurée d'un modèle est bornée par la qualité de l'étiquetage. Un modèle ne peut apprendre correctement une distinction que ses étiquettes n'encodent pas correctement.

Conséquence opérationnelle

Avant d'imputer une contre-performance à l'algorithme, vérifier le protocole d'étiquetage : qui a étiqueté, selon quelle définition, avec quel taux d'accord inter-annotateurs.

3.3 Unicité et pluralité de la cible

ConfigurationStructure de la cibleDénominationRenvoi
Une seule colonne cible, valeur unique par observationy ∈ ℝ ou y ∈ {c₁, …, ckc_k}Cas standardChapitre 010
Une observation peut appartenir à plusieurs classes simultanémenty ∈ {0,1}k\{0,1\}^kClassification multilabelChapitre 011
Plusieurs cibles numériques prédites conjointementy ∈ Rm\mathbb{R}^mRégression multi-sortiesChapitre 048
Cible catégorielle à modalités ordonnéesy ∈ {c₁ < … < ckc_k}Classification ordinaleChapitre 011

Point de vigilance : la présence de plusieurs colonnes candidates au rôle de cible dans un fichier n'autorise pas à les traiter comme une cible unique. Deux cibles distinctes définissent deux problèmes distincts, exigeant chacun leur modèle, leurs métriques et leur validation.

3.4 La cible est une construction, non une donnée naturelle

Aucun système opérationnel ne produit spontanément une colonne nommée « a_resilie ». Cette colonne résulte d'une chaîne de décisions explicites.

DécisionEffet sur le projet
Définition de l'événementDétermine le taux de positifs, donc le degré de déséquilibre (chapitre 050)
Horizon temporelDétermine la difficulté du problème et l'utilité opérationnelle de la prédiction
Population concernéeDétermine le périmètre de validité du modèle et les biais de sélection
Date d'observationDétermine quelles variables explicatives sont légitimement disponibles (point 6.1)

Principe directeur : une variable cible mal définie ne peut être compensée par aucun raffinement algorithmique. La formalisation de la cible est la première étape du cycle de vie d'un projet (chapitre 012), et elle relève d'une discussion avec le métier, non d'une décision technique.


4. Variable dépendante et variable indépendante

4.1 Origine de la terminologie

DÉFINITION — Variable indépendante et variable dépendante

Définition rigoureuse dans le cadre expérimental d'origine

Dans un plan d'expérience, la variable indépendante est la grandeur dont l'expérimentateur fixe délibérément les valeurs, indépendamment de tout autre facteur du dispositif ; la variable dépendante est la grandeur mesurée dont on cherche à établir si elle varie en fonction de la première.

Contexte historique

Cette terminologie provient de la méthodologie expérimentale formalisée par Ronald Fisher (The Design of Experiments, 1935) et diffusée par la psychologie expérimentale. Elle suppose un dispositif dans lequel l'expérimentateur manipule une variable, contrôle les autres et randomise l'affectation des unités, ce qui autorise une inférence causale.

Traduction en langage courant

Ce que l'on règle soi-même, et ce que l'on observe en conséquence.

Point de vigilance

Ces conditions ne sont pratiquement jamais réunies en Machine Learning appliqué, qui opère sur des données observationnelles collectées sans plan d'expérience. Le vocabulaire subsiste, sa justification a disparu.

4.2 Pourquoi cette terminologie est trompeuse en Machine Learning

DifficultéCe que le terme suggèreCe qu'il en est en Machine Learning
Indépendance statistiqueLes variables explicatives seraient indépendantes entre ellesElles sont presque toujours corrélées entre elles. La corrélation forte entre variables explicatives porte un nom, la multicolinéarité, et constitue un problème traité au chapitre 017
Manipulation expérimentaleL'analyste fixerait les valeurs des variables d'entréeElles sont observées, non manipulées. Personne ne « fixe » l'âge d'un client ou la surface d'un logement
Dépendance causaleLa cible varierait à cause des variables d'entréeLe modèle capte une association. L'inférence causale exige un cadre spécifique, non un modèle prédictif (chapitre 016)
Propriété intrinsèqueUne variable serait indépendante ou dépendante par natureLe statut est un rôle assigné par le projet, réversible d'un projet à l'autre
Symétrie logiqueUne seule lecture serait possibleLe sens de la flèche est un choix de conception, contraint par la disponibilité temporelle, non par la logique

Le contresens le plus fréquent : conclure que les variables explicatives doivent être indépendantes entre elles parce qu'elles sont appelées « indépendantes ». L'exigence d'absence de forte colinéarité existe pour certains modèles paramétriques, mais elle n'a aucun rapport avec l'origine du terme, qui renvoie à l'indépendance vis-à-vis du dispositif expérimental, non entre variables.

4.3 Le rôle est fonctionnel, non intrinsèque

Une même grandeur change de rôle selon la question posée. La colonne ne change pas ; le projet change.

GrandeurProjet où elle est cibleProjet où elle est explicative
Montant d'une transactionPrévision du panier moyenDétection de fraude bancaire
Note de satisfaction clientPrédiction de la satisfaction post-appelPrédiction de l'attrition
Durée d'hospitalisationPlanification de la capacité hospitalièrePrédiction du risque de réadmission
Température d'un roulementPrévision thermique d'un équipementDétection d'une panne imminente
SalaireEstimation salariale à l'embaucheScore d'octroi de crédit

4.4 Recommandation terminologique

SituationFormulation recommandéeFormulation à éviter
Rapport technique en françaisVariables explicatives / variable cibleVariables indépendantes / dépendante
Code et documentation techniquefeatures / target, X / y
Présentation à un public métierInformations fournies / valeur à prédireTout terme statistique non traduit
Article scientifique en statistiquePrédicteurs / variable réponse
Entretien d'embaucheVariables explicatives, en signalant la connaissance des synonymesEmploi d'un seul terme sans recul

Position professionnelle attendue : connaître les synonymes, savoir les traduire d'un registre à l'autre, et savoir expliquer pourquoi variable indépendante est un héritage inadapté au cadre observationnel du Machine Learning.


5. Vecteur de caractéristiques et espace des caractéristiques

5.1 De la ligne au vecteur

DÉFINITION — Vecteur de caractéristiques (feature vector)

Définition rigoureuse

Représentation d'une observation sous forme d'un p-uplet ordonné de valeurs, une par variable explicative retenue :

x=(x1,x2,,xp)Rp\displaystyle x = (x_{1}, x_{2}, \dots , x_p)^{\top} \in \mathbb{R} ^p

où p désigne le nombre de variables explicatives et xjx_j la valeur prise par la j-ième variable pour cette observation.

Trois propriétés contraignantes

  1. L'ordre est fixé et signifiant. La j-ième composante correspond toujours à la même variable, pour toutes les observations. Une permutation entre l'entraînement et la prédiction produit des prédictions numériquement valides et sémantiquement absurdes.
  2. La dimension est constante. Toutes les observations sont décrites par le même nombre de composantes. Une observation à laquelle il manque une variable ne peut être traitée telle quelle : elle exige une imputation ou une exclusion (chapitre 019).
  3. Les composantes sont numériques. Les variables catégorielles doivent avoir été encodées au préalable (chapitre 022).

Traduction en langage courant

Une ligne du tableau, réduite aux colonnes utiles et convertie en une suite de nombres.

DÉFINITION — Matrice de conception (design matrix, X)

Définition rigoureuse

Matrice X ∈ Rn×p\mathbb{R}^{\text{n×p}} dont la i-ième ligne est le vecteur de caractéristiques xᵢᵀ de la i-ième observation et la j-ième colonne le vecteur des valeurs prises par la j-ième variable explicative sur les n observations.

Le vecteur cible associé est y ∈ Yn\mathcal{Y}^n, où 𝒴 = ℝ en régression et 𝒴 = {c₁, …, ckc_k} en classification.

Origine du terme

Design matrix provient de la littérature des plans d'expérience, où les lignes de la matrice décrivaient la configuration expérimentale de chaque essai. Le terme est conservé en régression et en apprentissage statistique.

Convention de notation

X majuscule pour la matrice, y minuscule pour le vecteur cible : la casse signale la différence de dimensionnalité, deux dimensions contre une. Cette convention est universelle dans la littérature et dans les bibliothèques logicielles.

ObjetNotationDimensionContenu
Jeu d'entraînement(X, y)n couples (observation, cible)
Matrice des variables explicativesXn × pValeurs numériques
Vecteur cibleynUne valeur par observation
Vecteur de caractéristiques d'une observationxᵢpLa ligne i de X
Valeur d'une variable pour une observationxijx_{ij}scalaireCellule (i, j)
Vecteur d'une variable sur tout le jeuX[:, j]nLa colonne j de X
Prédiction pour une observationŷᵢscalaire ou vecteurSortie du modèle

5.2 Séparation de X et de y en pratique

python
import pandas as pd

df = pd.read_csv("clients_telecom.csv")

cible = "a_resilie"
identifiants = ["client_id"]

X = df.drop(columns=[cible] + identifiants)
y = df[cible]

print("X :", X.shape)
print("y :", y.shape)
print()
print(X.dtypes)
X : (10000, 7)
y : (10000,)

age                    int64
anciennete_mois        int64
type_forfait             str
engagement               str
facture_mensuelle    float64
nb_appels_support      int64
satisfaction         float64
dtype: object

Interprétation. Le jeu comporte n = 10 000 observations. La matrice X comporte sept colonnes, la cible et l'identifiant ayant été retirés. La forme de y, (10000,), confirme qu'il s'agit d'un vecteur à une dimension et non d'une matrice à une colonne : cette distinction est source d'avertissements et d'erreurs dans plusieurs bibliothèques.

Point de vigilance : df.drop(columns=[cible]) doit être écrit avant toute autre transformation. Toute étape de préparation calculée sur un jeu contenant encore la cible expose à une fuite (chapitre 028).

5.3 Le vecteur de caractéristiques d'une observation

python
print(X.iloc[0])
age                       49
anciennete_mois           80
type_forfait          Mobile
engagement           12_mois
facture_mensuelle      43.81
nb_appels_support          3
satisfaction             4.0
Name: 0, dtype: object

Cette ligne n'est pas encore un vecteur de Rp\mathbb{R}^p : deux composantes sont textuelles. L'encodage des variables catégorielles produit la représentation numérique effectivement soumise au modèle.

python
X_encode = pd.get_dummies(X, columns=["type_forfait", "engagement"])
X_num = X_encode.astype(float)

print("Nombre de colonnes avant encodage :", X.shape[1])
print("Nombre de colonnes après encodage :", X_encode.shape[1])
print(list(X_encode.columns))
print("Type :", X_num.to_numpy().dtype, "| forme :", X_num.to_numpy().shape)
print("Vecteur de caractéristiques de la première observation :")
print(X_num.to_numpy()[0])
Nombre de colonnes avant encodage : 7
Nombre de colonnes après encodage : 11
['age', 'anciennete_mois', 'facture_mensuelle', 'nb_appels_support',
 'satisfaction', 'type_forfait_Fibre', 'type_forfait_Fibre+TV',
 'type_forfait_Mobile', 'engagement_12_mois', 'engagement_24_mois',
 'engagement_Sans_eng']
Type : float64 | forme : (10000, 11)
Vecteur de caractéristiques de la première observation :
[49.   80.   43.81  3.    4.    0.    0.    1.    1.    0.    0.  ]

Interprétation. L'observation, initialement décrite par sept colonnes hétérogènes, est désormais un point de ℝ¹¹. Les cinq premières composantes sont les variables numériques d'origine ; les six suivantes sont des indicatrices binaires codant les modalités des deux variables catégorielles. Les valeurs 1 en positions huit et neuf indiquent un forfait Mobile avec un engagement de douze mois.

Deux enseignements de portée générale :

  • p ≠ nombre de colonnes du fichier. Ici, sept colonnes produisent onze dimensions. Avec des variables catégorielles à forte cardinalité, l'écart devient considérable : une variable « commune » à 400 modalités ajoute à elle seule 400 dimensions en encodage indicatrice.
  • Les échelles sont hétérogènes. anciennete_mois varie de 1 à 120, facture_mensuelle de 15 à 95, les indicatrices valent 0 ou 1. Cette hétérogénéité est sans effet sur un arbre de décision et déterminante pour tout modèle fondé sur des distances ou sur une descente de gradient (chapitre 023).

5.4 L'espace des caractéristiques

DÉFINITION — Espace des caractéristiques (feature space)

Définition rigoureuse

Ensemble 𝒳 de toutes les valeurs admissibles du vecteur de caractéristiques. Dans le cas usuel de p variables à valeurs réelles, 𝒳 ⊆ Rp\mathbb{R}^p, muni d'une structure d'espace vectoriel normé permettant de définir une distance entre observations.

Formulation géométrique

Chaque observation est un point de cet espace ; chaque variable explicative est un axe ; le jeu de données est un nuage de n points dans un espace de dimension p. La tâche d'apprentissage consiste à identifier dans cet espace une structure — une frontière séparant des régions en classification, une surface de réponse en régression — qui reproduit correctement le lien entre position et valeur cible.

Traduction en langage courant

L'ensemble de toutes les fiches signalétiques possibles, vues comme des points sur une carte à p dimensions.

Point de vigilance

L'intuition géométrique acquise en dimension 2 ou 3 cesse d'être fiable au-delà. En grande dimension, le volume se concentre dans les régions périphériques, les distances entre paires de points deviennent presque toutes équivalentes, et la notion de voisinage perd son pouvoir discriminant. Ce phénomène, dit fléau de la dimension, affecte particulièrement les méthodes fondées sur les distances (chapitre 040).

ANALOGIE — La carte et les points de mesure

Une carte plane possède deux axes, longitude et latitude. Chaque ville y occupe un point unique. Deux villes voisines sur la carte le sont dans la réalité : la proximité dans l'espace de représentation a un sens.

L'espace des caractéristiques est cette carte, avec p axes au lieu de deux. Deux clients dont les vecteurs de caractéristiques sont proches sont des clients « semblables » au sens des variables retenues.

Trois prolongements exacts de l'analogie :

  • Changer les variables revient à changer de carte. Une carte des reliefs et une carte des réseaux ferroviaires placent les mêmes villes différemment proches. C'est l'enjeu du feature engineering : construire la carte sur laquelle le phénomène devient lisible.
  • Changer d'unité déforme la carte. Si un axe est gradué en mètres et l'autre en kilomètres, la notion de proximité est dominée par le premier. C'est la justification de la mise à l'échelle (chapitre 023).
  • Une carte à 300 axes n'est pas consultable à l'oeil. La visualisation exige une projection en deux ou trois dimensions, opération qui perd nécessairement de l'information (chapitre 015).

5.5 Le modèle comme fonction sur l'espace des caractéristiques

ÉlémentFormalisationLecture
Une observationx ∈ 𝒳 ⊆ Rp\mathbb{R}^pUn point
La cible réelley ∈ 𝒴La valeur vraie
Le modèlef : 𝒳 → 𝒴Une fonction définie sur tout l'espace
La prédictionŷ = f(x)La valeur assignée au point
L'erreur sur une observationℓ(y, ŷ)L'écart mesuré par une fonction de perte
L'objectif d'apprentissageminimiser 𝔼[ℓ(Y, f(X))]Réduire l'erreur attendue sur la distribution, non sur l'échantillon

Point essentiel. Le modèle est défini sur tout l'espace, y compris dans les régions où aucune observation n'a été relevée. Il produira une prédiction pour un vecteur de caractéristiques situé hors du domaine couvert par l'entraînement, sans signaler que cette région n'a jamais été observée. Cette extrapolation silencieuse est une source majeure de défaillance en production et motive la surveillance de la dérive des données (chapitre 082).


6. Critères de sélection d'une variable explicative

Disposer d'une colonne n'autorise pas à l'utiliser. Quatre filtres successifs s'appliquent, dans cet ordre, avant toute considération de performance.

6.1 Critère premier : la disponibilité au moment de la prédiction

DÉFINITION — Disponibilité à l'instant de prédiction

Définition rigoureuse

Une variable est disponible à l'instant de prédiction tpredt_{\mathrm{pred}} si sa valeur est observée, accessible et définitive dans les systèmes d'information à cet instant, pour toute observation sur laquelle le modèle devra se prononcer.

Formulation opérationnelle

Soit tpredt_{\mathrm{pred}} l'instant où la prédiction doit être produite et tobst_{\mathrm{obs}} l'instant où la valeur de la variable devient effectivement connue. La variable est recevable si et seulement si :

tobst_{\mathrm{obs}}tpredt_{\mathrm{pred}}, pour toutes les observations, sans exception

Traduction en langage courant

Aurai-je réellement cette information au moment de devoir répondre, ou seulement dans mon historique parce que je regarde le passé ?

Point de vigilance

Le jeu de données historique est constitué a posteriori : il contient naturellement des informations accumulées après l'instant de décision. Rien dans le fichier ne distingue une variable disponible d'une variable postérieure. Seule une connaissance du processus métier permet de trancher. Cette vérification ne peut pas être automatisée.

Cas d'usageVariable candidatetobst_{\mathrm{obs}} par rapport à tpredt_{\mathrm{pred}}Verdict
Attrition client à 90 joursAncienneté en moisAntérieurRecevable
Attrition client à 90 joursDate de résiliationPostérieur, et défini par l'événementExclusion, fuite manifeste
Attrition client à 90 joursMotif de départ saisi par le conseillerPostérieurExclusion
Attrition client à 90 joursNombre d'appels au support sur les 6 derniers moisAntérieur si la fenêtre est bornée à tpredt_{\mathrm{pred}}Recevable sous condition de fenêtrage strict
Octroi de créditRevenu déclaré à la demandeAntérieurRecevable
Octroi de créditNombre d'incidents de paiement sur le prêt accordéPostérieurExclusion
Estimation du prix de vente d'un logementSurface, année de constructionAntérieurRecevable
Estimation du prix de vente d'un logementDurée de mise en ventePostérieur à la mise en vente, connu seulement aprèsExclusion
Maintenance prédictive à 7 joursVibration moyenne des 24 dernières heuresAntérieurRecevable
Maintenance prédictive à 7 joursCode d'anomalie du diagnostic de pannePostérieurExclusion
Diagnostic médical à l'admissionConstantes vitales à l'arrivéeAntérieurRecevable
Diagnostic médical à l'admissionTraitement administréPostérieur, et conséquence du diagnosticExclusion

Trois formes d'indisponibilité, dont deux sont fréquemment omises :

FormeDescriptionIllustration
Indisponibilité temporelleLa valeur n'existe pas encore à tpredt_{\mathrm{pred}}Le montant total facturé sur l'année en cours
Indisponibilité de latenceLa valeur existe mais n'est consolidée dans les systèmes qu'avec un délai supérieur à la fenêtre de décisionUn score externe rafraîchi mensuellement, exploité dans un scoring temps réel
Indisponibilité de périmètreLa valeur existe pour la population historique mais pas pour la population cibleUne variable renseignée uniquement pour les clients d'une filiale absorbée

Point de vigilance sur la latence. Un modèle validé sur un historique complet peut s'effondrer en production parce qu'une variable arrive avec quarante-huit heures de retard et se présente donc systématiquement comme manquante à l'instant de la prédiction. La vérification porte non seulement sur l'existence de la variable, mais sur sa disponibilité effective dans le système appelant, avec la fraîcheur requise.

Le mécanisme complet par lequel une variable indisponible dégrade un projet, ses formes subtiles et les protocoles de détection sont traités au chapitre 028.

6.2 Deuxième critère : l'absence de fuite

DÉFINITION — Fuite de données (data leakage)

Définition rigoureuse

Présence, parmi les informations utilisées pour construire le modèle, d'une information qui ne sera pas légitimement disponible à l'instant de la prédiction, ou qui est déterminée par la valeur de la cible, entraînant une surestimation de la performance mesurée et une défaillance en production.

Traduction en langage courant

Le modèle a vu la réponse, directement ou indirectement, pendant son apprentissage.

Les deux grandes familles

FamilleMécanismeDétection
Fuite par la variableUne colonne encode tout ou partie de la ciblePerformance anormalement élevée, importance concentrée sur une variable
Fuite par le protocoleUne statistique calculée sur l'ensemble des données avant séparation contamine le jeu de testÉcart faible entre validation et test, effondrement en production

Signal d'alerte le plus fiable

Une performance nettement supérieure aux attentes du métier. Un modèle qui atteint 0,99 d'AUC sur un problème réputé difficile doit être suspecté de fuite avant d'être célébré.

Point de vigilance

La fuite ne provoque aucune erreur d'exécution. Elle produit d'excellents résultats. C'est précisément ce qui la rend dangereuse : rien n'invite à la chercher.

Type de variable suspecteQuestion de contrôleExemple
Variable de conséquenceLa valeur est-elle produite parce que l'événement a eu lieu ?date_resiliation, motif_annulation, montant_rembourse
Variable de traitementLa valeur reflète-t-elle une action déclenchée par la connaissance de l'issue ?offre_de_retention_proposee, dossier_transmis_au_contentieux
Variable agrégée non fenêtréeL'agrégat couvre-t-il une période postérieure à tpredt_{\mathrm{pred}} ?nb_transactions_total, moyenne_annuelle
Variable proxy quasi parfaiteLa corrélation avec la cible est-elle suspecte de trivialité ?statut_compte = "clos" pour prédire l'attrition
Identifiant porteur d'ordreL'identifiant encode-t-il implicitement la chronologie ou le groupe ?Numéros séquentiels attribués par lot, un lot par classe

6.3 Troisième critère : la plausibilité métier

Une variable statistiquement associée à la cible sans mécanisme plausible doit être examinée avant d'être retenue. Trois issues sont possibles.

DiagnosticNature du lienConduite à tenir
Mécanisme métier identifiéAssociation fondéeConserver
Variable indirecte d'une cause non observéeAssociation réelle mais fragileConserver avec réserve, documenter, surveiller la stabilité
Corrélation fortuite propre à l'échantillonAssociation sans fondementExclure ; elle ne se reproduira pas
Artefact de collecteL'association provient du processus de constitution des donnéesExclure et corriger la collecte

Point de vigilance : la plausibilité métier est un filtre, non une preuve. Une variable plausible peut être inutile, et une variable dont le mécanisme n'est pas compris peut être authentiquement prédictive. Le critère sert à identifier les variables à examiner, non à trancher seul.

Point de vigilance sur la stabilité. Une variable dont la distribution ou la définition évolue dans le temps — refonte d'une nomenclature, changement de système de collecte, modification d'une règle de gestion — dégrade le modèle sans qu'aucune alerte technique ne se déclenche. La surveillance de ces évolutions est traitée au chapitre 082.

6.4 Quatrième critère : licéité et éthique

CatégorieStatutDifficulté propre
Variables directement sensibles : origine, religion, opinions politiques, santé, orientation sexuelleUsage strictement encadré ou interdit selon les juridictions et les finalitésIdentification aisée
Variables indirectes fortement corrélées à une variable sensibleInterdiction souvent contournée sans intentionLe code postal peut se substituer à l'origine ; le prénom au genre
Variables issues d'une collecte sans base légaleInexploitablesTraçabilité de la provenance exigée
Variables produites par un autre modèleExploitables avec précautionDépendance en cascade, opacité accrue, propagation des biais

Point de vigilance : retirer les variables sensibles ne suffit pas à produire un modèle équitable. Les variables indirectes reconstituent l'information supprimée. L'audit d'équité se conduit sur les prédictions du modèle, non sur la seule liste de ses entrées (chapitre 080).

6.5 Grille de contrôle en huit questions

#QuestionSi la réponse est défavorable
1La variable sera-t-elle renseignée à l'instant de la prédiction, pour toute la population cible ?Exclusion
2Sa valeur est-elle définitive à cet instant, ou révisée ultérieurement ?Exclusion ou fenêtrage explicite
3Sa valeur est-elle une conséquence de l'événement à prédire ?Exclusion pour fuite
4Un agrégat qu'elle contient déborde-t-il sur la période postérieure ?Recalcul avec fenêtre bornée
5Un mécanisme métier plausible relie-t-il cette variable à la cible ?Examen approfondi
6Sa définition et sa distribution sont-elles stables dans le temps ?Surveillance renforcée
7Son usage est-il licite au regard de la finalité et de la réglementation ?Exclusion
8Son coût d'acquisition en production est-il compatible avec l'usage visé ?Arbitrage

Ces huit questions précèdent toute mesure statistique. Les méthodes de sélection fondées sur l'importance, la corrélation ou la performance interviennent après ce filtrage, et sont traitées au chapitre 025.

6.6 La primauté des variables explicatives sur le choix de l'algorithme

Le constat, largement documenté par la pratique industrielle et par les compétitions de modélisation, est le suivant : à jeu de données donné, le gain obtenu en enrichissant l'information fournie dépasse généralement le gain obtenu en substituant un algorithme à un autre.

L'illustration ci-dessous est reproductible. Les données sont simulées, le mécanisme générateur étant connu : le prix est le produit de la surface par le prix au mètre carré local, corrigé de la vétusté. Le jeu contient également six variables de bruit sans lien avec la cible.

python
import numpy as np
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.ensemble import HistGradientBoostingRegressor
from sklearn.metrics import r2_score

rng = np.random.default_rng(7)
n = 600

surface = rng.uniform(20, 160, n)
prix_m2_commune = rng.uniform(2000, 7000, n)
annee_construction = rng.integers(1900, 2021, n)
age_bien = 2024 - annee_construction

# Mécanisme générateur : le prix est un PRODUIT, corrigé par la vétusté
prix = surface * prix_m2_commune * (1 - 0.0025 * age_bien) + rng.normal(0, 40000, n)

X_brut = pd.DataFrame({
    "surface_m2": surface,
    "prix_m2_commune": prix_m2_commune,
    "annee_construction": annee_construction,
})
for j in range(6):
    X_brut[f"var_bruit_{j+1}"] = rng.normal(0, 1, n)

X_enrichi = X_brut.copy()
X_enrichi["valeur_theorique"] = surface * prix_m2_commune
X_enrichi["age_bien"] = age_bien

configurations = [("Variables brutes", X_brut), ("Variables enrichies", X_enrichi)]
modeles = [("Regression lineaire", LinearRegression()),
           ("Gradient boosting", HistGradientBoostingRegressor(random_state=0))]

for nom_config, X in configurations:
    X_tr, X_te, y_tr, y_te = train_test_split(X, prix, test_size=0.3, random_state=0)
    for nom_modele, modele in modeles:
        modele.fit(X_tr, y_tr)
        r2 = r2_score(y_te, modele.predict(X_te))
        print(f"{nom_config:20s} | {nom_modele:20s} | p = {X.shape[1]:2d} | R2 = {r2:.3f}")
Variables brutes     | Regression lineaire  | p =  9 | R2 = 0.898
Variables brutes     | Gradient boosting    | p =  9 | R2 = 0.927
Variables enrichies  | Regression lineaire  | p = 11 | R2 = 0.946
Variables enrichies  | Gradient boosting    | p = 11 | R2 = 0.929
ComparaisonÉcart de R²Lecture
Changement d'algorithme, à variables brutes constantes+0,029Gain obtenu en remplaçant la régression linéaire par le gradient boosting
Enrichissement des variables, à algorithme linéaire constant+0,048Gain obtenu en ajoutant deux variables construites
Modèle linéaire enrichi contre gradient boosting brut+0,019 en faveur du linéaireLe modèle le plus simple, correctement informé, dépasse le modèle le plus puissant mal informé

Interprétation. Le mécanisme générateur est multiplicatif. Un modèle linéaire ne peut pas représenter un produit de deux variables : il en est structurellement incapable tant que ce produit ne lui est pas fourni. Dès que la variable valeur_theorique est construite, le problème redevient linéaire et le modèle le plus simple atteint la meilleure performance de l'ensemble. Le gradient boosting, qui approche le produit par une somme d'arbres, y parvient partiellement, à un coût computationnel supérieur et au prix d'une interprétabilité moindre.

Portée de la démonstration et limites. Ce résultat est construit sur des données simulées dont le mécanisme est connu ; il illustre un principe et ne constitue pas une mesure généralisable. Sur des données réelles, l'écart dépend du problème : il existe des cas où le changement d'algorithme domine. Le principe directeur reste néanmoins solidement établi.

Un algorithme, quel qu'il soit, ne peut exploiter que l'information contenue dans les variables qui lui sont fournies. Aucune sophistication algorithmique ne compense une information absente.

Levier d'améliorationEffet typiqueCoûtPriorité
Corriger la définition de la cibleDéterminantFaible, mais exige un accord métier1
Éliminer les fuites et les variables indisponiblesDéterminant pour la validitéFaible2
Acquérir une source de données nouvelle et pertinenteSouvent élevéÉlevé3
Construire des variables dérivées adaptées au mécanismeSouvent élevéModéré4
Augmenter le volume d'observationsVariable, décroissantModéré à élevé5
Changer d'algorithmeModéréFaible6
Optimiser les hyperparamètresFaible à modéréModéré7

7. Trois cas pratiques annotés

7.1 Attrition dans les télécommunications

client_idageanciennete_moistype_forfaitfacture_mensuellenb_appels_supportsatisfactiondate_resiliationmotif_departa_resilie
C-00001348Mobile29,90040
C-000026745Fibre64,90320
C-00003292Mobile19,9012025-01-14Prix1
C-000045261Fibre+TV89,90050
C-000054117Fibre49,90712024-11-22Service1
ÉlémentDétermination
Variable ciblea_resilie, binaire, résiliation constatée dans les 90 jours suivant la date d'observation
Type de problèmeClassification binaire
Variables explicatives retenuesage, anciennete_mois, type_forfait, facture_mensuelle, nb_appels_support, satisfaction
Colonnes exclues comme identifiantsclient_id
Colonnes exclues pour fuitedate_resiliation et motif_depart : toutes deux ne sont renseignées que si la résiliation a eu lieu. Leur seule présence détermine la cible
Dimension après encodagep = 8 : cinq numériques et trois indicatrices pour type_forfait
Point de vigilance sur le fenêtragenb_appels_support doit être calculé sur une fenêtre bornée à la date d'observation. Un comptage sur toute la durée de vie du client inclut les appels postérieurs, notamment l'appel de résiliation lui-même

Diagnostic de fuite par le taux de valeurs manquantes. La colonne motif_depart est vide pour toutes les observations non résiliées. Une colonne dont le taux de complétude coïncide exactement avec le taux de positifs de la cible est une variable de fuite jusqu'à preuve du contraire. Ce contrôle est peu coûteux et détecte une large part des fuites par la variable.

7.2 Estimation de prix immobilier

annonce_idcommunesurface_m2nb_piecesannee_constructionclasse_energieascenseurduree_mise_en_vente_jnb_visitesprix_vente
A-10471Lyon 3e6831972D14712331 000
A-10472Villeurbanne4222015B12219218 500
A-10473Lyon 6e10551930E01188712 000
A-10474Bron7741988D06311249 000
A-10475Lyon 3e3112019A11524189 900
ÉlémentDétermination
Variable cibleprix_vente, numérique continue strictement positive
Type de problèmeRégression
Variables explicatives retenuescommune, surface_m2, nb_pieces, annee_construction, classe_energie, ascenseur
Colonnes exclues comme identifiantsannonce_id
Colonnes exclues pour indisponibilitéduree_mise_en_vente_j et nb_visites : ces valeurs ne sont connues qu'après la vente. L'usage visé est l'estimation à la mise en vente, instant auquel elles valent zéro ou sont indéfinies
Variables à construireage_bien = annee_vente − annee_construction ; prix_m2_median_commune calculé sur la période d'entraînement uniquement ; surface_par_piece
Dimension après encodageDépend de la cardinalité de commune ; un encodage indicatrice sur 60 communes porte p au-delà de 65

Point de vigilance sur la variable construite prix_m2_median_commune. Cette variable est le levier de performance le plus fort du problème, et simultanément un vecteur de fuite. Calculée sur l'ensemble du jeu de données, elle incorpore les prix de vente du jeu de test dans les entrées de l'entraînement. Elle doit être estimée exclusivement sur le jeu d'entraînement, puis appliquée aux autres jeux, ce qui impose de l'intégrer dans un pipeline (chapitres 079 et 092) et non de la calculer en amont.

Point de vigilance sur la dépendance temporelle. Le niveau général des prix dérive. Si l'usage cible consiste à estimer des transactions futures, la séparation doit être chronologique (chapitre 027) et la surveillance de la dérive mise en place (chapitre 082).

7.3 Maintenance prédictive sur équipement industriel

capteur_idmachine_idhorodatagetemperature_cvibration_rmspression_barheures_fonctionnementjours_depuis_maintenancecode_defaut_diagpanne_sous_7j
S-0001M-142025-03-02 06:0062,41,824,1018 420340
S-0002M-142025-03-02 07:0071,93,474,0818 42134E-2071
S-0003M-222025-03-02 06:0058,11,443,956 210120
S-0004M-222025-03-02 07:0058,61,513,966 211120
S-0005M-072025-03-02 06:0079,24,914,4241 003961
ÉlémentDétermination
Variable ciblepanne_sous_7j, binaire, survenue d'un arrêt non planifié dans les sept jours
Type de problèmeClassification binaire à cible fortement déséquilibrée
Que représente une observationUn relevé horaire pour une machine, non une machine. La même machine occupe des milliers de lignes
Variables explicatives retenuestemperature_c, vibration_rms, pression_bar, heures_fonctionnement, jours_depuis_maintenance, plus des agrégats temporels à construire
Colonnes exclues comme identifiantscapteur_id ; machine_id est conservé comme clé de groupement, non comme variable explicative
Colonnes exclues pour fuitecode_defaut_diag : ce code est émis par le diagnostic effectué au moment de la panne. Sa présence détermine mécaniquement la cible
Variables à construireMoyennes, écarts-types et pentes de vibration_rms sur fenêtres glissantes de 6, 24 et 72 heures ; écart à la valeur de référence par machine

Point de vigilance sur la structure de groupe. Une séparation aléatoire placerait des relevés de la même machine et de la même journée à la fois en entraînement et en test. Le modèle mémoriserait la signature de la machine plutôt que le mécanisme de dégradation, et la performance mesurée serait fortement surestimée. La séparation doit être conduite par groupe de machines et respecter la chronologie (chapitre 027).

Point de vigilance sur le fenêtrage des agrégats. Toute fenêtre glissante doit être strictement antérieure à l'horodatage de l'observation. Une moyenne centrée sur l'instant courant intègre des mesures futures et produit une fuite qui ne se manifestera qu'en production.

DomaineFuite la plus fréquenteVariable de disponibilité la plus critique
Attrition télécomColonnes renseignées uniquement pour les partantsAgrégats de contacts au support, à fenêtre bornée
ImmobilierStatistiques de prix calculées sur tout le jeuVariables décrivant le déroulement de la vente
Maintenance industrielleCodes de diagnostic postérieurs à la panneAgrégats sur fenêtres glissantes strictement antérieures

8. Erreurs de raisonnement fréquentes

ERREUR — Traiter toute colonne disponible comme variable explicative

La disponibilité d'une colonne dans un fichier historique n'établit ni sa disponibilité au moment de la prédiction, ni sa légitimité. Identifiants, variables de conséquence et variables consolidées tardivement doivent être écartés avant toute modélisation.

Formulation correcte : « Une colonne devient une variable explicative après avoir satisfait quatre critères : disponibilité à l'instant de prédiction, absence de fuite, plausibilité métier et licéité. »

ERREUR — Interpréter « variable indépendante » comme une exigence d'indépendance mutuelle

Le qualificatif provient du cadre expérimental où la variable est fixée par l'expérimentateur indépendamment du dispositif. Il ne prescrit aucune indépendance statistique entre les variables d'entrée, lesquelles sont généralement corrélées.

Formulation correcte : « Le terme indépendante est un héritage du plan d'expérience ; la corrélation entre variables explicatives est un phénomène distinct, la multicolinéarité, traitée au chapitre 017. »

ERREUR — Confondre label et target

Label désigne une valeur catégorielle assignée à une observation. Une cible numérique continue est une target sans être un label. Parler du « label » d'un problème de régression est un abus de langage qui signale une maîtrise incomplète du vocabulaire.

Formulation correcte : « La cible est un label en classification et une valeur numérique en régression ; target couvre les deux cas, label seulement le premier. »

ERREUR — Supposer que le rôle d'une variable est intrinsèque

Aucune grandeur n'est explicative ou cible par nature. Le montant d'une transaction est cible dans un projet de prévision du panier moyen et explicative dans un projet de détection de fraude.

Formulation correcte : « Le rôle d'une variable est assigné par la question posée, non par la variable elle-même. »

ERREUR — Considérer que l'ajout de variables améliore mécaniquement le modèle

L'ajout de variables non informatives augmente la dimension de l'espace des caractéristiques, accroît la variance de l'estimation, favorise le surapprentissage et alourdit la chaîne de production. La relation entre nombre de variables et performance en généralisation n'est pas monotone.

Formulation correcte : « L'information pertinente améliore le modèle ; le nombre de colonnes, en lui-même, ne l'améliore pas. »

ERREUR — Déduire l'espace des caractéristiques du nombre de colonnes du fichier

L'encodage des variables catégorielles, la construction de variables dérivées et la sélection modifient la dimension p. Sept colonnes sources peuvent produire onze dimensions, ou plusieurs centaines avec des variables à forte cardinalité.

Formulation correcte : « p désigne le nombre de composantes du vecteur effectivement soumis au modèle, après préparation. »

ERREUR — Chercher un gain de performance dans le choix de l'algorithme avant d'avoir examiné les variables

L'ordre des leviers est établi : définition de la cible, élimination des fuites, enrichissement de l'information, puis seulement choix de l'algorithme et optimisation des hyperparamètres. Inverser cet ordre conduit à consommer un budget important pour un gain marginal.

Formulation correcte : « Avant de changer de modèle, vérifier que l'information nécessaire à la prédiction figure effectivement dans les entrées. »

ERREUR — Considérer la vérité terrain comme exacte par définition

L'étiquetage est produit par un protocole faillible. Les désaccords entre annotateurs, les diagnostics erronés et les fraudes non détectées introduisent un bruit dans la cible qui borne la performance atteignable.

Formulation correcte : « La vérité terrain est une mesure de référence, non la vérité ; la qualité de l'étiquetage conditionne le plafond de performance du modèle. »


9. Synthèse

LA FORMULE MENTALE
    FEATURES  →  MODÈLE  →  TARGET
    ce qui est connu     la fonction     ce qui est cherché
    à l'instant t_pred   apprise         et inconnu à t_pred

VARIABLE EXPLICATIVE — SYNONYMES ET ORIGINES
    feature, caractéristique      reconnaissance de formes
    variable explicative          statistique appliquée
    variable indépendante         plan d'expérience (Fisher, 1935)
    variable d'entrée, input      automatique, théorie des systèmes
    prédicteur                    statistique de la régression
    régresseur                    économétrie
    covariable                    biostatistique, essais cliniques
    attribut                      fouille de données, bases relationnelles
    descripteur                   chimiométrie

VARIABLE CIBLE — SYNONYMES ET ORIGINES
    target, cible                 Machine Learning
    variable dépendante           statistique expérimentale
    variable réponse              plans d'expérience
    variable expliquée            statistique francophone
    variable endogène             économétrie
    output, sortie                automatique
    label, étiquette              classification uniquement
    vérité terrain                télédétection, puis vision
    gold standard                 biostatistique

TERMINOLOGIE DÉPENDANTE / INDÉPENDANTE
    Héritage du plan d'expérience, inadapté au ML observationnel.
    « Indépendante » ne signifie pas indépendante des autres variables.
    « Dépendante » ne signifie pas causalement déterminée.
    Le rôle est fonctionnel et réversible d'un projet à l'autre.

FORMALISATION
    x = (x1, …, xp)ᵀ ∈ ℝ^p        vecteur de caractéristiques
    X ∈ ℝ^(n×p)                   matrice de conception
    y ∈ 𝒴^n                       vecteur cible
    f : 𝒳 → 𝒴                     le modèle
    ŷ = f(x)                      la prédiction
    p ≠ nombre de colonnes du fichier source

LES QUATRE FILTRES, DANS CET ORDRE
    1. Disponibilité à l'instant de la prédiction    → sinon exclusion
    2. Absence de fuite                              → sinon exclusion
    3. Plausibilité métier                           → sinon examen
    4. Licéité et éthique                            → sinon exclusion
    La sélection statistique n'intervient qu'ensuite.

LE CRITÈRE PREMIER
    t_obs ≤ t_pred, pour toutes les observations, sans exception.
    Trois formes d'indisponibilité : temporelle, de latence, de périmètre.

LA HIÉRARCHIE DES LEVIERS
    cible bien définie > absence de fuite > information nouvelle
    > variables construites > volume > algorithme > hyperparamètres

Énoncé de synthèse

Les variables explicatives constituent l'intégralité de l'information dont dispose le modèle et la variable cible la grandeur qu'il doit estimer ; leur désignation varie selon la discipline d'origine sans que la notion change, la terminologie statistique de dépendance et d'indépendance étant un héritage expérimental inadapté au cadre observationnel du Machine Learning. Une observation se représente comme un vecteur de Rp\mathbb{R}^p et le modèle comme une fonction définie sur cet espace. Une colonne ne devient une variable explicative qu'après avoir satisfait quatre critères, dont le premier est sa disponibilité effective à l'instant où la prédiction devra être produite ; et la qualité de cette information détermine la performance atteignable davantage que le choix de l'algorithme.


Quiz associés

  • 006.1-quiz-relation-features-target.md
  • 006.2-quiz-variable-explicative.md
  • 006.3-quiz-variable-cible.md
  • 006.4-quiz-dependante-independante.md
  • 006.5-quiz-vecteur-espace-caracteristiques.md
  • 006.6-quiz-criteres-de-selection.md
  • 006.7-quiz-etudes-de-cas.md

Chapitre suivant : 007-x-et-y-label-classe.md