Tout problème d'apprentissage supervisé, quel que soit le domaine applicatif, l'algorithme retenu ou le volume de données, se ramène à une structure unique :
Cette formule est à retenir littéralement. Elle porte trois engagements méthodologiques :
La même structure se lit différemment selon la phase. C'est la source de confusion la plus fréquente chez les débutants.
| Phase | Variables explicatives | Variable cible | Ce qui est produit |
|---|---|---|---|
| Apprentissage | Connues, fournies | Connue, fournie | Le modèle |
| Validation | Connues, fournies | Connue mais masquée au modèle, utilisée pour comparer | Une mesure de performance |
| Prédiction en production | Connues, fournies | Inconnue | Une estimation ŷ |
| Surveillance a posteriori | Connues | Observée après coup, avec délai | Une mesure de dérive |
Point de vigilance : en phase d'apprentissage, la cible est présente dans le jeu de données au même titre que les autres colonnes. Elle n'en est pas moins d'une nature fonctionnelle radicalement différente. La confondre avec une colonne ordinaire, ou omettre de la retirer des entrées, produit un modèle qui prédit parfaitement en apprentissage et qui est inutilisable en production.
Un enquêteur ne dispose jamais de la réponse. Il dispose d'indices : une empreinte, un horaire, un témoignage, une trace bancaire. Chaque indice est une information partielle, incomplète, parfois trompeuse. L'enquêteur ne peut raisonner que sur ce qu'il a collecté.
Les variables explicatives sont exactement ces indices : ce sont les seules informations que le modèle possède pour se prononcer. La variable cible est l'identité du coupable, c'est-à-dire ce que l'enquête doit établir.
Trois conséquences de cette analogie, toutes exactes techniquement :
Définition rigoureuse
Grandeur mesurée ou construite, associée à chaque observation d'un jeu de données, dont les valeurs sont soumises au modèle en entrée et à partir desquelles celui-ci produit une estimation de la variable cible.
Formulation équivalente en théorie de l'apprentissage
Composante du vecteur d'entrée x appartenant à l'espace des caractéristiques 𝒳, sur lequel est définie la fonction de prédiction f : 𝒳 → 𝒴 que l'algorithme d'apprentissage sélectionne dans une classe d'hypothèses.
Traduction en langage courant
Une information que l'on donne à la machine pour l'aider à répondre.
Nature du concept
La variable explicative désigne un rôle fonctionnel, non un type de donnée. Une colonne n'est pas une variable explicative par nature : elle le devient par une décision de conception, révocable. La même colonne peut être explicative dans un projet, cible dans un autre, exclue dans un troisième. Ce point est développé au point 4.4.
Point de vigilance
Le terme explicative est trompeur pris au pied de la lettre. Une variable explicative n'explique rien au sens causal : elle apporte une information statistiquement associée à la cible. Une variable fortement prédictive peut n'entretenir aucun lien causal avec la cible et n'être qu'un indicateur indirect d'une cause commune non observée.
| Énoncé courant | Statut | Justification |
|---|---|---|
| « Toute colonne du fichier est une feature » | Incorrect | Les identifiants, la cible et les variables de fuite en sont exclus (chapitre 005, point 3.2) |
| « Une feature explique la cible » | Incorrect au sens strict | Elle est associée à la cible ; l'explication causale relève d'un autre cadre méthodologique (chapitre 016) |
| « Une feature doit être numérique » | Incorrect | Elle peut être catégorielle, temporelle ou textuelle ; l'encodage numérique est une étape ultérieure (chapitres 022 et 023) |
| « Plus il y a de features, meilleur est le modèle » | Incorrect | Au-delà d'un seuil, l'ajout de variables dégrade la performance en généralisation (chapitres 025 et 031) |
| « Une feature est fournie par les données » | Partiellement inexact | Une part importante des variables les plus prédictives est construite, non relevée (chapitre 024) |
Le domaine agrège du vocabulaire issu de disciplines distinctes, chacune ayant forgé son propre terme pour le même objet. Les dénominations ci-dessous sont strictement équivalentes en pratique ; elles diffèrent par leur origine, leur registre et les connotations qu'elles véhiculent.
| Terme | Discipline d'origine | Connotation propre | Registre d'usage actuel |
|---|---|---|---|
| Feature | Reconnaissance de formes et vision par ordinateur | Grandeur extraite du signal brut, éventuellement construite | Dominant en Machine Learning, y compris en français professionnel |
| Caractéristique | Traduction française de feature | Identique à feature | Recommandé à l'écrit en français ; usage oral minoritaire |
| Variable explicative | Statistique appliquée, modélisation | Suggère une contribution à l'explication du phénomène | Standard académique francophone |
| Variable indépendante | Statistique expérimentale, plan d'expérience, psychologie expérimentale (héritage de Fisher, 1935) | Suggère une variable manipulée par l'expérimentateur | Fréquent mais problématique en ML (point 4) |
| Variable d'entrée, input | Automatique, théorie des systèmes, ingénierie | Neutre : ce qui entre dans la boîte | Très courant, sans ambiguïté |
| Prédicteur, predictor | Statistique appliquée, littérature de la régression | Souligne la finalité prédictive plutôt qu'explicative | Courant, particulièrement adapté au cadre du ML |
| Régresseur | Économétrie | Terme du modèle de régression, associé à un coefficient | Réservé aux modèles paramétriques linéaires |
| Covariable, covariate | Biostatistique, épidémiologie, essais cliniques | Variable dont on ajuste l'effet pour isoler celui d'un traitement | Standard en recherche clinique |
| Attribut | Apprentissage symbolique, fouille de données, bases de données relationnelles (Quinlan, 1986) | Propriété descriptive d'une entité | Vieilli en ML, vivant en bases de données |
| Descripteur | Chimiométrie, chémoinformatique | Grandeur calculée décrivant une structure | Spécialisé |
| Variable exogène | Économétrie structurelle | Déterminée hors du système modélisé | Spécialisé, à forte charge théorique |
| Facteur | Plans d'expérience, analyse de la variance | Variable catégorielle contrôlée | Ambigu : signifie autre chose en analyse factorielle |
Recommandation professionnelle. À l'écrit en français, employer variable explicative ou caractéristique. À l'oral et dans le code, feature est l'usage établi et n'a pas à être évité. En contexte de communication avec des interlocuteurs métier, variable d'entrée ou information fournie au modèle sont les formulations les plus immédiatement comprises. Éviter variable indépendante pour les raisons exposées au point 4.
Définition rigoureuse
Variable dont les valeurs sont utilisées pour estimer celles d'une autre variable, indépendamment de toute prétention explicative ou causale.
Intérêt du terme
C'est le terme le plus honnête épistémologiquement pour le Machine Learning : il nomme exactement ce qui est recherché, à savoir un pouvoir prédictif, sans suggérer une compréhension du mécanisme sous-jacent.
Point de vigilance
Ne pas confondre prédicteur au sens de variable d'entrée, et prédicteur au sens de modèle entier, acception rencontrée dans la littérature anglophone où a predictor désigne parfois le système de prédiction complet. Le contexte lève l'ambiguïté ; en français, réserver le terme à la variable.
Régresseur (économétrie)
Variable figurant au membre droit d'une équation de régression, associée à un coefficient estimé. Dans le modèle y = β₀ + β₁x₁ + … + + ε, les sont les régresseurs et la variable expliquée y est le régressande.
Le terme est indissociable d'un modèle paramétrique explicite. Parler de « régresseurs » à propos d'une forêt aléatoire est un abus de langage : aucun coefficient n'y est associé à une variable.
Covariable (biostatistique)
Variable mesurée dont l'effet est pris en compte dans le modèle afin d'isoler l'effet d'une variable d'intérêt, typiquement un traitement. Dans un essai clinique évaluant un médicament, l'âge et le sexe des patients sont des covariables : ils ne sont pas l'objet de l'étude mais influencent l'issue.
Point de vigilance
Le vocabulaire de la covariable présuppose une hiérarchie entre variables : une variable d'intérêt, des variables d'ajustement. Cette hiérarchie n'existe pas en Machine Learning prédictif, où toutes les variables explicatives ont le même statut fonctionnel. Reprendre ce vocabulaire dans un projet de ML importe une structure conceptuelle sans objet.
Le terme est employé dans la littérature avec deux portées différentes, dont la confusion est une source d'erreur réelle.
| Acception | Ce qu'elle désigne | Exemple |
|---|---|---|
| Acception large | Toute colonne descriptive du jeu de données, indépendamment de son usage | date_souscription est une « feature du dataset » |
| Acception stricte | Toute entrée effectivement soumise au modèle après préparation | anciennete_jours, dérivée de date_souscription, est une feature du modèle |
L'écart entre les deux acceptions est exactement le périmètre du feature engineering (chapitre 024) et de la feature selection (chapitre 025).
Conséquence de notation : le nombre de variables explicatives p d'un modèle n'est presque jamais égal au nombre de colonnes du fichier d'origine. Formuler « mon jeu de données a 14 features » sans préciser l'acception est une source d'incompréhension entre praticiens.
Définition rigoureuse
Grandeur dont la valeur est inconnue au moment où le système doit se prononcer, et dont l'estimation constitue la finalité du modèle. En apprentissage supervisé, sa valeur observée est disponible pour les observations du jeu d'entraînement, ce qui autorise la constitution d'un signal d'erreur et donc l'apprentissage.
Position dans le formalisme
Élément y de l'espace de sortie 𝒴. Le couple (x, y) constitue un exemple étiqueté ; l'ensemble d'entraînement est une collection de tels couples supposés issus d'une distribution jointe P(X, Y) inconnue et fixe.
Traduction en langage courant
Ce que l'on veut que la machine devine.
Le critère discriminant de l'apprentissage supervisé
C'est l'existence d'une variable cible observée qui définit l'apprentissage supervisé et le sépare de l'apprentissage non supervisé (chapitre 003). En l'absence de cible, il n'existe aucun signal d'erreur, donc rien à minimiser, donc aucun apprentissage supervisé possible.
Point de vigilance
La variable cible n'est pas donnée par la nature. Elle est construite par une décision de conception qui fixe ce qui compte comme le phénomène à prédire et à quel horizon. Ce point est développé au point 3.4.
| Terme | Discipline d'origine | Portée particulière | Registre d'usage |
|---|---|---|---|
| Target, cible | Machine Learning anglophone | Neutre, tout type de cible | Dominant |
| Variable cible | Traduction française | Identique | Standard francophone |
| Variable dépendante | Statistique expérimentale, psychologie expérimentale | Suggère une dépendance causale envers les variables manipulées | Fréquent, problématique en ML (point 4) |
| Variable réponse, response variable | Statistique, méthodologie des plans d'expérience | Ce qui répond à une variation contrôlée des entrées | Standard académique |
| Variable expliquée, variable à expliquer | Statistique et économétrie francophones | Symétrique de « variable explicative » | Courant en français |
| Variable endogène, régressande | Économétrie structurelle | Déterminée à l'intérieur du système modélisé | Spécialisé |
| Sortie, output | Automatique, théorie des systèmes | Neutre : ce qui sort de la boîte | Très courant |
| Label, étiquette | Apprentissage supervisé, annotation de données | Restreint aux cibles catégorielles | Dominant en classification |
| Classe | Reconnaissance de formes, classification | Une modalité particulière du label | Dominant en classification |
| Vérité terrain, ground truth | Télédétection, puis vision par ordinateur | La valeur de référence tenue pour vraie, par opposition à la prédiction | Standard en annotation |
| Étalon de référence, gold standard | Biostatistique, diagnostic médical | La procédure de référence servant à établir la valeur vraie | Standard en médecine |
| Variable critère | Psychométrie, sélection du personnel | Le résultat que le dispositif cherche à prédire | Spécialisé |
Définition rigoureuse
Valeur catégorielle attribuée à une observation, désignant son appartenance à l'une des modalités d'un ensemble fini de classes prédéfinies.
Le point discriminant
Label n'est pas un synonyme exact de target. Tout label est une cible, toute cible n'est pas un label.
| Type de problème | Cible | Peut-on dire « label » |
|---|---|---|
| Classification binaire : fraude / normal | Catégorielle à 2 modalités | Oui |
| Classification multiclasse : chat / chien / cheval | Catégorielle à k modalités | Oui |
| Régression : prix en euros | Numérique continue | Non, par convention d'usage |
Traduction en langage courant
L'étiquette collée sur l'exemple : « ceci est un spam », « ceci est une fraude ».
Point de vigilance
L'expression données étiquetées (labeled data) est employée dans la littérature pour désigner tout jeu de données comportant une cible observée, y compris en régression. L'usage est donc plus large que la définition stricte du label. Le chapitre 007 précise l'articulation entre label, classe et codage numérique.
Définition rigoureuse
Valeur de la variable cible tenue pour exacte, établie par une procédure de référence indépendante du modèle, et servant de référentiel pour l'apprentissage et l'évaluation.
Origine du terme
L'expression provient de la télédétection : la validation des interprétations d'images satellitaires exigeait des relevés effectués sur le terrain, au sol.
Point de vigilance majeur
La vérité terrain n'est pas la vérité. C'est une mesure, produite par un protocole faillible : annotation humaine sujette à désaccord, diagnostic médical imparfait, transaction frauduleuse non détectée et donc étiquetée « normale ». La performance mesurée d'un modèle est bornée par la qualité de l'étiquetage. Un modèle ne peut apprendre correctement une distinction que ses étiquettes n'encodent pas correctement.
Conséquence opérationnelle
Avant d'imputer une contre-performance à l'algorithme, vérifier le protocole d'étiquetage : qui a étiqueté, selon quelle définition, avec quel taux d'accord inter-annotateurs.
| Configuration | Structure de la cible | Dénomination | Renvoi |
|---|---|---|---|
| Une seule colonne cible, valeur unique par observation | y ∈ ℝ ou y ∈ {c₁, …, } | Cas standard | Chapitre 010 |
| Une observation peut appartenir à plusieurs classes simultanément | y ∈ | Classification multilabel | Chapitre 011 |
| Plusieurs cibles numériques prédites conjointement | y ∈ | Régression multi-sorties | Chapitre 048 |
| Cible catégorielle à modalités ordonnées | y ∈ {c₁ < … < } | Classification ordinale | Chapitre 011 |
Point de vigilance : la présence de plusieurs colonnes candidates au rôle de cible dans un fichier n'autorise pas à les traiter comme une cible unique. Deux cibles distinctes définissent deux problèmes distincts, exigeant chacun leur modèle, leurs métriques et leur validation.
Aucun système opérationnel ne produit spontanément une colonne nommée « a_resilie ». Cette colonne résulte d'une chaîne de décisions explicites.
| Décision | Effet sur le projet |
|---|---|
| Définition de l'événement | Détermine le taux de positifs, donc le degré de déséquilibre (chapitre 050) |
| Horizon temporel | Détermine la difficulté du problème et l'utilité opérationnelle de la prédiction |
| Population concernée | Détermine le périmètre de validité du modèle et les biais de sélection |
| Date d'observation | Détermine quelles variables explicatives sont légitimement disponibles (point 6.1) |
Principe directeur : une variable cible mal définie ne peut être compensée par aucun raffinement algorithmique. La formalisation de la cible est la première étape du cycle de vie d'un projet (chapitre 012), et elle relève d'une discussion avec le métier, non d'une décision technique.
Définition rigoureuse dans le cadre expérimental d'origine
Dans un plan d'expérience, la variable indépendante est la grandeur dont l'expérimentateur fixe délibérément les valeurs, indépendamment de tout autre facteur du dispositif ; la variable dépendante est la grandeur mesurée dont on cherche à établir si elle varie en fonction de la première.
Contexte historique
Cette terminologie provient de la méthodologie expérimentale formalisée par Ronald Fisher (The Design of Experiments, 1935) et diffusée par la psychologie expérimentale. Elle suppose un dispositif dans lequel l'expérimentateur manipule une variable, contrôle les autres et randomise l'affectation des unités, ce qui autorise une inférence causale.
Traduction en langage courant
Ce que l'on règle soi-même, et ce que l'on observe en conséquence.
Point de vigilance
Ces conditions ne sont pratiquement jamais réunies en Machine Learning appliqué, qui opère sur des données observationnelles collectées sans plan d'expérience. Le vocabulaire subsiste, sa justification a disparu.
| Difficulté | Ce que le terme suggère | Ce qu'il en est en Machine Learning |
|---|---|---|
| Indépendance statistique | Les variables explicatives seraient indépendantes entre elles | Elles sont presque toujours corrélées entre elles. La corrélation forte entre variables explicatives porte un nom, la multicolinéarité, et constitue un problème traité au chapitre 017 |
| Manipulation expérimentale | L'analyste fixerait les valeurs des variables d'entrée | Elles sont observées, non manipulées. Personne ne « fixe » l'âge d'un client ou la surface d'un logement |
| Dépendance causale | La cible varierait à cause des variables d'entrée | Le modèle capte une association. L'inférence causale exige un cadre spécifique, non un modèle prédictif (chapitre 016) |
| Propriété intrinsèque | Une variable serait indépendante ou dépendante par nature | Le statut est un rôle assigné par le projet, réversible d'un projet à l'autre |
| Symétrie logique | Une seule lecture serait possible | Le sens de la flèche est un choix de conception, contraint par la disponibilité temporelle, non par la logique |
Le contresens le plus fréquent : conclure que les variables explicatives doivent être indépendantes entre elles parce qu'elles sont appelées « indépendantes ». L'exigence d'absence de forte colinéarité existe pour certains modèles paramétriques, mais elle n'a aucun rapport avec l'origine du terme, qui renvoie à l'indépendance vis-à-vis du dispositif expérimental, non entre variables.
Une même grandeur change de rôle selon la question posée. La colonne ne change pas ; le projet change.
| Grandeur | Projet où elle est cible | Projet où elle est explicative |
|---|---|---|
| Montant d'une transaction | Prévision du panier moyen | Détection de fraude bancaire |
| Note de satisfaction client | Prédiction de la satisfaction post-appel | Prédiction de l'attrition |
| Durée d'hospitalisation | Planification de la capacité hospitalière | Prédiction du risque de réadmission |
| Température d'un roulement | Prévision thermique d'un équipement | Détection d'une panne imminente |
| Salaire | Estimation salariale à l'embauche | Score d'octroi de crédit |
| Situation | Formulation recommandée | Formulation à éviter |
|---|---|---|
| Rapport technique en français | Variables explicatives / variable cible | Variables indépendantes / dépendante |
| Code et documentation technique | features / target, X / y | — |
| Présentation à un public métier | Informations fournies / valeur à prédire | Tout terme statistique non traduit |
| Article scientifique en statistique | Prédicteurs / variable réponse | — |
| Entretien d'embauche | Variables explicatives, en signalant la connaissance des synonymes | Emploi d'un seul terme sans recul |
Position professionnelle attendue : connaître les synonymes, savoir les traduire d'un registre à l'autre, et savoir expliquer pourquoi variable indépendante est un héritage inadapté au cadre observationnel du Machine Learning.
Définition rigoureuse
Représentation d'une observation sous forme d'un p-uplet ordonné de valeurs, une par variable explicative retenue :
où p désigne le nombre de variables explicatives et la valeur prise par la j-ième variable pour cette observation.
Trois propriétés contraignantes
Traduction en langage courant
Une ligne du tableau, réduite aux colonnes utiles et convertie en une suite de nombres.
Définition rigoureuse
Matrice X ∈ dont la i-ième ligne est le vecteur de caractéristiques xᵢᵀ de la i-ième observation et la j-ième colonne le vecteur des valeurs prises par la j-ième variable explicative sur les n observations.
Le vecteur cible associé est y ∈ , où 𝒴 = ℝ en régression et 𝒴 = {c₁, …, } en classification.
Origine du terme
Design matrix provient de la littérature des plans d'expérience, où les lignes de la matrice décrivaient la configuration expérimentale de chaque essai. Le terme est conservé en régression et en apprentissage statistique.
Convention de notation
X majuscule pour la matrice, y minuscule pour le vecteur cible : la casse signale la différence de dimensionnalité, deux dimensions contre une. Cette convention est universelle dans la littérature et dans les bibliothèques logicielles.
| Objet | Notation | Dimension | Contenu |
|---|---|---|---|
| Jeu d'entraînement | (X, y) | — | n couples (observation, cible) |
| Matrice des variables explicatives | X | n × p | Valeurs numériques |
| Vecteur cible | y | n | Une valeur par observation |
| Vecteur de caractéristiques d'une observation | xᵢ | p | La ligne i de X |
| Valeur d'une variable pour une observation | scalaire | Cellule (i, j) | |
| Vecteur d'une variable sur tout le jeu | X[:, j] | n | La colonne j de X |
| Prédiction pour une observation | ŷᵢ | scalaire ou vecteur | Sortie du modèle |
import pandas as pd
df = pd.read_csv("clients_telecom.csv")
cible = "a_resilie"
identifiants = ["client_id"]
X = df.drop(columns=[cible] + identifiants)
y = df[cible]
print("X :", X.shape)
print("y :", y.shape)
print()
print(X.dtypes)X : (10000, 7)
y : (10000,)
age int64
anciennete_mois int64
type_forfait str
engagement str
facture_mensuelle float64
nb_appels_support int64
satisfaction float64
dtype: objectInterprétation. Le jeu comporte n = 10 000 observations. La matrice X
comporte sept colonnes, la cible et l'identifiant ayant été retirés. La forme de
y, (10000,), confirme qu'il s'agit d'un vecteur à une dimension et non d'une
matrice à une colonne : cette distinction est source d'avertissements et
d'erreurs dans plusieurs bibliothèques.
Point de vigilance : df.drop(columns=[cible]) doit être écrit avant toute
autre transformation. Toute étape de préparation calculée sur un jeu contenant
encore la cible expose à une fuite (chapitre 028).
print(X.iloc[0])age 49
anciennete_mois 80
type_forfait Mobile
engagement 12_mois
facture_mensuelle 43.81
nb_appels_support 3
satisfaction 4.0
Name: 0, dtype: objectCette ligne n'est pas encore un vecteur de : deux composantes sont textuelles. L'encodage des variables catégorielles produit la représentation numérique effectivement soumise au modèle.
X_encode = pd.get_dummies(X, columns=["type_forfait", "engagement"])
X_num = X_encode.astype(float)
print("Nombre de colonnes avant encodage :", X.shape[1])
print("Nombre de colonnes après encodage :", X_encode.shape[1])
print(list(X_encode.columns))
print("Type :", X_num.to_numpy().dtype, "| forme :", X_num.to_numpy().shape)
print("Vecteur de caractéristiques de la première observation :")
print(X_num.to_numpy()[0])Nombre de colonnes avant encodage : 7
Nombre de colonnes après encodage : 11
['age', 'anciennete_mois', 'facture_mensuelle', 'nb_appels_support',
'satisfaction', 'type_forfait_Fibre', 'type_forfait_Fibre+TV',
'type_forfait_Mobile', 'engagement_12_mois', 'engagement_24_mois',
'engagement_Sans_eng']
Type : float64 | forme : (10000, 11)
Vecteur de caractéristiques de la première observation :
[49. 80. 43.81 3. 4. 0. 0. 1. 1. 0. 0. ]Interprétation. L'observation, initialement décrite par sept colonnes
hétérogènes, est désormais un point de ℝ¹¹. Les cinq premières composantes sont
les variables numériques d'origine ; les six suivantes sont des indicatrices
binaires codant les modalités des deux variables catégorielles. Les valeurs
1 en positions huit et neuf indiquent un forfait Mobile avec un engagement de
douze mois.
Deux enseignements de portée générale :
anciennete_mois varie de 1 à 120,
facture_mensuelle de 15 à 95, les indicatrices valent 0 ou 1. Cette
hétérogénéité est sans effet sur un arbre de décision et déterminante pour tout
modèle fondé sur des distances ou sur une descente de gradient (chapitre 023).Définition rigoureuse
Ensemble 𝒳 de toutes les valeurs admissibles du vecteur de caractéristiques. Dans le cas usuel de p variables à valeurs réelles, 𝒳 ⊆ , muni d'une structure d'espace vectoriel normé permettant de définir une distance entre observations.
Formulation géométrique
Chaque observation est un point de cet espace ; chaque variable explicative est un axe ; le jeu de données est un nuage de n points dans un espace de dimension p. La tâche d'apprentissage consiste à identifier dans cet espace une structure — une frontière séparant des régions en classification, une surface de réponse en régression — qui reproduit correctement le lien entre position et valeur cible.
Traduction en langage courant
L'ensemble de toutes les fiches signalétiques possibles, vues comme des points sur une carte à p dimensions.
Point de vigilance
L'intuition géométrique acquise en dimension 2 ou 3 cesse d'être fiable au-delà. En grande dimension, le volume se concentre dans les régions périphériques, les distances entre paires de points deviennent presque toutes équivalentes, et la notion de voisinage perd son pouvoir discriminant. Ce phénomène, dit fléau de la dimension, affecte particulièrement les méthodes fondées sur les distances (chapitre 040).
Une carte plane possède deux axes, longitude et latitude. Chaque ville y occupe un point unique. Deux villes voisines sur la carte le sont dans la réalité : la proximité dans l'espace de représentation a un sens.
L'espace des caractéristiques est cette carte, avec p axes au lieu de deux. Deux clients dont les vecteurs de caractéristiques sont proches sont des clients « semblables » au sens des variables retenues.
Trois prolongements exacts de l'analogie :
| Élément | Formalisation | Lecture |
|---|---|---|
| Une observation | x ∈ 𝒳 ⊆ | Un point |
| La cible réelle | y ∈ 𝒴 | La valeur vraie |
| Le modèle | f : 𝒳 → 𝒴 | Une fonction définie sur tout l'espace |
| La prédiction | ŷ = f(x) | La valeur assignée au point |
| L'erreur sur une observation | ℓ(y, ŷ) | L'écart mesuré par une fonction de perte |
| L'objectif d'apprentissage | minimiser 𝔼[ℓ(Y, f(X))] | Réduire l'erreur attendue sur la distribution, non sur l'échantillon |
Point essentiel. Le modèle est défini sur tout l'espace, y compris dans les régions où aucune observation n'a été relevée. Il produira une prédiction pour un vecteur de caractéristiques situé hors du domaine couvert par l'entraînement, sans signaler que cette région n'a jamais été observée. Cette extrapolation silencieuse est une source majeure de défaillance en production et motive la surveillance de la dérive des données (chapitre 082).
Disposer d'une colonne n'autorise pas à l'utiliser. Quatre filtres successifs s'appliquent, dans cet ordre, avant toute considération de performance.
Définition rigoureuse
Une variable est disponible à l'instant de prédiction si sa valeur est observée, accessible et définitive dans les systèmes d'information à cet instant, pour toute observation sur laquelle le modèle devra se prononcer.
Formulation opérationnelle
Soit l'instant où la prédiction doit être produite et l'instant où la valeur de la variable devient effectivement connue. La variable est recevable si et seulement si :
≤ , pour toutes les observations, sans exception
Traduction en langage courant
Aurai-je réellement cette information au moment de devoir répondre, ou seulement dans mon historique parce que je regarde le passé ?
Point de vigilance
Le jeu de données historique est constitué a posteriori : il contient naturellement des informations accumulées après l'instant de décision. Rien dans le fichier ne distingue une variable disponible d'une variable postérieure. Seule une connaissance du processus métier permet de trancher. Cette vérification ne peut pas être automatisée.
| Cas d'usage | Variable candidate | par rapport à | Verdict |
|---|---|---|---|
| Attrition client à 90 jours | Ancienneté en mois | Antérieur | Recevable |
| Attrition client à 90 jours | Date de résiliation | Postérieur, et défini par l'événement | Exclusion, fuite manifeste |
| Attrition client à 90 jours | Motif de départ saisi par le conseiller | Postérieur | Exclusion |
| Attrition client à 90 jours | Nombre d'appels au support sur les 6 derniers mois | Antérieur si la fenêtre est bornée à | Recevable sous condition de fenêtrage strict |
| Octroi de crédit | Revenu déclaré à la demande | Antérieur | Recevable |
| Octroi de crédit | Nombre d'incidents de paiement sur le prêt accordé | Postérieur | Exclusion |
| Estimation du prix de vente d'un logement | Surface, année de construction | Antérieur | Recevable |
| Estimation du prix de vente d'un logement | Durée de mise en vente | Postérieur à la mise en vente, connu seulement après | Exclusion |
| Maintenance prédictive à 7 jours | Vibration moyenne des 24 dernières heures | Antérieur | Recevable |
| Maintenance prédictive à 7 jours | Code d'anomalie du diagnostic de panne | Postérieur | Exclusion |
| Diagnostic médical à l'admission | Constantes vitales à l'arrivée | Antérieur | Recevable |
| Diagnostic médical à l'admission | Traitement administré | Postérieur, et conséquence du diagnostic | Exclusion |
Trois formes d'indisponibilité, dont deux sont fréquemment omises :
| Forme | Description | Illustration |
|---|---|---|
| Indisponibilité temporelle | La valeur n'existe pas encore à | Le montant total facturé sur l'année en cours |
| Indisponibilité de latence | La valeur existe mais n'est consolidée dans les systèmes qu'avec un délai supérieur à la fenêtre de décision | Un score externe rafraîchi mensuellement, exploité dans un scoring temps réel |
| Indisponibilité de périmètre | La valeur existe pour la population historique mais pas pour la population cible | Une variable renseignée uniquement pour les clients d'une filiale absorbée |
Point de vigilance sur la latence. Un modèle validé sur un historique complet peut s'effondrer en production parce qu'une variable arrive avec quarante-huit heures de retard et se présente donc systématiquement comme manquante à l'instant de la prédiction. La vérification porte non seulement sur l'existence de la variable, mais sur sa disponibilité effective dans le système appelant, avec la fraîcheur requise.
Le mécanisme complet par lequel une variable indisponible dégrade un projet, ses formes subtiles et les protocoles de détection sont traités au chapitre 028.
Définition rigoureuse
Présence, parmi les informations utilisées pour construire le modèle, d'une information qui ne sera pas légitimement disponible à l'instant de la prédiction, ou qui est déterminée par la valeur de la cible, entraînant une surestimation de la performance mesurée et une défaillance en production.
Traduction en langage courant
Le modèle a vu la réponse, directement ou indirectement, pendant son apprentissage.
Les deux grandes familles
| Famille | Mécanisme | Détection |
|---|---|---|
| Fuite par la variable | Une colonne encode tout ou partie de la cible | Performance anormalement élevée, importance concentrée sur une variable |
| Fuite par le protocole | Une statistique calculée sur l'ensemble des données avant séparation contamine le jeu de test | Écart faible entre validation et test, effondrement en production |
Signal d'alerte le plus fiable
Une performance nettement supérieure aux attentes du métier. Un modèle qui atteint 0,99 d'AUC sur un problème réputé difficile doit être suspecté de fuite avant d'être célébré.
Point de vigilance
La fuite ne provoque aucune erreur d'exécution. Elle produit d'excellents résultats. C'est précisément ce qui la rend dangereuse : rien n'invite à la chercher.
| Type de variable suspecte | Question de contrôle | Exemple |
|---|---|---|
| Variable de conséquence | La valeur est-elle produite parce que l'événement a eu lieu ? | date_resiliation, motif_annulation, montant_rembourse |
| Variable de traitement | La valeur reflète-t-elle une action déclenchée par la connaissance de l'issue ? | offre_de_retention_proposee, dossier_transmis_au_contentieux |
| Variable agrégée non fenêtrée | L'agrégat couvre-t-il une période postérieure à ? | nb_transactions_total, moyenne_annuelle |
| Variable proxy quasi parfaite | La corrélation avec la cible est-elle suspecte de trivialité ? | statut_compte = "clos" pour prédire l'attrition |
| Identifiant porteur d'ordre | L'identifiant encode-t-il implicitement la chronologie ou le groupe ? | Numéros séquentiels attribués par lot, un lot par classe |
Une variable statistiquement associée à la cible sans mécanisme plausible doit être examinée avant d'être retenue. Trois issues sont possibles.
| Diagnostic | Nature du lien | Conduite à tenir |
|---|---|---|
| Mécanisme métier identifié | Association fondée | Conserver |
| Variable indirecte d'une cause non observée | Association réelle mais fragile | Conserver avec réserve, documenter, surveiller la stabilité |
| Corrélation fortuite propre à l'échantillon | Association sans fondement | Exclure ; elle ne se reproduira pas |
| Artefact de collecte | L'association provient du processus de constitution des données | Exclure et corriger la collecte |
Point de vigilance : la plausibilité métier est un filtre, non une preuve. Une variable plausible peut être inutile, et une variable dont le mécanisme n'est pas compris peut être authentiquement prédictive. Le critère sert à identifier les variables à examiner, non à trancher seul.
Point de vigilance sur la stabilité. Une variable dont la distribution ou la définition évolue dans le temps — refonte d'une nomenclature, changement de système de collecte, modification d'une règle de gestion — dégrade le modèle sans qu'aucune alerte technique ne se déclenche. La surveillance de ces évolutions est traitée au chapitre 082.
| Catégorie | Statut | Difficulté propre |
|---|---|---|
| Variables directement sensibles : origine, religion, opinions politiques, santé, orientation sexuelle | Usage strictement encadré ou interdit selon les juridictions et les finalités | Identification aisée |
| Variables indirectes fortement corrélées à une variable sensible | Interdiction souvent contournée sans intention | Le code postal peut se substituer à l'origine ; le prénom au genre |
| Variables issues d'une collecte sans base légale | Inexploitables | Traçabilité de la provenance exigée |
| Variables produites par un autre modèle | Exploitables avec précaution | Dépendance en cascade, opacité accrue, propagation des biais |
Point de vigilance : retirer les variables sensibles ne suffit pas à produire un modèle équitable. Les variables indirectes reconstituent l'information supprimée. L'audit d'équité se conduit sur les prédictions du modèle, non sur la seule liste de ses entrées (chapitre 080).
| # | Question | Si la réponse est défavorable |
|---|---|---|
| 1 | La variable sera-t-elle renseignée à l'instant de la prédiction, pour toute la population cible ? | Exclusion |
| 2 | Sa valeur est-elle définitive à cet instant, ou révisée ultérieurement ? | Exclusion ou fenêtrage explicite |
| 3 | Sa valeur est-elle une conséquence de l'événement à prédire ? | Exclusion pour fuite |
| 4 | Un agrégat qu'elle contient déborde-t-il sur la période postérieure ? | Recalcul avec fenêtre bornée |
| 5 | Un mécanisme métier plausible relie-t-il cette variable à la cible ? | Examen approfondi |
| 6 | Sa définition et sa distribution sont-elles stables dans le temps ? | Surveillance renforcée |
| 7 | Son usage est-il licite au regard de la finalité et de la réglementation ? | Exclusion |
| 8 | Son coût d'acquisition en production est-il compatible avec l'usage visé ? | Arbitrage |
Ces huit questions précèdent toute mesure statistique. Les méthodes de sélection fondées sur l'importance, la corrélation ou la performance interviennent après ce filtrage, et sont traitées au chapitre 025.
Le constat, largement documenté par la pratique industrielle et par les compétitions de modélisation, est le suivant : à jeu de données donné, le gain obtenu en enrichissant l'information fournie dépasse généralement le gain obtenu en substituant un algorithme à un autre.
L'illustration ci-dessous est reproductible. Les données sont simulées, le mécanisme générateur étant connu : le prix est le produit de la surface par le prix au mètre carré local, corrigé de la vétusté. Le jeu contient également six variables de bruit sans lien avec la cible.
import numpy as np
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.ensemble import HistGradientBoostingRegressor
from sklearn.metrics import r2_score
rng = np.random.default_rng(7)
n = 600
surface = rng.uniform(20, 160, n)
prix_m2_commune = rng.uniform(2000, 7000, n)
annee_construction = rng.integers(1900, 2021, n)
age_bien = 2024 - annee_construction
# Mécanisme générateur : le prix est un PRODUIT, corrigé par la vétusté
prix = surface * prix_m2_commune * (1 - 0.0025 * age_bien) + rng.normal(0, 40000, n)
X_brut = pd.DataFrame({
"surface_m2": surface,
"prix_m2_commune": prix_m2_commune,
"annee_construction": annee_construction,
})
for j in range(6):
X_brut[f"var_bruit_{j+1}"] = rng.normal(0, 1, n)
X_enrichi = X_brut.copy()
X_enrichi["valeur_theorique"] = surface * prix_m2_commune
X_enrichi["age_bien"] = age_bien
configurations = [("Variables brutes", X_brut), ("Variables enrichies", X_enrichi)]
modeles = [("Regression lineaire", LinearRegression()),
("Gradient boosting", HistGradientBoostingRegressor(random_state=0))]
for nom_config, X in configurations:
X_tr, X_te, y_tr, y_te = train_test_split(X, prix, test_size=0.3, random_state=0)
for nom_modele, modele in modeles:
modele.fit(X_tr, y_tr)
r2 = r2_score(y_te, modele.predict(X_te))
print(f"{nom_config:20s} | {nom_modele:20s} | p = {X.shape[1]:2d} | R2 = {r2:.3f}")Variables brutes | Regression lineaire | p = 9 | R2 = 0.898
Variables brutes | Gradient boosting | p = 9 | R2 = 0.927
Variables enrichies | Regression lineaire | p = 11 | R2 = 0.946
Variables enrichies | Gradient boosting | p = 11 | R2 = 0.929| Comparaison | Écart de R² | Lecture |
|---|---|---|
| Changement d'algorithme, à variables brutes constantes | +0,029 | Gain obtenu en remplaçant la régression linéaire par le gradient boosting |
| Enrichissement des variables, à algorithme linéaire constant | +0,048 | Gain obtenu en ajoutant deux variables construites |
| Modèle linéaire enrichi contre gradient boosting brut | +0,019 en faveur du linéaire | Le modèle le plus simple, correctement informé, dépasse le modèle le plus puissant mal informé |
Interprétation. Le mécanisme générateur est multiplicatif. Un modèle linéaire
ne peut pas représenter un produit de deux variables : il en est structurellement
incapable tant que ce produit ne lui est pas fourni. Dès que la variable
valeur_theorique est construite, le problème redevient linéaire et le modèle le
plus simple atteint la meilleure performance de l'ensemble. Le gradient boosting,
qui approche le produit par une somme d'arbres, y parvient partiellement, à un
coût computationnel supérieur et au prix d'une interprétabilité moindre.
Portée de la démonstration et limites. Ce résultat est construit sur des données simulées dont le mécanisme est connu ; il illustre un principe et ne constitue pas une mesure généralisable. Sur des données réelles, l'écart dépend du problème : il existe des cas où le changement d'algorithme domine. Le principe directeur reste néanmoins solidement établi.
Un algorithme, quel qu'il soit, ne peut exploiter que l'information contenue dans les variables qui lui sont fournies. Aucune sophistication algorithmique ne compense une information absente.
| Levier d'amélioration | Effet typique | Coût | Priorité |
|---|---|---|---|
| Corriger la définition de la cible | Déterminant | Faible, mais exige un accord métier | 1 |
| Éliminer les fuites et les variables indisponibles | Déterminant pour la validité | Faible | 2 |
| Acquérir une source de données nouvelle et pertinente | Souvent élevé | Élevé | 3 |
| Construire des variables dérivées adaptées au mécanisme | Souvent élevé | Modéré | 4 |
| Augmenter le volume d'observations | Variable, décroissant | Modéré à élevé | 5 |
| Changer d'algorithme | Modéré | Faible | 6 |
| Optimiser les hyperparamètres | Faible à modéré | Modéré | 7 |
| client_id | age | anciennete_mois | type_forfait | facture_mensuelle | nb_appels_support | satisfaction | date_resiliation | motif_depart | a_resilie |
|---|---|---|---|---|---|---|---|---|---|
| C-00001 | 34 | 8 | Mobile | 29,90 | 0 | 4 | — | — | 0 |
| C-00002 | 67 | 45 | Fibre | 64,90 | 3 | 2 | — | — | 0 |
| C-00003 | 29 | 2 | Mobile | 19,90 | 1 | — | 2025-01-14 | Prix | 1 |
| C-00004 | 52 | 61 | Fibre+TV | 89,90 | 0 | 5 | — | — | 0 |
| C-00005 | 41 | 17 | Fibre | 49,90 | 7 | 1 | 2024-11-22 | Service | 1 |
| Élément | Détermination |
|---|---|
| Variable cible | a_resilie, binaire, résiliation constatée dans les 90 jours suivant la date d'observation |
| Type de problème | Classification binaire |
| Variables explicatives retenues | age, anciennete_mois, type_forfait, facture_mensuelle, nb_appels_support, satisfaction |
| Colonnes exclues comme identifiants | client_id |
| Colonnes exclues pour fuite | date_resiliation et motif_depart : toutes deux ne sont renseignées que si la résiliation a eu lieu. Leur seule présence détermine la cible |
| Dimension après encodage | p = 8 : cinq numériques et trois indicatrices pour type_forfait |
| Point de vigilance sur le fenêtrage | nb_appels_support doit être calculé sur une fenêtre bornée à la date d'observation. Un comptage sur toute la durée de vie du client inclut les appels postérieurs, notamment l'appel de résiliation lui-même |
Diagnostic de fuite par le taux de valeurs manquantes. La colonne
motif_depart est vide pour toutes les observations non résiliées. Une colonne
dont le taux de complétude coïncide exactement avec le taux de positifs de la
cible est une variable de fuite jusqu'à preuve du contraire. Ce contrôle est peu
coûteux et détecte une large part des fuites par la variable.
| annonce_id | commune | surface_m2 | nb_pieces | annee_construction | classe_energie | ascenseur | duree_mise_en_vente_j | nb_visites | prix_vente |
|---|---|---|---|---|---|---|---|---|---|
| A-10471 | Lyon 3e | 68 | 3 | 1972 | D | 1 | 47 | 12 | 331 000 |
| A-10472 | Villeurbanne | 42 | 2 | 2015 | B | 1 | 22 | 19 | 218 500 |
| A-10473 | Lyon 6e | 105 | 5 | 1930 | E | 0 | 118 | 8 | 712 000 |
| A-10474 | Bron | 77 | 4 | 1988 | D | 0 | 63 | 11 | 249 000 |
| A-10475 | Lyon 3e | 31 | 1 | 2019 | A | 1 | 15 | 24 | 189 900 |
| Élément | Détermination |
|---|---|
| Variable cible | prix_vente, numérique continue strictement positive |
| Type de problème | Régression |
| Variables explicatives retenues | commune, surface_m2, nb_pieces, annee_construction, classe_energie, ascenseur |
| Colonnes exclues comme identifiants | annonce_id |
| Colonnes exclues pour indisponibilité | duree_mise_en_vente_j et nb_visites : ces valeurs ne sont connues qu'après la vente. L'usage visé est l'estimation à la mise en vente, instant auquel elles valent zéro ou sont indéfinies |
| Variables à construire | age_bien = annee_vente − annee_construction ; prix_m2_median_commune calculé sur la période d'entraînement uniquement ; surface_par_piece |
| Dimension après encodage | Dépend de la cardinalité de commune ; un encodage indicatrice sur 60 communes porte p au-delà de 65 |
Point de vigilance sur la variable construite prix_m2_median_commune.
Cette variable est le levier de performance le plus fort du problème, et
simultanément un vecteur de fuite. Calculée sur l'ensemble du jeu de données,
elle incorpore les prix de vente du jeu de test dans les entrées de
l'entraînement. Elle doit être estimée exclusivement sur le jeu d'entraînement,
puis appliquée aux autres jeux, ce qui impose de l'intégrer dans un pipeline
(chapitres 079 et 092) et non de la calculer en amont.
Point de vigilance sur la dépendance temporelle. Le niveau général des prix dérive. Si l'usage cible consiste à estimer des transactions futures, la séparation doit être chronologique (chapitre 027) et la surveillance de la dérive mise en place (chapitre 082).
| capteur_id | machine_id | horodatage | temperature_c | vibration_rms | pression_bar | heures_fonctionnement | jours_depuis_maintenance | code_defaut_diag | panne_sous_7j |
|---|---|---|---|---|---|---|---|---|---|
| S-0001 | M-14 | 2025-03-02 06:00 | 62,4 | 1,82 | 4,10 | 18 420 | 34 | — | 0 |
| S-0002 | M-14 | 2025-03-02 07:00 | 71,9 | 3,47 | 4,08 | 18 421 | 34 | E-207 | 1 |
| S-0003 | M-22 | 2025-03-02 06:00 | 58,1 | 1,44 | 3,95 | 6 210 | 12 | — | 0 |
| S-0004 | M-22 | 2025-03-02 07:00 | 58,6 | 1,51 | 3,96 | 6 211 | 12 | — | 0 |
| S-0005 | M-07 | 2025-03-02 06:00 | 79,2 | 4,91 | 4,42 | 41 003 | 96 | — | 1 |
| Élément | Détermination |
|---|---|
| Variable cible | panne_sous_7j, binaire, survenue d'un arrêt non planifié dans les sept jours |
| Type de problème | Classification binaire à cible fortement déséquilibrée |
| Que représente une observation | Un relevé horaire pour une machine, non une machine. La même machine occupe des milliers de lignes |
| Variables explicatives retenues | temperature_c, vibration_rms, pression_bar, heures_fonctionnement, jours_depuis_maintenance, plus des agrégats temporels à construire |
| Colonnes exclues comme identifiants | capteur_id ; machine_id est conservé comme clé de groupement, non comme variable explicative |
| Colonnes exclues pour fuite | code_defaut_diag : ce code est émis par le diagnostic effectué au moment de la panne. Sa présence détermine mécaniquement la cible |
| Variables à construire | Moyennes, écarts-types et pentes de vibration_rms sur fenêtres glissantes de 6, 24 et 72 heures ; écart à la valeur de référence par machine |
Point de vigilance sur la structure de groupe. Une séparation aléatoire placerait des relevés de la même machine et de la même journée à la fois en entraînement et en test. Le modèle mémoriserait la signature de la machine plutôt que le mécanisme de dégradation, et la performance mesurée serait fortement surestimée. La séparation doit être conduite par groupe de machines et respecter la chronologie (chapitre 027).
Point de vigilance sur le fenêtrage des agrégats. Toute fenêtre glissante doit être strictement antérieure à l'horodatage de l'observation. Une moyenne centrée sur l'instant courant intègre des mesures futures et produit une fuite qui ne se manifestera qu'en production.
| Domaine | Fuite la plus fréquente | Variable de disponibilité la plus critique |
|---|---|---|
| Attrition télécom | Colonnes renseignées uniquement pour les partants | Agrégats de contacts au support, à fenêtre bornée |
| Immobilier | Statistiques de prix calculées sur tout le jeu | Variables décrivant le déroulement de la vente |
| Maintenance industrielle | Codes de diagnostic postérieurs à la panne | Agrégats sur fenêtres glissantes strictement antérieures |
La disponibilité d'une colonne dans un fichier historique n'établit ni sa disponibilité au moment de la prédiction, ni sa légitimité. Identifiants, variables de conséquence et variables consolidées tardivement doivent être écartés avant toute modélisation.
Formulation correcte : « Une colonne devient une variable explicative après avoir satisfait quatre critères : disponibilité à l'instant de prédiction, absence de fuite, plausibilité métier et licéité. »
Le qualificatif provient du cadre expérimental où la variable est fixée par l'expérimentateur indépendamment du dispositif. Il ne prescrit aucune indépendance statistique entre les variables d'entrée, lesquelles sont généralement corrélées.
Formulation correcte : « Le terme indépendante est un héritage du plan d'expérience ; la corrélation entre variables explicatives est un phénomène distinct, la multicolinéarité, traitée au chapitre 017. »
Label désigne une valeur catégorielle assignée à une observation. Une cible numérique continue est une target sans être un label. Parler du « label » d'un problème de régression est un abus de langage qui signale une maîtrise incomplète du vocabulaire.
Formulation correcte : « La cible est un label en classification et une valeur numérique en régression ; target couvre les deux cas, label seulement le premier. »
Aucune grandeur n'est explicative ou cible par nature. Le montant d'une transaction est cible dans un projet de prévision du panier moyen et explicative dans un projet de détection de fraude.
Formulation correcte : « Le rôle d'une variable est assigné par la question posée, non par la variable elle-même. »
L'ajout de variables non informatives augmente la dimension de l'espace des caractéristiques, accroît la variance de l'estimation, favorise le surapprentissage et alourdit la chaîne de production. La relation entre nombre de variables et performance en généralisation n'est pas monotone.
Formulation correcte : « L'information pertinente améliore le modèle ; le nombre de colonnes, en lui-même, ne l'améliore pas. »
L'encodage des variables catégorielles, la construction de variables dérivées et la sélection modifient la dimension p. Sept colonnes sources peuvent produire onze dimensions, ou plusieurs centaines avec des variables à forte cardinalité.
Formulation correcte : « p désigne le nombre de composantes du vecteur effectivement soumis au modèle, après préparation. »
L'ordre des leviers est établi : définition de la cible, élimination des fuites, enrichissement de l'information, puis seulement choix de l'algorithme et optimisation des hyperparamètres. Inverser cet ordre conduit à consommer un budget important pour un gain marginal.
Formulation correcte : « Avant de changer de modèle, vérifier que l'information nécessaire à la prédiction figure effectivement dans les entrées. »
L'étiquetage est produit par un protocole faillible. Les désaccords entre annotateurs, les diagnostics erronés et les fraudes non détectées introduisent un bruit dans la cible qui borne la performance atteignable.
Formulation correcte : « La vérité terrain est une mesure de référence, non la vérité ; la qualité de l'étiquetage conditionne le plafond de performance du modèle. »
LA FORMULE MENTALE
FEATURES → MODÈLE → TARGET
ce qui est connu la fonction ce qui est cherché
à l'instant t_pred apprise et inconnu à t_pred
VARIABLE EXPLICATIVE — SYNONYMES ET ORIGINES
feature, caractéristique reconnaissance de formes
variable explicative statistique appliquée
variable indépendante plan d'expérience (Fisher, 1935)
variable d'entrée, input automatique, théorie des systèmes
prédicteur statistique de la régression
régresseur économétrie
covariable biostatistique, essais cliniques
attribut fouille de données, bases relationnelles
descripteur chimiométrie
VARIABLE CIBLE — SYNONYMES ET ORIGINES
target, cible Machine Learning
variable dépendante statistique expérimentale
variable réponse plans d'expérience
variable expliquée statistique francophone
variable endogène économétrie
output, sortie automatique
label, étiquette classification uniquement
vérité terrain télédétection, puis vision
gold standard biostatistique
TERMINOLOGIE DÉPENDANTE / INDÉPENDANTE
Héritage du plan d'expérience, inadapté au ML observationnel.
« Indépendante » ne signifie pas indépendante des autres variables.
« Dépendante » ne signifie pas causalement déterminée.
Le rôle est fonctionnel et réversible d'un projet à l'autre.
FORMALISATION
x = (x1, …, xp)ᵀ ∈ ℝ^p vecteur de caractéristiques
X ∈ ℝ^(n×p) matrice de conception
y ∈ 𝒴^n vecteur cible
f : 𝒳 → 𝒴 le modèle
ŷ = f(x) la prédiction
p ≠ nombre de colonnes du fichier source
LES QUATRE FILTRES, DANS CET ORDRE
1. Disponibilité à l'instant de la prédiction → sinon exclusion
2. Absence de fuite → sinon exclusion
3. Plausibilité métier → sinon examen
4. Licéité et éthique → sinon exclusion
La sélection statistique n'intervient qu'ensuite.
LE CRITÈRE PREMIER
t_obs ≤ t_pred, pour toutes les observations, sans exception.
Trois formes d'indisponibilité : temporelle, de latence, de périmètre.
LA HIÉRARCHIE DES LEVIERS
cible bien définie > absence de fuite > information nouvelle
> variables construites > volume > algorithme > hyperparamètresÉnoncé de synthèse
Les variables explicatives constituent l'intégralité de l'information dont dispose le modèle et la variable cible la grandeur qu'il doit estimer ; leur désignation varie selon la discipline d'origine sans que la notion change, la terminologie statistique de dépendance et d'indépendance étant un héritage expérimental inadapté au cadre observationnel du Machine Learning. Une observation se représente comme un vecteur de et le modèle comme une fonction définie sur cet espace. Une colonne ne devient une variable explicative qu'après avoir satisfait quatre critères, dont le premier est sa disponibilité effective à l'instant où la prédiction devra être produite ; et la qualité de cette information détermine la performance atteignable davantage que le choix de l'algorithme.
Quiz associés
006.1-quiz-relation-features-target.md006.2-quiz-variable-explicative.md006.3-quiz-variable-cible.md006.4-quiz-dependante-independante.md006.5-quiz-vecteur-espace-caracteristiques.md006.6-quiz-criteres-de-selection.md006.7-quiz-etudes-de-cas.mdChapitre suivant : 007-x-et-y-label-classe.md