Les formulations suivantes sont couramment employées pour justifier le choix entre classificação et regressão. Aucune n'est valide.
| Formulation entendue | Statut | Contre-exemple immédiat |
|---|---|---|
| « C'est un problème médical, donc de la classificação » | Faux | Prédire la glycémie à 3 mois est une regressão en contexte médical |
| « J'utilise un random forest, donc de la classificação » | Faux | RandomForestRegressor existe et traite des cibles réelles |
| « Mes variables d'entrée sont catégorielles, donc de la classificação » | Faux | Le type des entrées est indépendant du type de la cible |
| « La cible est stockée en entier, donc de la classificação » | Faux | Un nombre de visites mensuelles est un entier et relève de la regressão |
| « Il n'y a que deux valeurs possibles en sortie, donc de la regressão binaire » | Faux | Deux modalités non ordonnées définissent une classificação binaire |
Le critère unique est la structure mathématique de l'ensemble dans lequel la variável alvo prend ses valeurs. Ni le domaine d'application, ni l'algoritmo envisagé, ni le type des variables explicatives, ni le format de stockage n'interviennent dans cette qualification.
L'apprentissage supervisé, défini au chapitre 004, consiste à induire à partir d'un échantillon étiqueté une fonction
f : X → Y
où X désigne l'espace des variables explicatives et Y l'ensemble d'arrivée, c'est-à-dire l'ensemble des valeurs que la variável alvo peut prendre.
classificação et regressão partagent intégralement ce cadre. Elles partagent également l'échantillon d'apprentissage, la notion de generalização, la séparation treinamento/test (chapitre 026) et le risque de sobreajuste (chapitre 031). Elles se distinguent sur un seul point : la structure de Y.
Définition rigoureuse
Ensemble Y dans lequel la fonction cible prend ses valeurs, considéré non comme un simple ensemble de symboles mais comme une structure algébrique : on s'intéresse aux relations et opérations qui y sont définies — égalité, ordre total, distance, addition, espérance.
Traduction en langage courant
L'ensemble de toutes les réponses possibles, et ce que l'on a le droit de faire avec ces réponses : peut-on seulement dire qu'elles sont identiques ou différentes, peut-on les ranger, peut-on mesurer l'écart entre deux d'entre elles.
Point de vigilance
La structure de Y n'est jamais visible dans le fichier de dados. Une colonne contenant les valeurs 1, 2, 3 peut représenter trois espèces végétales (structure nominale) ou trois passages en atelier (structure numérique). Seule la connaissance du domaine tranche. La qualification est un acte d'analyse, pas une inspection de type informatique.
Énoncé directeur du chapitre
Le type de problème est déterminé par la nature de la variável alvo. Il n'est déterminé ni par le domaine métier, ni par l'algoritmo envisagé, ni par le type des variables explicatives.
Définition rigoureuse
Tâche d'apprentissage supervisé consistant à induire, à partir d'un échantillon d'observations étiquetées, une fonction f : X → Y où l'ensemble d'arrivée Y = {c₁, c₂, …, } est fini et non muni d'une relation d'ordre intrinsèque. Les éléments de Y sont appelés classes, catégories ou modalités. K désigne le nombre de classes ; K = 2 définit la classificação binaire, K > 2 la classificação multiclasse (chapitre 011).
Structure de l'ensemble d'arrivée
La seule relation définie sur Y est l'égalité. Deux classes sont identiques ou distinctes ; aucune n'est « supérieure », et aucune distance n'est définie entre elles. La proposition « la classe chien est plus proche de la classe chat que de la classe cheval » n'a aucun statut mathématique dans le cadre standard.
Traduction en langage courant
Ranger chaque cas dans l'un des casiers d'un ensemble fixé à l'avance, sans que ces casiers soient classés du plus petit au plus grand.
Point de vigilance
L'ensemble des classes est déterminé avant l'apprentissage et fait partie de la spécification du problème. Un modelo de classificação ne peut jamais prédire une classe absente de l'échantillon d'treinamento. L'apparition d'une modalité nouvelle em produção constitue une rupture de spécification, non une erreur de previsão.
| Opération sur deux valeurs cibles | classificação | Justification |
|---|---|---|
| Tester l'égalité y₁ = y₂ | Licite | L'égalité est la relation fondatrice de Y |
| Ordonner y₁ < y₂ | Illicite | Aucun ordre intrinsèque sur un ensemble nominal |
| Calculer l'écart y₁ − y₂ | Illicite | La soustraction n'est pas définie |
| Calculer une moyenne des valeurs cibles | Illicite | L'espérance d'une variable nominale n'a pas de sens |
| Dénombrer les occurrences d'une classe | Licite | Fournit la distribution des classes (chapitre 050) |
Conséquence directe : l'erreur d'un modelo de classificação ne se mesure pas par un écart mais par un dénombrement de désaccords, formalisé par la matriz de confusão (chapitre 052). Il n'existe pas d'erreur « petite » ou « grande » sur une previsão unique : elle est correcte ou incorrecte.
Un classifieur produit en réalité deux sorties distinctes, dont la confusion est une source d'erreur fréquente.
| Sortie | Nature | Méthode scikit-learn | Ensemble d'arrivée |
|---|---|---|---|
| Score ou probabilité par classe | Vecteur de K réels sommant à 1 | predict_proba() | [0, 1]^K |
| classe prédite | Une modalité | predict() | {c₁, …, } |
Le passage du premier au second s'effectue par application d'une règle de décision, le plus souvent un seuil en binaire (chapitre 062) ou l'argument du maximum en multiclasse. La production d'un score réel intermédiaire ne transforme pas le problème en regressão : l'ensemble d'arrivée du problème reste l'ensemble fini des classes, le score n'étant qu'un intermédiaire de calcul.
Définition rigoureuse
Sous-ensemble de l'espace des variables explicatives X séparant les régions associées à des classes prédites différentes. Formellement, pour un classifieur binaire fondé sur une fonction de score s(x) et un seuil t, la frontière est l'ensemble {x ∈ X : s(x) = t}.
Traduction en langage courant
La ligne, la surface ou la limite au-delà de laquelle le modelo change d'avis sur la catégorie à attribuer.
Point de vigilance
L'objet géométrique appris en classificação est une partition de l'espace d'entrée. En regressão, l'objet appris est une surface de réponse définie sur tout l'espace d'entrée. Cette différence de nature explique que certains algorithmes se transposent mal d'un cadre à l'autre.
Un centre de tri dispose d'un nombre fixe de casiers, un par région de destination. Chaque colis doit être placé dans exactement un casier. Le trieur ne peut pas inventer un casier, ni placer un colis « entre » deux casiers.
Se tromper de casier est une erreur, sans degré : un colis destiné à Lyon placé dans le casier Marseille et un colis destiné à Lyon placé dans le casier Lille sont deux erreurs équivalentes du point de vue du tri, même si les conséquences opérationnelles diffèrent.
L'hésitation du trieur — « ce colis est probablement pour Lyon, peut-être pour Grenoble » — correspond au score de probabilité. La décision finale de le déposer dans un casier correspond à la classe prédite.
| Domaine | Question métier | Ensemble d'arrivée | K |
|---|---|---|---|
| Paiement | Cette transaction est-elle frauduleuse ? | {fraude, normal} | 2 |
| Messagerie | Ce courriel est-il indésirable ? | {spam, légitime} | 2 |
| Santé | Ce patient présente-t-il la pathologie ? | {malade, sain} | 2 |
| Télécommunications | Ce client va-t-il résilier ? | {résiliation, maintien} | 2 |
| Botanique | De quelle espèce s'agit-il ? | {setosa, versicolor, virginica} | 3 |
| Industrie | Quel type de défaut affecte cette pièce ? | {rayure, fissure, porosité, aucun} | 4 |
Définition rigoureuse
Tâche d'apprentissage supervisé consistant à induire, à partir d'un échantillon d'observations étiquetées, une fonction f : X → Y où l'ensemble d'arrivée Y est un sous-ensemble de ℝ — le plus souvent ℝ tout entier, ℝ⁺, ou un intervalle borné. L'ensemble d'arrivée est donc muni d'un ordre total et d'une distance, ce qui confère un sens à la quantité y − ŷ, appelée résidu (chapitre 066).
Formulation statistique
La regressão estime une caractéristique de la loi conditionnelle de Y sachant X. La regressão par moindres carrés estime l'espérance conditionnelle E[Y | X = x] ; la regressão quantile estime un quantile conditionnel ; la regressão sur la valeur absolue estime la médiane conditionnelle.
Traduction en langage courant
Estimer une quantité, c'est-à-dire produire un nombre situé sur une échelle graduée, sur laquelle il est possible de dire de combien on s'est trompé.
Point d'étymologie
Le terme provient de Francis Galton (1886), qui observe la « regressão vers la médiocrité » — aujourd'hui regressão vers la moyenne — dans la transmission de la taille entre générations. Le mot désigne aujourd'hui, par extension, toute estimation d'une cible numérique. Il n'exprime aucune notion de retour en arrière.
| Opération sur deux valeurs cibles | regressão | Conséquence pratique |
|---|---|---|
| Tester l'égalité y₁ = y₂ | Licite mais sans intérêt | La probabilité d'égalité exacte est nulle sur une variable continue |
| Ordonner y₁ < y₂ | Licite | Permet les métriques fondées sur les rangs |
| Calculer l'écart y₁ − y₂ | Licite | Fonde la notion de résidu |
| Calculer une moyenne | Licite | Fonde la baseline « prédire la moyenne » |
| Élever l'écart au carré | Licite | Fonde MSE et RMSE (chapitres 068 et 069) |
Conséquence directe : en regressão, l'erreur est graduée. Prédire 248 000 € pour un bien vendu 250 000 € est un résultat de qualité ; prédire 90 000 € pour le même bien est une défaillance. La distinction entre ces deux situations est impossible à formuler dans le cadre de la classificação, où les deux prédictions seraient également « fausses ».
| Sortie | Nature | Usage |
|---|---|---|
| previsão ponctuelle | Un réel ŷ | Sortie standard de predict() |
| Intervalle de previsão | Un couple [, ] | Communication de l'incertitude |
| Quantiles conditionnels | Plusieurs réels | Décision asymétrique, gestion de stock |
Un régresseur ne dispose d'aucun équivalent de predict_proba() : il n'existe
pas de « probabilité de chaque valeur possible » lorsque l'ensemble d'arrivée
est continu. Cette asymétrie est développée au chapitre 029.
Un pharmacien range des boîtes dans des tiroirs étiquetés : antibiotiques, antalgiques, antihistaminiques. Une boîte est dans le bon tiroir ou dans le mauvais. Il n'existe pas de « presque bon tiroir ». C'est une classificação.
Le même pharmacien pèse une préparation magistrale et vise 250 mg. Il obtient 248 mg : l'écart est de 2 mg, quantifiable, et acceptable au regard de la tolérance pharmaceutique. Il obtient 90 mg : l'écart est de 160 mg, et la préparation est inutilisable. C'est une regressão.
Le tiroir n'admet pas de degré. La balance en admet un. Toute la différence entre les deux cadres tient dans cette propriété de l'échelle de sortie.
Le tableau suivant place côte à côte, pour un même domaine métier, une cible relevant de la classificação et une cible relevant de la regressão. Il établit que le domaine ne détermine rien.
| Domaine | Cible catégorielle → classificação | Cible numérique → regressão |
|---|---|---|
| Immobilier | Le bien se vendra-t-il sous 90 jours ? | Prix de vente en euros |
| Santé | Le patient est-il diabétique ? | Taux d'HbA1c en pourcentage |
| Énergie | Le pic de consommation sera-t-il dépassé ? | Consommation en kWh de la journée |
| Météorologie | Pleuvra-t-il demain ? | Température maximale en °C |
| Paiement | La transaction est-elle frauduleuse ? | Montant de la perte en cas de fraude |
| Ressources humaines | Le candidat acceptera-t-il l'offre ? | Salaire d'acceptation en euros |
| Industrie | La pièce est-elle conforme ? | Cote mesurée en millimètres |
| Marketing | Le client va-t-il souscrire ? | Chiffre d'affaires à 12 mois |
Lecture du tableau : chaque ligne décrit un unique domaine, souvent un unique conjunto de dados, avec les mêmes variables explicatives. Seule la colonne sélectionnée comme cible change, et avec elle le type de problème.
Que cherche-t-on exactement à produire, et de quelle nature est la valeur produite : une catégorie prise dans une liste fixée, ou un nombre situé sur une échelle ?
Sa forme abrégée, utilisable en réunion de cadrage :
| Forme de la question métier | Type de problème |
|---|---|
| « Quelle catégorie ? », « Lequel ? », « Est-ce que … ? », « Oui ou non ? » | classificação |
| « Combien ? », « Quelle quantité ? », « Quel montant ? », « Quelle durée ? » | regressão |
Point de vigilance : la question doit porter sur la valeur produite par le modelo, non sur la décision prise ensuite par l'organisation. Un modelo estimant un montant de perte (regressão) peut alimenter une décision binaire d'acceptation ou de refus. La décision aval ne modifie pas la nature de la sortie du modelo.
Lorsque la question métier reste ambiguë, le test suivant tranche mécaniquement. Il s'applique aux valeurs observées de la cible.
| Opération testée | Interprétation si le résultat a un sens métier |
|---|---|
| 1. y₁ = y₂ ? | Toujours vrai : condition minimale, ne discrimine pas |
| 2. y₁ < y₂ ? | Un ordre existe : la cible est au moins ordinale |
| 3. y₁ − y₂ interprétable comme un écart ? | Une métrique existe : la cible est numérique |
Règle de lecture
Exemple d'application au code postal : deux codes postaux peuvent être comparés par égalité ; l'ordre 69001 < 75015 n'exprime rien de métier ; la différence 75015 − 69001 = 6014 n'est pas une distance. Le code postal est une variable nominale malgré son stockage numérique.
Définition rigoureuse
Une variable aléatoire est dite discrète lorsque l'ensemble de ses valeurs possibles est fini ou infini dénombrable. Elle est dite continue lorsque cet ensemble est un intervalle non dégénéré de ℝ et que sa fonction de répartition est continue, la probabilité d'une valeur ponctuelle étant alors nulle.
Traduction en langage courant
Discret : les valeurs se comptent une par une, et entre deux valeurs voisines il n'y a rien. Continu : entre deux valeurs, aussi proches soient-elles, il en existe une infinité d'autres.
Point de vigilance — la confusion centrale
Discret n'est pas synonyme de catégoriel. Un nombre de visites mensuelles est discret (0, 1, 2, …) et pourtant parfaitement numérique : l'ordre et l'écart y ont un sens. La dichotomie utile pour qualifier un problème d'apprentissage n'est pas discret/continu mais nominal/numérique.
Point de vigilance — la mesure physique
Toute mesure enregistrée est discrète par construction, du fait de la résolution finale de l'instrument et de la représentation en virgule flottante. Une température relevée au dixième de degré prend un nombre fini de valeurs. Elle est traitée comme continue, car sa structure sous-jacente est un intervalle de ℝ.
| Cible | Discrète ou continue | Nominale ou numérique | Type de problème |
|---|---|---|---|
| Espèce d'iris | Discrète | Nominale | classificação |
| Statut de transaction | Discrète | Nominale | classificação |
| Code postal | Discrète | Nominale | classificação |
| Nombre de visites mensuelles | Discrète | Numérique | regressão |
| Nombre de sinistres déclarés | Discrète | Numérique | regressão |
| Température maximale | Continue | Numérique | regressão |
| Prix de vente | Continue | Numérique | regressão |
Scikit-learn expose une fonction d'inspection du type de cible. Elle constitue un contrôle utile, à condition d'en connaître les limites.
import numpy as np
from sklearn.utils.multiclass import type_of_target
cibles = {
"statut_transaction ": np.array(["normal", "fraude", "normal", "fraude"]),
"espece_iris ": np.array(["setosa", "versicolor", "virginica", "setosa"]),
"temperature_celsius ": np.array([18.4, 21.0, 19.7, 23.2]),
"prix_vente_eur ": np.array([245000.0, 312500.0, 189900.0, 405000.0]),
"nb_visites_mensuelles ": np.array([0, 3, 1, 12]),
"note_satisfaction_1_5 ": np.array([1, 3, 2, 5]),
}
for nom, y in cibles.items():
print(f"{nom} dtype={str(y.dtype):8s} -> type_of_target = {type_of_target(y)}")Sortie
statut_transaction dtype=<U6 -> type_of_target = binary
espece_iris dtype=<U10 -> type_of_target = multiclass
temperature_celsius dtype=float64 -> type_of_target = continuous
prix_vente_eur dtype=float64 -> type_of_target = multiclass
nb_visites_mensuelles dtype=int64 -> type_of_target = multiclass
note_satisfaction_1_5 dtype=int64 -> type_of_target = multiclassInterprétation
Les trois premières lignes sont conformes à l'analyse métier. Les trois suivantes ne le sont pas :
prix_vente_eur est une cible de regressão, qualifiée multiclass parce que
les quatre valeurs, bien que de type flottant, sont entières et peu
nombreuses ;nb_visites_mensuelles est une cible de regressão au sens du test des trois
opérations, qualifiée multiclass parce qu'elle est entière ;note_satisfaction_1_5 est une cible ordinale, que la fonction ne distingue
pas d'une cible nominale.Conclusion opérationnelle : type_of_target applique une heuristique
syntaxique fondée sur le type de stockage et le nombre de valeurs distinctes.
Elle détecte des incohérences de format ; elle ne qualifie pas un problème. La
qualification demeure un acte d'analyse fondé sur la connaissance du domaine.
Cinq configurations résistent à la qualification directe. Chacune appelle une décision documentée, non un choix par défaut.
Nature : ensemble fini, muni d'un ordre métier signifiant, sans distance interprétable entre modalités consécutives. Exemples : niveau de risque {faible, moyen, élevé}, note de satisfaction de 1 à 5, stade tumoral I à IV, notation financière de AAA à D.
Le dilemme : traiter la cible en classificação multiclasse revient à détruire l'information d'ordre — confondre « élevé » avec « faible » et avec « moyen » compte pour la même erreur. La traiter en regressão revient à postuler une équidistance entre modalités, hypothèse généralement fausse : l'écart de gravité entre les stades I et II n'égale pas celui entre III et IV.
Choix retenu : classificação, en tant que qualification du problème, l'ensemble d'arrivée restant fini. Deux aménagements sont recommandés :
| Aménagement | Mise en oeuvre | Justification |
|---|---|---|
| Métrique sensible à l'ordre | Kappa quadratiquement pondéré, MAE sur les rangs | Pénalise davantage les erreurs éloignées dans l'ordre |
| modelo ordinal dédié | modelo à cotes proportionnelles (McCullagh, 1980), décomposition en K−1 classifieurs binaires cumulés | Exploite l'ordre sans postuler l'équidistance |
Recours à la regressão : acceptable lorsque le nombre de modalités est élevé (à partir d'une dizaine) et que l'équidistance est défendable, la previsão réelle étant alors arrondie. Ce choix doit être justifié explicitement. La classificação ordinale est détaillée au chapitre 011.
Nature : ensemble des entiers naturels, infini dénombrable, ordonné, muni d'une distance interprétable. Exemples : nombre de sinistres annuels, nombre de visites, nombre de défauts par lot.
Choix retenu : regressão. Les trois opérations du test ont un sens ; l'ensemble d'arrivée n'est pas fini. Le fait que les valeurs soient entières ne constitue pas un critère de classificação.
| Point d'attention | Traitement recommandé |
|---|---|
| Support positif et asymétrie forte | Perte de déviance de Poisson ou binomiale négative plutôt que MSE |
| Surdispersion (variância supérieure à la moyenne) | modelo binomial négatif |
| Excès de zéros | modelo à inflation de zéros, ou décomposition en un classifieur « zéro ou non » suivi d'un régresseur sur les non-zéros |
| previsão réelle non entière | Arrondi en post-traitement, jamais dans la função de perda |
Erreur fréquente : traiter un comptage borné en pratique (0, 1, 2, 3 sinistres) comme une classificação à quatre classes. Cette formulation interdit au modelo de prédire 4, détruit l'ordre et rend le résidu ininterprétable.
Nature : durée jusqu'à la survenue d'un événement, observée de façon incomplète pour une partie des sujets — le contrat est toujours actif, le patient est encore en vie, la machine n'est pas encore tombée en panne à la fin de la période d'observação.
Définition rigoureuse
Situation dans laquelle la durée d'intérêt T d'un sujet n'est pas observée directement, seule étant disponible la donnée du couple (min(T, C), 1{T ≤ C}), où C désigne la durée de suivi. L'information disponible est alors « T est supérieure à C » et non la valeur de T.
Traduction en langage courant
On sait que l'événement n'était pas encore survenu quand on a cessé d'observer, sans savoir quand il surviendra.
Conséquence méthodologique
Écarter les observations censurées biaise l'estimation vers les durées courtes, car les sujets à longue durée de vie sont précisément ceux qui sont censurés. Remplacer la durée censurée par la durée de suivi biaise également l'estimation, vers le bas. Le cadre approprié est l'analyse de survie : estimateur de Kaplan-Meier (1958), modelo à risques proportionnels de Cox (1972), forêts de survie.
Point de vigilance
La censure n'est pas une donnée manquante au sens du chapitre 018. Une durée censurée porte une information partielle exploitable, non une absence d'information.
Choix retenu : ni classificação ni regressão au sens strict lorsque la censure est substantielle. Le tableau suivant fixe la conduite à tenir.
| Situation | Formulation retenue | Justification |
|---|---|---|
| Historique complet, tous les événements observés | regressão sur la durée | Aucune censure, cadre standard applicable |
| Censure présente, estimation de la durée requise | Analyse de survie | Seul cadre exploitant correctement les observations censurées |
| Censure présente, décision à horizon fixe H | classificação binaire « événement avant H » | Valide à condition de ne retenir que les sujets dont le suivi atteint H |
| Censure importante et suivi hétérogène | Analyse de survie obligatoire | La restriction du champ détruirait une part majeure de l'échantillon |
Nature : la valeur à produire est un nombre de l'intervalle [0, 1]. La qualification dépend entièrement de ce qui est observé dans l'échantillon d'treinamento, non de ce qui est demandé en sortie.
| Ce qui est observé pour chaque ligne | Type de problème | Modélisation |
|---|---|---|
| Une issue binaire, 0 ou 1 | classificação binaire | Classifieur probabiliste, sortie predict_proba, perte log loss (chapitre 061), calibration vérifiée |
| Une proportion mesurée, par exemple un taux de conversion par magasin | regressão sur [0, 1] | regressão bêta, ou regressão sur la transformation logit, ou perte adaptée au support borné |
Point central : demander une probabilité en sortie ne fait pas d'un problème une regressão. Un modelo de détection de fraude renvoyant p = 0,83 reste un modelo de classificação : la cible observée à l'treinamento vaut 0 ou 1. La sortie continue est une estimation de P(Y = 1 | X = x), pas une cible numérique apprise comme telle.
Point de vigilance : un score de probabilité produit par un classifieur n'est pas nécessairement calibré. Un score de 0,83 ne signifie pas que 83 % des cas recevant ce score sont positifs, sauf vérification explicite (chapitre 061).
Nature : la cible disponible est numérique — un montant, un âge, un taux — et l'organisation demande une sortie en classes définies par seuils : « client à faible, moyen ou fort potentiel », « risque acceptable ou inacceptable ».
Choix retenu : regressão sur la cible numérique, puis application du seuil à la previsão. La discrétisation préalable de la cible détruit de l'information et dégrade la puissance statistique ; cette pratique est documentée dans la littérature méthodologique sous le terme de dichotomisation abusive (Royston, Altman et Sauerbrei, 2006).
| Critère | Discrétiser la cible avant l'apprentissage | Régresser puis seuiller |
|---|---|---|
| Information conservée | Perte de la variation intra-classe | Intégralité conservée |
| Effet de seuil | Deux valeurs séparées par 1 € deviennent deux classes différentes | Aucun : traitement continu |
| Changement de seuil métier | Réétiquetage et rétreinamento complets | Modification d'une constante, sans rétreinamento |
| Seuils multiples simultanés | Un modelo par découpage | Un modelo unique |
| Lisibilité pour le métier | Immédiate | Requiert une couche de restitution |
Exception admise : lorsque la cible numérique sous-jacente n'est pas observable et que seule la classe est enregistrée dans le système source — une tranche de revenu déclarative, un niveau de risque attribué par un expert. La donnée disponible est alors nativement catégorielle et le problème est une classificação, sans reformulation possible.
| Cas | Structure de la cible | Choix retenu | Motif déterminant |
|---|---|---|---|
| Ordinale | Fini, ordonné, non métrique | classificação, avec métrique et modelo sensibles à l'ordre | L'ensemble d'arrivée reste fini |
| Comptage | Entiers, infini, métrique | regressão, perte de Poisson | Les trois opérations ont un sens |
| Durée censurée | ℝ⁺ partiellement observé | Analyse de survie, ou classificação à horizon fixe | La censure invalide la regressão naïve |
| Probabilité | [0, 1] | classificação si l'étiquette observée est binaire, regressão si une proportion est mesurée | La qualification dépend de la cible observée |
| Numérique discrétisée | ℝ recodé en classes | regressão puis seuil, sauf cible nativement catégorielle | La discrétisation détruit de l'information |
La qualification intervient à l'étape 3 du cycle de vie (chapitre 012). Toutes les étapes ultérieures en dépendent.
| Dimension | classificação | regressão |
|---|---|---|
| Ensemble d'arrivée | {c₁, …, }, fini, non ordonné | Sous-ensemble de ℝ, ordonné et métrique |
| Objet appris | Partition de l'espace d'entrée, frontière de décision | Surface de réponse définie sur tout l'espace d'entrée |
| Quantité estimée | P(Y = c sachant X = x), probabilité conditionnelle de chaque classe | E[Y sachant X = x], espérance conditionnelle, ou un quantile conditionnel |
| Sortie brute du modelo | Vecteur de K scores | Un réel |
| Sortie livrée | Une classe, après application d'un seuil ou d'un argmax | La valeur, éventuellement encadrée d'un intervalle |
| Notion d'erreur | Désaccord binaire, dénombré | Résidu signé, gradué |
| Fonctions de perte usuelles | Entropie croisée, log loss, hinge, focal loss ; critères de division Gini et entropie | MSE, MAE, Huber, quantile pinball, déviance de Poisson, RMSLE |
| Métriques d'évaluation | accuracy, precisão, recall, spécificité, F1, F-bêta, balanced accuracy, log loss, ROC-AUC, PR-AUC | MAE, MSE, RMSE, R², R² ajusté, MAPE, sMAPE, MedAE, RMSLE |
| Algorithmes représentatifs | regressão logistique, arbre, floresta aleatória, boosting, SVC, k-NN, Naive Bayes, MLP | regressão linéaire, Ridge, Lasso, ElasticNet, arbre, floresta aleatória, boosting, SVR, k-NN, MLP |
| Suffixe scikit-learn | …Classifier | …Regressor |
| Baseline de référence | Prédire systématiquement la classe majoritaire | Prédire systématiquement la moyenne ou la médiane |
| Découpage des dados | Stratification sur la cible recommandée (chapitre 027) | Découpage aléatoire, stratification par tranches si la cible est très asymétrique |
| Pathologie de distribution | Déséquilibre des classes (chapitres 050 et 051) | Asymétrie, valeurs extrêmes, hétéroscédasticité |
| Réglage post-treinamento | Seuil de décision (chapitre 062) | Aucun équivalent direct ; recalibrage éventuel de l'échelle |
| Diagnostic d'erreur | matriz de confusão, analyse FP/FN | Graphe des résidus, résidus contre valeurs prédites |
| Nature de l'arbitrage métier | Quelle erreur coûte le plus cher, faux positif ou faux négatif | Quelle erreur coûte le plus cher, sur-estimation ou sous-estimation |
| Surveillance em produção | desvio de la distribution des classes prédites | desvio de la distribution et de la moyenne des prédictions |
La função de perda n'est pas la métrique. La perte est optimisée pendant l'treinamento et doit être dérivable pour les algorithmes à gradient ; la métrique évalue le modelo et répond à une question métier. Un classifieur optimise la log loss et se juge sur le recall ; un régresseur optimise le MSE et se juge sur le MAE. Cette distinction est développée au chapitre 030.
Le seuil de décision n'existe qu'en classificação binaire. Il constitue un levier post-treinamento puissant : à modelo inchangé, faire varier le seuil déplace l'équilibre entre faux positifs et faux négatifs. La regressão n'offre aucun levier équivalent sur le modelo lui-même ; le seuil éventuellement appliqué à sa sortie relève de la règle de décision aval, non du modelo.
Un besoin métier n'est pas un problème d'apprentissage. Il devient un problème d'apprentissage au moment où une variável alvo est choisie. Lorsque plusieurs cibles sont disponibles pour répondre au même besoin, plusieurs formulations coexistent, éventuellement dans des cadres différents.
Le cas de référence : la maintenance prédictive. Un exploitant surveille un parc de pompes industrielles instrumentées. Le besoin est unique : intervenir avant la défaillance sans multiplier les immobilisations inutiles. Deux cibles sont constructibles à partir du même historique et des mêmes capteurs.
Définition rigoureuse
Durée séparant l'instant d'observação de l'instant de défaillance d'un équipement, conditionnellement à son état constaté et à son historique d'exploitation. Elle constitue la cible de référence des approches pronostiques en maintenance conditionnelle.
Traduction en langage courant
Le nombre de jours qu'il reste à la machine avant la panne, estimé d'après son état actuel.
Point de vigilance
L'étiquetage d'une durée de vie résiduelle exige des cycles de vie complets : la valeur n'est connue que pour les équipements effectivement allés jusqu'à la défaillance. Les équipements encore en service au terme de la période d'observação sont censurés au sens de la section 5.3. Un conjunto de dados de maintenance comporte quasi systématiquement de la censure, ce qui constitue le premier obstacle pratique à la formulation en regressão.
Le protocole suivant construit un conjunto de dados de dégradation, desvio les deux cibles des mêmes variables explicatives, entraîne les deux modèles, et cale pour chacun son propre seuil de décision sur une partition de validation, au regard d'une fonction de coût explicite : 800 € pour une intervention préventive, 12 000 € pour une défaillance subie.
import numpy as np
from sklearn.ensemble import RandomForestClassifier, RandomForestRegressor
from sklearn.model_selection import train_test_split
from sklearn.metrics import precision_score, recall_score, mean_absolute_error
rng = np.random.default_rng(42)
n = 6000
# Parc de pompes industrielles : les MEMES variables explicatives
heures = rng.uniform(0, 20000, n) # heures cumulées
vibration = 1.2 + 0.00018 * heures + rng.normal(0, 0.35, n) # mm/s RMS
temp = 55 + 0.0011 * heures + rng.normal(0, 3.0, n) # °C au palier
delta_p = 2.6 - 0.00007 * heures + rng.normal(0, 0.20, n) # bar
nb_maint = rng.poisson(0.5 + heures / 9000) # interventions passées
usure = 0.55 * vibration + 0.035 * temp - 0.9 * delta_p + 0.00004 * heures
rul = 300 * np.exp(-0.5 * usure) * np.exp(rng.normal(0, 0.22, n)) # jours restants
X = np.column_stack([heures, vibration, temp, delta_p, nb_maint])
y_reg = rul # cible continue -> RÉGRESSION
y_clf = (rul <= 30).astype(int) # cible binaire -> CLASSIFICATION
Xtr, Xte, yr_tr, yr_te, yc_tr, yc_te = train_test_split(
X, y_reg, y_clf, test_size=0.3, random_state=0, stratify=y_clf)
Xtr, Xva, yr_tr, yr_va, yc_tr, yc_va = train_test_split(
Xtr, yr_tr, yc_tr, test_size=0.25, random_state=0, stratify=yc_tr)
C_PREV, C_PANNE = 800, 12000 # euros : intervention préventive / défaillance subie
def cout(y_vrai, pred):
return int(pred.sum()) * C_PREV + int(((y_vrai == 1) & (pred == 0)).sum()) * C_PANNE
clf = RandomForestClassifier(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yc_tr)
reg = RandomForestRegressor(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yr_tr)
p_va, p_te = clf.predict_proba(Xva)[:, 1], clf.predict_proba(Xte)[:, 1]
r_va, r_te = reg.predict(Xva), reg.predict(Xte)
# Chaque formulation reçoit son seuil de décision, calé sur le coût, en validation
seuil_a = min(np.arange(0.02, 0.61, 0.01), key=lambda s: cout(yc_va, (p_va >= s).astype(int)))
seuil_b = min(np.arange(10, 121, 1), key=lambda t: cout(yc_va, (r_va <= t).astype(int)))
print(f"Seuils calés sur la validation : A p >= {seuil_a:.2f} B RUL_pred <= {seuil_b} jours")
print(f"MAE de B sur la durée de vie résiduelle : {mean_absolute_error(yr_te, r_te):.1f} jours")
print(f"Coût de référence, aucune alerte : {int(yc_te.sum()) * C_PANNE} EUR\n")
for nom, pred in [("A - classification binaire ", (p_te >= seuil_a).astype(int)),
("B - régression sur la durée vie", (r_te <= seuil_b).astype(int))]:
print(f"{nom} precision={precision_score(yc_te, pred, zero_division=0):.3f} "
f"rappel={recall_score(yc_te, pred):.3f} alertes={int(pred.sum()):3d} "
f"manquées={int(((yc_te == 1) & (pred == 0)).sum()):2d} coût={cout(yc_te, pred):6d} EUR")
print("\nB - horizon d'intervention modifié sans réentraînement :")
for h in (60, 90):
cible_h, pred_h = (yr_te <= h).astype(int), (r_te <= h).astype(int)
print(f" horizon {h:2d} j : precision={precision_score(cible_h, pred_h):.3f} "
f"rappel={recall_score(cible_h, pred_h):.3f} alertes={int(pred_h.sum()):3d}")Sortie
Seuils calés sur la validation : A p >= 0.05 B RUL_pred <= 40 jours
MAE de B sur la durée de vie résiduelle : 18.5 jours
Coût de référence, aucune alerte : 2076000 EUR
A - classification binaire precision=0.431 rappel=0.954 alertes=383 manquées= 8 coût=402400 EUR
B - régression sur la durée vie precision=0.486 rappel=0.913 alertes=325 manquées=15 coût=440000 EUR
B - horizon d'intervention modifié sans réentraînement :
horizon 60 j : precision=0.900 rappel=0.888 alertes=668
horizon 90 j : precision=0.932 rappel=0.927 alertes=979Interprétation
| observação | Lecture |
|---|---|
| Les deux formulations réduisent le coût de 2 076 000 € à environ 0,4 M€ | Le besoin est traitable dans les deux cadres ; la qualification ne se joue pas sur la faisabilité |
| A obtient 402 400 € contre 440 000 € pour B sur l'horizon de 30 jours | La classificação optimise directement la séparation à l'horizon considéré ; la regressão optimise l'erreur sur toute l'échelle des durées, y compris là où aucune décision ne se joue |
| B affiche une precisão légèrement supérieure et 58 alertes de moins, pour 7 défaillances manquées de plus | Les deux formulations n'occupent pas le même point du compromis precisão-recall ; la comparaison n'a de sens qu'à fonction de coût fixée |
| Le seuil optimal de B est 40 jours, non 30 | La sortie d'un régresseur ne s'utilise pas avec le seuil métier brut : elle est régressée vers la moyenne et doit être recalée empiriquement |
| B traite les horizons 60 et 90 jours avec le même modelo entraîné | Changer d'horizon en formulation A impose un réétiquetage et un rétreinamento complets |
| Le MAE de B est de 18,5 jours | Une erreur moyenne de 18,5 jours rend la formulation B inexploitable pour un horizon de 7 ou 14 jours, information que la seule métrique de classificação ne révèle pas |
| Critère | Oriente vers la classificação | Oriente vers la regressão |
|---|---|---|
| Horizon de décision | Unique, fixe, stable dans le temps | Multiple, variable, ou négocié au cas par cas |
| Disponibilité des étiquettes | Seule l'occurrence de l'événement est enregistrée | Les cycles de vie complets sont documentés |
| Censure dans l'historique | Importante : la classificação à horizon fixe est plus robuste | Faible ou traitable par analyse de survie |
| Volume d'événements | Faible : concentrer la capacité du modelo sur la frontière | Élevé : la richesse de la cible continue est exploitable |
| Nature de la décision aval | Binaire, immédiate, sans priorisation | Ordonnancement, planification, allocation de ressources |
| Besoin de hiérarchiser les cas | Satisfait par le score de probabilité | Satisfait par la valeur prédite, directement interprétable |
| Communication au métier | « 83 % de risque sous 30 jours » | « environ 45 jours restants » |
| Sensibilité au changement de politique | Faible : tout changement de seuil impose un rétreinamento | Forte : un changement d'horizon est une constante à modifier |
| Contrôle du compromis d'erreurs | Direct, par le seuil de décision | Indirect, par le seuil appliqué à la sortie |
Règle de conduite : lorsque les deux formulations sont réalisables, les construire toutes deux, les évaluer sur la même fonction de coût métier et sur le même jeu de test, puis trancher sur ce résultat. La comparaison de métriques hétérogènes — un MAE contre un F1 — ne constitue pas un arbitrage.
Un carrefour peut être signalé de deux façons. Le feu tricolore fournit une catégorie : rouge, orange, vert. Le compte à rebours affiche un nombre de secondes restantes.
Le feu suffit à décider s'il faut s'arrêter : la décision est binaire et son horizon est immédiat. Le compte à rebours permet en outre d'anticiper, de moduler sa vitesse et de coordonner plusieurs véhicules ; il exige en revanche une information plus riche et plus difficile à produire.
Le choix entre les deux dispositifs ne tient pas au carrefour, mais à ce que l'on veut pouvoir décider et à la precisão réellement atteignable.
Les énoncés « le médical, c'est de la classificação » ou « la finance, c'est de la regressão » n'ont aucun fondement. Un même service hospitalier produit des problèmes de classificação (diagnostic) et de regressão (durée de séjour, posologie, taux biologique).
Formulation correcte : « Le type de problème est déterminé par la structure de l'ensemble des valeurs que peut prendre la variável alvo, indépendamment du domaine d'application. »
Les familles algorithmiques majeures — arbres, forêts, boosting, k-NN, SVM, réseaux de neurones — existent dans les deux variantes. Le choix de l'algoritmo intervient après la qualification et ne peut donc la déterminer.
Formulation correcte : « La cible qualifie le problème ; le problème restreint l'ensemble des algorithmes admissibles ; l'algoritmo est choisi dans cet ensemble. »
La regressão logistique est un modelo de classificação. Le terme « regressão » y désigne la regressão linéaire opérée sur le logit de la probabilité, non la nature de la cible, qui est catégorielle. Le chapitre 036 détaille ce point.
Formulation correcte : « La regressão logistique modélise linéairement le logarithme des cotes d'une cible binaire ; elle relève de la classificação. »
Un code postal, un identifiant de gamme de produit ou un code de département
sont stockés en entier sans constituer des quantités. Réciproquement, un nombre
de sinistres stocké en entier constitue une quantité. L'inspection du dtype
ne remplace pas l'analyse sémantique.
Formulation correcte : « Le type informatique de la colonne est une propriété du format de stockage ; la structure de l'ensemble d'arrivée est une propriété du domaine. »
Découper une cible numérique en tranches avant l'apprentissage réduit la puissance statistique, introduit des effets de seuil arbitraires et rend le modelo inutilisable dès que les seuils métier évoluent. La lisibilité par les équipes métier s'obtient en discrétisant la previsão, pas la cible.
Formulation correcte : « Le modelo est appris sur la cible numérique ; la mise en classes est appliquée à la sortie, dans la couche de restitution. »
Un classifieur binaire produit un score continu dans [0, 1]. Cette sortie continue est une estimation de la probabilité conditionnelle d'appartenance à la classe positive. L'ensemble d'arrivée du problème demeure fini.
Formulation correcte : « La qualification porte sur la cible observée à l'treinamento, non sur la forme de la sortie intermédiaire du modelo. »
Restreindre l'échantillon aux équipements effectivement tombés en panne, ou remplacer les durées censurées par la durée de suivi, biaise systématiquement l'estimation vers des durées trop courtes.
Formulation correcte : « En présence de censure à droite, le cadre approprié est l'analyse de survie ; la classificação à horizon fixe constitue une alternative valide si le suivi de chaque sujet couvre l'horizon retenu. »
Un MAE de 18,5 jours et un F1 de 0,60 ne sont pas comparables. L'arbitrage entre une formulation en classificação et une formulation en regressão exige de les ramener toutes deux à une décision et de les évaluer sur la même fonction de coût, sur le même jeu de test.
Formulation correcte : « Deux formulations d'un même besoin se comparent sur la décision qu'elles produisent et sur son coût, jamais sur leurs métriques natives respectives. »
CRITÈRE UNIQUE DE QUALIFICATION
La structure de l'ensemble d'arrivée de la variable cible.
Ni le domaine, ni l'algorithme, ni le type des variables d'entrée,
ni le format de stockage.
CLASSIFICATION
f : X -> {c1, ..., cK}, ensemble FINI et NON ORDONNÉ.
Seule l'égalité est définie. L'erreur se dénombre.
RÉGRESSION
f : X -> intervalle de R, ensemble ORDONNÉ et MÉTRIQUE.
L'écart y - y_pred a un sens. L'erreur se mesure.
LE TEST DES TROIS OPÉRATIONS
Égalité seule -> classification
Égalité + ordre -> cas ordinal, traité en classification
Égalité + ordre + écart -> régression
LES CINQ CAS AMBIGUS
Ordinale -> classification, métrique sensible à l'ordre
Comptage -> régression, perte de Poisson
Durée censurée -> analyse de survie, ou classification à horizon fixe
Probabilité -> selon l'étiquette OBSERVÉE : binaire ou proportion
Numérique découpée -> régression, puis seuil appliqué à la prédiction
CE QUE LE CHOIX DÉTERMINE ENSUITE
Algorithmes admissibles, fonction de perte, métriques d'évaluation,
forme de la sortie, baseline, stratification, diagnostic d'erreur,
levier de réglage post-entraînement, indicateurs de surveillance.
REFORMULATION
Un besoin métier peut se formuler dans les deux cadres.
Les deux formulations se comparent sur la MÊME fonction de coût
et le MÊME jeu de test, jamais sur leurs métriques natives.Énoncé de synthèse
Un problème d'apprentissage supervisé est une classificação lorsque sa cible prend ses valeurs dans un ensemble fini non ordonné, et une regressão lorsque sa cible prend ses valeurs sur une échelle numérique où l'écart entre deux valeurs est interprétable ; cette qualification dépend exclusivement de la nature de la variável alvo retenue, et elle détermine ensuite l'intégralité de la chaîne de modélisation, des algorithmes admissibles jusqu'aux indicateurs de surveillance em produção.
Quiz associés
010.1-quiz-critere-de-qualification.md010.2-quiz-classificação.md010.3-quiz-regression.md010.4-quiz-arbre-de-decision.md010.5-quiz-cas-ambigus.md010.6-quiz-consequences-du-choix.md010.7-quiz-reformulation.mdChapitre suivant : 011-types-de-classificação.md