Classificação ou regressão: qualificar o problema

31 min
Bloc 2 — Identifier le problème
Objectif
savoir qualifier tout problème d'apprentissage supervisé en classificação ou en regressão à partir de la seule structure de la variable cible, traiter les cinq configurations ambiguës qui résistent à cette qualification, énoncer les conséquences du choix sur l'ensemble de la chaîne de modélisation, et arbitrer entre deux formulations concurrentes d'un même besoin métier.
Durée estimée
40 minutes
Prérequis
chapitres 001 à 009, en particulier 004 (apprentissage supervisé), 006 (features et target) et 007 (X, y, label, classe)
Quiz associés
010.1-quiz-critere-de-qualification.md à 010.7-quiz-reformulation.md

1. Le critère de qualification : la structure de l'ensemble d'arrivée

1.1 Position du problème

Les formulations suivantes sont couramment employées pour justifier le choix entre classificação et regressão. Aucune n'est valide.

Formulation entendueStatutContre-exemple immédiat
« C'est un problème médical, donc de la classificação »FauxPrédire la glycémie à 3 mois est une regressão en contexte médical
« J'utilise un random forest, donc de la classificação »FauxRandomForestRegressor existe et traite des cibles réelles
« Mes variables d'entrée sont catégorielles, donc de la classificação »FauxLe type des entrées est indépendant du type de la cible
« La cible est stockée en entier, donc de la classificação »FauxUn nombre de visites mensuelles est un entier et relève de la regressão
« Il n'y a que deux valeurs possibles en sortie, donc de la regressão binaire »FauxDeux modalités non ordonnées définissent une classificação binaire

Le critère unique est la structure mathématique de l'ensemble dans lequel la variável alvo prend ses valeurs. Ni le domaine d'application, ni l'algoritmo envisagé, ni le type des variables explicatives, ni le format de stockage n'interviennent dans cette qualification.

1.2 Le cadre formel commun

L'apprentissage supervisé, défini au chapitre 004, consiste à induire à partir d'un échantillon étiqueté une fonction

f : X → Y

où X désigne l'espace des variables explicatives et Y l'ensemble d'arrivée, c'est-à-dire l'ensemble des valeurs que la variável alvo peut prendre.

classificação et regressão partagent intégralement ce cadre. Elles partagent également l'échantillon d'apprentissage, la notion de generalização, la séparation treinamento/test (chapitre 026) et le risque de sobreajuste (chapitre 031). Elles se distinguent sur un seul point : la structure de Y.

DÉFINITION — Ensemble d'arrivée (espace de sortie, output space)

Définition rigoureuse

Ensemble Y dans lequel la fonction cible prend ses valeurs, considéré non comme un simple ensemble de symboles mais comme une structure algébrique : on s'intéresse aux relations et opérations qui y sont définies — égalité, ordre total, distance, addition, espérance.

Traduction en langage courant

L'ensemble de toutes les réponses possibles, et ce que l'on a le droit de faire avec ces réponses : peut-on seulement dire qu'elles sont identiques ou différentes, peut-on les ranger, peut-on mesurer l'écart entre deux d'entre elles.

Point de vigilance

La structure de Y n'est jamais visible dans le fichier de dados. Une colonne contenant les valeurs 1, 2, 3 peut représenter trois espèces végétales (structure nominale) ou trois passages en atelier (structure numérique). Seule la connaissance du domaine tranche. La qualification est un acte d'analyse, pas une inspection de type informatique.

1.3 La bifurcation fondamentale

Énoncé directeur du chapitre

Le type de problème est déterminé par la nature de la variável alvo. Il n'est déterminé ni par le domaine métier, ni par l'algoritmo envisagé, ni par le type des variables explicatives.


2. La classificação

DÉFINITION — classificação (classificação supervisée)

Définition rigoureuse

Tâche d'apprentissage supervisé consistant à induire, à partir d'un échantillon d'observations étiquetées, une fonction f : X → Y où l'ensemble d'arrivée Y = {c₁, c₂, …, cKc_K} est fini et non muni d'une relation d'ordre intrinsèque. Les éléments de Y sont appelés classes, catégories ou modalités. K désigne le nombre de classes ; K = 2 définit la classificação binaire, K > 2 la classificação multiclasse (chapitre 011).

Structure de l'ensemble d'arrivée

La seule relation définie sur Y est l'égalité. Deux classes sont identiques ou distinctes ; aucune n'est « supérieure », et aucune distance n'est définie entre elles. La proposition « la classe chien est plus proche de la classe chat que de la classe cheval » n'a aucun statut mathématique dans le cadre standard.

Traduction en langage courant

Ranger chaque cas dans l'un des casiers d'un ensemble fixé à l'avance, sans que ces casiers soient classés du plus petit au plus grand.

Point de vigilance

L'ensemble des classes est déterminé avant l'apprentissage et fait partie de la spécification du problème. Un modelo de classificação ne peut jamais prédire une classe absente de l'échantillon d'treinamento. L'apparition d'une modalité nouvelle em produção constitue une rupture de spécification, non une erreur de previsão.

2.1 Opérations licites et illicites sur la cible

Opération sur deux valeurs ciblesclassificaçãoJustification
Tester l'égalité y₁ = y₂LiciteL'égalité est la relation fondatrice de Y
Ordonner y₁ < y₂IlliciteAucun ordre intrinsèque sur un ensemble nominal
Calculer l'écart y₁ − y₂IlliciteLa soustraction n'est pas définie
Calculer une moyenne des valeurs ciblesIlliciteL'espérance d'une variable nominale n'a pas de sens
Dénombrer les occurrences d'une classeLiciteFournit la distribution des classes (chapitre 050)

Conséquence directe : l'erreur d'un modelo de classificação ne se mesure pas par un écart mais par un dénombrement de désaccords, formalisé par la matriz de confusão (chapitre 052). Il n'existe pas d'erreur « petite » ou « grande » sur une previsão unique : elle est correcte ou incorrecte.

2.2 Forme de la sortie

Un classifieur produit en réalité deux sorties distinctes, dont la confusion est une source d'erreur fréquente.

SortieNatureMéthode scikit-learnEnsemble d'arrivée
Score ou probabilité par classeVecteur de K réels sommant à 1predict_proba()[0, 1]^K
classe préditeUne modalitépredict(){c₁, …, cKc_K}

Le passage du premier au second s'effectue par application d'une règle de décision, le plus souvent un seuil en binaire (chapitre 062) ou l'argument du maximum en multiclasse. La production d'un score réel intermédiaire ne transforme pas le problème en regressão : l'ensemble d'arrivée du problème reste l'ensemble fini des classes, le score n'étant qu'un intermédiaire de calcul.

DÉFINITION — Frontière de décision (decision boundary)

Définition rigoureuse

Sous-ensemble de l'espace des variables explicatives X séparant les régions associées à des classes prédites différentes. Formellement, pour un classifieur binaire fondé sur une fonction de score s(x) et un seuil t, la frontière est l'ensemble {x ∈ X : s(x) = t}.

Traduction en langage courant

La ligne, la surface ou la limite au-delà de laquelle le modelo change d'avis sur la catégorie à attribuer.

Point de vigilance

L'objet géométrique appris en classificação est une partition de l'espace d'entrée. En regressão, l'objet appris est une surface de réponse définie sur tout l'espace d'entrée. Cette différence de nature explique que certains algorithmes se transposent mal d'un cadre à l'autre.

ANALOGIE — Le centre de tri postal

Un centre de tri dispose d'un nombre fixe de casiers, un par région de destination. Chaque colis doit être placé dans exactement un casier. Le trieur ne peut pas inventer un casier, ni placer un colis « entre » deux casiers.

Se tromper de casier est une erreur, sans degré : un colis destiné à Lyon placé dans le casier Marseille et un colis destiné à Lyon placé dans le casier Lille sont deux erreurs équivalentes du point de vue du tri, même si les conséquences opérationnelles diffèrent.

L'hésitation du trieur — « ce colis est probablement pour Lyon, peut-être pour Grenoble » — correspond au score de probabilité. La décision finale de le déposer dans un casier correspond à la classe prédite.

2.3 Exemples représentatifs

DomaineQuestion métierEnsemble d'arrivéeK
PaiementCette transaction est-elle frauduleuse ?{fraude, normal}2
MessagerieCe courriel est-il indésirable ?{spam, légitime}2
SantéCe patient présente-t-il la pathologie ?{malade, sain}2
TélécommunicationsCe client va-t-il résilier ?{résiliation, maintien}2
BotaniqueDe quelle espèce s'agit-il ?{setosa, versicolor, virginica}3
IndustrieQuel type de défaut affecte cette pièce ?{rayure, fissure, porosité, aucun}4

3. La regressão

DÉFINITION — regressão (regressão supervisée)

Définition rigoureuse

Tâche d'apprentissage supervisé consistant à induire, à partir d'un échantillon d'observations étiquetées, une fonction f : X → Y où l'ensemble d'arrivée Y est un sous-ensemble de ℝ — le plus souvent ℝ tout entier, ℝ⁺, ou un intervalle borné. L'ensemble d'arrivée est donc muni d'un ordre total et d'une distance, ce qui confère un sens à la quantité y − ŷ, appelée résidu (chapitre 066).

Formulation statistique

La regressão estime une caractéristique de la loi conditionnelle de Y sachant X. La regressão par moindres carrés estime l'espérance conditionnelle E[Y | X = x] ; la regressão quantile estime un quantile conditionnel ; la regressão sur la valeur absolue estime la médiane conditionnelle.

Traduction en langage courant

Estimer une quantité, c'est-à-dire produire un nombre situé sur une échelle graduée, sur laquelle il est possible de dire de combien on s'est trompé.

Point d'étymologie

Le terme provient de Francis Galton (1886), qui observe la « regressão vers la médiocrité » — aujourd'hui regressão vers la moyenne — dans la transmission de la taille entre générations. Le mot désigne aujourd'hui, par extension, toute estimation d'une cible numérique. Il n'exprime aucune notion de retour en arrière.

3.1 Opérations licites et signification de l'erreur

Opération sur deux valeurs ciblesregressãoConséquence pratique
Tester l'égalité y₁ = y₂Licite mais sans intérêtLa probabilité d'égalité exacte est nulle sur une variable continue
Ordonner y₁ < y₂LicitePermet les métriques fondées sur les rangs
Calculer l'écart y₁ − y₂LiciteFonde la notion de résidu
Calculer une moyenneLiciteFonde la baseline « prédire la moyenne »
Élever l'écart au carréLiciteFonde MSE et RMSE (chapitres 068 et 069)

Conséquence directe : en regressão, l'erreur est graduée. Prédire 248 000 € pour un bien vendu 250 000 € est un résultat de qualité ; prédire 90 000 € pour le même bien est une défaillance. La distinction entre ces deux situations est impossible à formuler dans le cadre de la classificação, où les deux prédictions seraient également « fausses ».

3.2 Forme de la sortie

SortieNatureUsage
previsão ponctuelleUn réel ŷSortie standard de predict()
Intervalle de previsãoUn couple [y^inf\hat{y}_{\mathrm{inf}}, y^sup\hat{y}_{\mathrm{sup}}]Communication de l'incertitude
Quantiles conditionnelsPlusieurs réelsDécision asymétrique, gestion de stock

Un régresseur ne dispose d'aucun équivalent de predict_proba() : il n'existe pas de « probabilité de chaque valeur possible » lorsque l'ensemble d'arrivée est continu. Cette asymétrie est développée au chapitre 029.

ANALOGIE — Le casier et la règle graduée

Un pharmacien range des boîtes dans des tiroirs étiquetés : antibiotiques, antalgiques, antihistaminiques. Une boîte est dans le bon tiroir ou dans le mauvais. Il n'existe pas de « presque bon tiroir ». C'est une classificação.

Le même pharmacien pèse une préparation magistrale et vise 250 mg. Il obtient 248 mg : l'écart est de 2 mg, quantifiable, et acceptable au regard de la tolérance pharmaceutique. Il obtient 90 mg : l'écart est de 160 mg, et la préparation est inutilisable. C'est une regressão.

Le tiroir n'admet pas de degré. La balance en admet un. Toute la différence entre les deux cadres tient dans cette propriété de l'échelle de sortie.

3.3 Exemples représentatifs et exemples croisés

Le tableau suivant place côte à côte, pour un même domaine métier, une cible relevant de la classificação et une cible relevant de la regressão. Il établit que le domaine ne détermine rien.

DomaineCible catégorielle → classificaçãoCible numérique → regressão
ImmobilierLe bien se vendra-t-il sous 90 jours ?Prix de vente en euros
SantéLe patient est-il diabétique ?Taux d'HbA1c en pourcentage
ÉnergieLe pic de consommation sera-t-il dépassé ?Consommation en kWh de la journée
MétéorologiePleuvra-t-il demain ?Température maximale en °C
PaiementLa transaction est-elle frauduleuse ?Montant de la perte en cas de fraude
Ressources humainesLe candidat acceptera-t-il l'offre ?Salaire d'acceptation en euros
IndustrieLa pièce est-elle conforme ?Cote mesurée en millimètres
MarketingLe client va-t-il souscrire ?Chiffre d'affaires à 12 mois

Lecture du tableau : chaque ligne décrit un unique domaine, souvent un unique conjunto de dados, avec les mêmes variables explicatives. Seule la colonne sélectionnée comme cible change, et avec elle le type de problème.


4. La question de qualification et son árvore de decisão

4.1 La question à poser

Que cherche-t-on exactement à produire, et de quelle nature est la valeur produite : une catégorie prise dans une liste fixée, ou un nombre situé sur une échelle ?

Sa forme abrégée, utilisable en réunion de cadrage :

Forme de la question métierType de problème
« Quelle catégorie ? », « Lequel ? », « Est-ce que … ? », « Oui ou non ? »classificação
« Combien ? », « Quelle quantité ? », « Quel montant ? », « Quelle durée ? »regressão

Point de vigilance : la question doit porter sur la valeur produite par le modelo, non sur la décision prise ensuite par l'organisation. Un modelo estimant un montant de perte (regressão) peut alimenter une décision binaire d'acceptation ou de refus. La décision aval ne modifie pas la nature de la sortie du modelo.

4.2 Le test des trois opérations

Lorsque la question métier reste ambiguë, le test suivant tranche mécaniquement. Il s'applique aux valeurs observées de la cible.

Opération testéeInterprétation si le résultat a un sens métier
1. y₁ = y₂ ?Toujours vrai : condition minimale, ne discrimine pas
2. y₁ < y₂ ?Un ordre existe : la cible est au moins ordinale
3. y₁ − y₂ interprétable comme un écart ?Une métrique existe : la cible est numérique

Règle de lecture

  • Seule l'opération 1 a un sens : classificação (cible nominale).
  • Les opérations 1 et 2 ont un sens, la 3 non : cas ordinal, traité en 5.1.
  • Les trois opérations ont un sens : regressão.

Exemple d'application au code postal : deux codes postaux peuvent être comparés par égalité ; l'ordre 69001 < 75015 n'exprime rien de métier ; la différence 75015 − 69001 = 6014 n'est pas une distance. Le code postal est une variable nominale malgré son stockage numérique.

4.3 L'árvore de decisão complet

4.4 Variable discrète et variable continue

DÉFINITION — Variable discrète et variable continue

Définition rigoureuse

Une variable aléatoire est dite discrète lorsque l'ensemble de ses valeurs possibles est fini ou infini dénombrable. Elle est dite continue lorsque cet ensemble est un intervalle non dégénéré de ℝ et que sa fonction de répartition est continue, la probabilité d'une valeur ponctuelle étant alors nulle.

Traduction en langage courant

Discret : les valeurs se comptent une par une, et entre deux valeurs voisines il n'y a rien. Continu : entre deux valeurs, aussi proches soient-elles, il en existe une infinité d'autres.

Point de vigilance — la confusion centrale

Discret n'est pas synonyme de catégoriel. Un nombre de visites mensuelles est discret (0, 1, 2, …) et pourtant parfaitement numérique : l'ordre et l'écart y ont un sens. La dichotomie utile pour qualifier un problème d'apprentissage n'est pas discret/continu mais nominal/numérique.

Point de vigilance — la mesure physique

Toute mesure enregistrée est discrète par construction, du fait de la résolution finale de l'instrument et de la représentation en virgule flottante. Une température relevée au dixième de degré prend un nombre fini de valeurs. Elle est traitée comme continue, car sa structure sous-jacente est un intervalle de ℝ.

CibleDiscrète ou continueNominale ou numériqueType de problème
Espèce d'irisDiscrèteNominaleclassificação
Statut de transactionDiscrèteNominaleclassificação
Code postalDiscrèteNominaleclassificação
Nombre de visites mensuellesDiscrèteNumériqueregressão
Nombre de sinistres déclarésDiscrèteNumériqueregressão
Température maximaleContinueNumériqueregressão
Prix de venteContinueNumériqueregressão

4.5 Vérification instrumentée de la nature de la cible

Scikit-learn expose une fonction d'inspection du type de cible. Elle constitue un contrôle utile, à condition d'en connaître les limites.

python
import numpy as np
from sklearn.utils.multiclass import type_of_target

cibles = {
    "statut_transaction    ": np.array(["normal", "fraude", "normal", "fraude"]),
    "espece_iris           ": np.array(["setosa", "versicolor", "virginica", "setosa"]),
    "temperature_celsius   ": np.array([18.4, 21.0, 19.7, 23.2]),
    "prix_vente_eur        ": np.array([245000.0, 312500.0, 189900.0, 405000.0]),
    "nb_visites_mensuelles ": np.array([0, 3, 1, 12]),
    "note_satisfaction_1_5 ": np.array([1, 3, 2, 5]),
}

for nom, y in cibles.items():
    print(f"{nom} dtype={str(y.dtype):8s} -> type_of_target = {type_of_target(y)}")

Sortie

statut_transaction     dtype=<U6      -> type_of_target = binary
espece_iris            dtype=<U10     -> type_of_target = multiclass
temperature_celsius    dtype=float64  -> type_of_target = continuous
prix_vente_eur         dtype=float64  -> type_of_target = multiclass
nb_visites_mensuelles  dtype=int64    -> type_of_target = multiclass
note_satisfaction_1_5  dtype=int64    -> type_of_target = multiclass

Interprétation

Les trois premières lignes sont conformes à l'analyse métier. Les trois suivantes ne le sont pas :

  • prix_vente_eur est une cible de regressão, qualifiée multiclass parce que les quatre valeurs, bien que de type flottant, sont entières et peu nombreuses ;
  • nb_visites_mensuelles est une cible de regressão au sens du test des trois opérations, qualifiée multiclass parce qu'elle est entière ;
  • note_satisfaction_1_5 est une cible ordinale, que la fonction ne distingue pas d'une cible nominale.

Conclusion opérationnelle : type_of_target applique une heuristique syntaxique fondée sur le type de stockage et le nombre de valeurs distinctes. Elle détecte des incohérences de format ; elle ne qualifie pas un problème. La qualification demeure un acte d'analyse fondé sur la connaissance du domaine.


5. Les cinq cas ambigus et leur traitement

Cinq configurations résistent à la qualification directe. Chacune appelle une décision documentée, non un choix par défaut.

5.1 Cible ordinale

Nature : ensemble fini, muni d'un ordre métier signifiant, sans distance interprétable entre modalités consécutives. Exemples : niveau de risque {faible, moyen, élevé}, note de satisfaction de 1 à 5, stade tumoral I à IV, notation financière de AAA à D.

Le dilemme : traiter la cible en classificação multiclasse revient à détruire l'information d'ordre — confondre « élevé » avec « faible » et avec « moyen » compte pour la même erreur. La traiter en regressão revient à postuler une équidistance entre modalités, hypothèse généralement fausse : l'écart de gravité entre les stades I et II n'égale pas celui entre III et IV.

Choix retenu : classificação, en tant que qualification du problème, l'ensemble d'arrivée restant fini. Deux aménagements sont recommandés :

AménagementMise en oeuvreJustification
Métrique sensible à l'ordreKappa quadratiquement pondéré, MAE sur les rangsPénalise davantage les erreurs éloignées dans l'ordre
modelo ordinal dédiémodelo à cotes proportionnelles (McCullagh, 1980), décomposition en K−1 classifieurs binaires cumulésExploite l'ordre sans postuler l'équidistance

Recours à la regressão : acceptable lorsque le nombre de modalités est élevé (à partir d'une dizaine) et que l'équidistance est défendable, la previsão réelle étant alors arrondie. Ce choix doit être justifié explicitement. La classificação ordinale est détaillée au chapitre 011.

5.2 Cible de comptage

Nature : ensemble des entiers naturels, infini dénombrable, ordonné, muni d'une distance interprétable. Exemples : nombre de sinistres annuels, nombre de visites, nombre de défauts par lot.

Choix retenu : regressão. Les trois opérations du test ont un sens ; l'ensemble d'arrivée n'est pas fini. Le fait que les valeurs soient entières ne constitue pas un critère de classificação.

Point d'attentionTraitement recommandé
Support positif et asymétrie fortePerte de déviance de Poisson ou binomiale négative plutôt que MSE
Surdispersion (variância supérieure à la moyenne)modelo binomial négatif
Excès de zérosmodelo à inflation de zéros, ou décomposition en un classifieur « zéro ou non » suivi d'un régresseur sur les non-zéros
previsão réelle non entièreArrondi en post-traitement, jamais dans la função de perda

Erreur fréquente : traiter un comptage borné en pratique (0, 1, 2, 3 sinistres) comme une classificação à quatre classes. Cette formulation interdit au modelo de prédire 4, détruit l'ordre et rend le résidu ininterprétable.

5.3 Durée avec censure

Nature : durée jusqu'à la survenue d'un événement, observée de façon incomplète pour une partie des sujets — le contrat est toujours actif, le patient est encore en vie, la machine n'est pas encore tombée en panne à la fin de la période d'observação.

DÉFINITION — Censure à droite (right censoring)

Définition rigoureuse

Situation dans laquelle la durée d'intérêt T d'un sujet n'est pas observée directement, seule étant disponible la donnée du couple (min(T, C), 1{T ≤ C}), où C désigne la durée de suivi. L'information disponible est alors « T est supérieure à C » et non la valeur de T.

Traduction en langage courant

On sait que l'événement n'était pas encore survenu quand on a cessé d'observer, sans savoir quand il surviendra.

Conséquence méthodologique

Écarter les observations censurées biaise l'estimation vers les durées courtes, car les sujets à longue durée de vie sont précisément ceux qui sont censurés. Remplacer la durée censurée par la durée de suivi biaise également l'estimation, vers le bas. Le cadre approprié est l'analyse de survie : estimateur de Kaplan-Meier (1958), modelo à risques proportionnels de Cox (1972), forêts de survie.

Point de vigilance

La censure n'est pas une donnée manquante au sens du chapitre 018. Une durée censurée porte une information partielle exploitable, non une absence d'information.

Choix retenu : ni classificação ni regressão au sens strict lorsque la censure est substantielle. Le tableau suivant fixe la conduite à tenir.

SituationFormulation retenueJustification
Historique complet, tous les événements observésregressão sur la duréeAucune censure, cadre standard applicable
Censure présente, estimation de la durée requiseAnalyse de survieSeul cadre exploitant correctement les observations censurées
Censure présente, décision à horizon fixe Hclassificação binaire « événement avant H »Valide à condition de ne retenir que les sujets dont le suivi atteint H
Censure importante et suivi hétérogèneAnalyse de survie obligatoireLa restriction du champ détruirait une part majeure de l'échantillon

5.4 Probabilité comme cible

Nature : la valeur à produire est un nombre de l'intervalle [0, 1]. La qualification dépend entièrement de ce qui est observé dans l'échantillon d'treinamento, non de ce qui est demandé en sortie.

Ce qui est observé pour chaque ligneType de problèmeModélisation
Une issue binaire, 0 ou 1classificação binaireClassifieur probabiliste, sortie predict_proba, perte log loss (chapitre 061), calibration vérifiée
Une proportion mesurée, par exemple un taux de conversion par magasinregressão sur [0, 1]regressão bêta, ou regressão sur la transformation logit, ou perte adaptée au support borné

Point central : demander une probabilité en sortie ne fait pas d'un problème une regressão. Un modelo de détection de fraude renvoyant p = 0,83 reste un modelo de classificação : la cible observée à l'treinamento vaut 0 ou 1. La sortie continue est une estimation de P(Y = 1 | X = x), pas une cible numérique apprise comme telle.

Point de vigilance : un score de probabilité produit par un classifieur n'est pas nécessairement calibré. Un score de 0,83 ne signifie pas que 83 % des cas recevant ce score sont positifs, sauf vérification explicite (chapitre 061).

5.5 Cible numérique discrétisée volontairement

Nature : la cible disponible est numérique — un montant, un âge, un taux — et l'organisation demande une sortie en classes définies par seuils : « client à faible, moyen ou fort potentiel », « risque acceptable ou inacceptable ».

Choix retenu : regressão sur la cible numérique, puis application du seuil à la previsão. La discrétisation préalable de la cible détruit de l'information et dégrade la puissance statistique ; cette pratique est documentée dans la littérature méthodologique sous le terme de dichotomisation abusive (Royston, Altman et Sauerbrei, 2006).

CritèreDiscrétiser la cible avant l'apprentissageRégresser puis seuiller
Information conservéePerte de la variation intra-classeIntégralité conservée
Effet de seuilDeux valeurs séparées par 1 € deviennent deux classes différentesAucun : traitement continu
Changement de seuil métierRéétiquetage et rétreinamento completsModification d'une constante, sans rétreinamento
Seuils multiples simultanésUn modelo par découpageUn modelo unique
Lisibilité pour le métierImmédiateRequiert une couche de restitution

Exception admise : lorsque la cible numérique sous-jacente n'est pas observable et que seule la classe est enregistrée dans le système source — une tranche de revenu déclarative, un niveau de risque attribué par un expert. La donnée disponible est alors nativement catégorielle et le problème est une classificação, sans reformulation possible.

5.6 Tableau récapitulatif des cas ambigus

CasStructure de la cibleChoix retenuMotif déterminant
OrdinaleFini, ordonné, non métriqueclassificação, avec métrique et modelo sensibles à l'ordreL'ensemble d'arrivée reste fini
ComptageEntiers, infini, métriqueregressão, perte de PoissonLes trois opérations ont un sens
Durée censuréeℝ⁺ partiellement observéAnalyse de survie, ou classificação à horizon fixeLa censure invalide la regressão naïve
Probabilité[0, 1]classificação si l'étiquette observée est binaire, regressão si une proportion est mesuréeLa qualification dépend de la cible observée
Numérique discrétiséeℝ recodé en classesregressão puis seuil, sauf cible nativement catégorielleLa discrétisation détruit de l'information

6. Conséquences du choix sur l'ensemble de la chaîne

La qualification intervient à l'étape 3 du cycle de vie (chapitre 012). Toutes les étapes ultérieures en dépendent.

6.1 Tableau comparatif complet

Dimensionclassificaçãoregressão
Ensemble d'arrivée{c₁, …, cKc_K}, fini, non ordonnéSous-ensemble de ℝ, ordonné et métrique
Objet apprisPartition de l'espace d'entrée, frontière de décisionSurface de réponse définie sur tout l'espace d'entrée
Quantité estiméeP(Y = c sachant X = x), probabilité conditionnelle de chaque classeE[Y sachant X = x], espérance conditionnelle, ou un quantile conditionnel
Sortie brute du modeloVecteur de K scoresUn réel
Sortie livréeUne classe, après application d'un seuil ou d'un argmaxLa valeur, éventuellement encadrée d'un intervalle
Notion d'erreurDésaccord binaire, dénombréRésidu signé, gradué
Fonctions de perte usuellesEntropie croisée, log loss, hinge, focal loss ; critères de division Gini et entropieMSE, MAE, Huber, quantile pinball, déviance de Poisson, RMSLE
Métriques d'évaluationaccuracy, precisão, recall, spécificité, F1, F-bêta, balanced accuracy, log loss, ROC-AUC, PR-AUCMAE, MSE, RMSE, R², R² ajusté, MAPE, sMAPE, MedAE, RMSLE
Algorithmes représentatifsregressão logistique, arbre, floresta aleatória, boosting, SVC, k-NN, Naive Bayes, MLPregressão linéaire, Ridge, Lasso, ElasticNet, arbre, floresta aleatória, boosting, SVR, k-NN, MLP
Suffixe scikit-learn…Classifier…Regressor
Baseline de référencePrédire systématiquement la classe majoritairePrédire systématiquement la moyenne ou la médiane
Découpage des dadosStratification sur la cible recommandée (chapitre 027)Découpage aléatoire, stratification par tranches si la cible est très asymétrique
Pathologie de distributionDéséquilibre des classes (chapitres 050 et 051)Asymétrie, valeurs extrêmes, hétéroscédasticité
Réglage post-treinamentoSeuil de décision (chapitre 062)Aucun équivalent direct ; recalibrage éventuel de l'échelle
Diagnostic d'erreurmatriz de confusão, analyse FP/FNGraphe des résidus, résidus contre valeurs prédites
Nature de l'arbitrage métierQuelle erreur coûte le plus cher, faux positif ou faux négatifQuelle erreur coûte le plus cher, sur-estimation ou sous-estimation
Surveillance em produçãodesvio de la distribution des classes préditesdesvio de la distribution et de la moyenne des prédictions

6.2 Deux points structurants

La função de perda n'est pas la métrique. La perte est optimisée pendant l'treinamento et doit être dérivable pour les algorithmes à gradient ; la métrique évalue le modelo et répond à une question métier. Un classifieur optimise la log loss et se juge sur le recall ; un régresseur optimise le MSE et se juge sur le MAE. Cette distinction est développée au chapitre 030.

Le seuil de décision n'existe qu'en classificação binaire. Il constitue un levier post-treinamento puissant : à modelo inchangé, faire varier le seuil déplace l'équilibre entre faux positifs et faux négatifs. La regressão n'offre aucun levier équivalent sur le modelo lui-même ; le seuil éventuellement appliqué à sa sortie relève de la règle de décision aval, non du modelo.


7. La reformulation : un besoin métier, deux cadres possibles

7.1 Le principe

Un besoin métier n'est pas un problème d'apprentissage. Il devient un problème d'apprentissage au moment où une variável alvo est choisie. Lorsque plusieurs cibles sont disponibles pour répondre au même besoin, plusieurs formulations coexistent, éventuellement dans des cadres différents.

Le cas de référence : la maintenance prédictive. Un exploitant surveille un parc de pompes industrielles instrumentées. Le besoin est unique : intervenir avant la défaillance sans multiplier les immobilisations inutiles. Deux cibles sont constructibles à partir du même historique et des mêmes capteurs.

DÉFINITION — Durée de vie résiduelle (Remaining Useful Life, RUL)

Définition rigoureuse

Durée séparant l'instant d'observação de l'instant de défaillance d'un équipement, conditionnellement à son état constaté et à son historique d'exploitation. Elle constitue la cible de référence des approches pronostiques en maintenance conditionnelle.

Traduction en langage courant

Le nombre de jours qu'il reste à la machine avant la panne, estimé d'après son état actuel.

Point de vigilance

L'étiquetage d'une durée de vie résiduelle exige des cycles de vie complets : la valeur n'est connue que pour les équipements effectivement allés jusqu'à la défaillance. Les équipements encore en service au terme de la période d'observação sont censurés au sens de la section 5.3. Un conjunto de dados de maintenance comporte quasi systématiquement de la censure, ce qui constitue le premier obstacle pratique à la formulation en regressão.

7.2 Chiffrage comparé des deux formulations

Le protocole suivant construit un conjunto de dados de dégradation, desvio les deux cibles des mêmes variables explicatives, entraîne les deux modèles, et cale pour chacun son propre seuil de décision sur une partition de validation, au regard d'une fonction de coût explicite : 800 € pour une intervention préventive, 12 000 € pour une défaillance subie.

python
import numpy as np
from sklearn.ensemble import RandomForestClassifier, RandomForestRegressor
from sklearn.model_selection import train_test_split
from sklearn.metrics import precision_score, recall_score, mean_absolute_error

rng = np.random.default_rng(42)
n = 6000

# Parc de pompes industrielles : les MEMES variables explicatives
heures    = rng.uniform(0, 20000, n)                            # heures cumulées
vibration = 1.2 + 0.00018 * heures + rng.normal(0, 0.35, n)     # mm/s RMS
temp      = 55 + 0.0011 * heures + rng.normal(0, 3.0, n)        # °C au palier
delta_p   = 2.6 - 0.00007 * heures + rng.normal(0, 0.20, n)     # bar
nb_maint  = rng.poisson(0.5 + heures / 9000)                    # interventions passées

usure = 0.55 * vibration + 0.035 * temp - 0.9 * delta_p + 0.00004 * heures
rul = 300 * np.exp(-0.5 * usure) * np.exp(rng.normal(0, 0.22, n))   # jours restants

X = np.column_stack([heures, vibration, temp, delta_p, nb_maint])
y_reg = rul                        # cible continue -> RÉGRESSION
y_clf = (rul <= 30).astype(int)    # cible binaire  -> CLASSIFICATION

Xtr, Xte, yr_tr, yr_te, yc_tr, yc_te = train_test_split(
    X, y_reg, y_clf, test_size=0.3, random_state=0, stratify=y_clf)
Xtr, Xva, yr_tr, yr_va, yc_tr, yc_va = train_test_split(
    Xtr, yr_tr, yc_tr, test_size=0.25, random_state=0, stratify=yc_tr)

C_PREV, C_PANNE = 800, 12000       # euros : intervention préventive / défaillance subie

def cout(y_vrai, pred):
    return int(pred.sum()) * C_PREV + int(((y_vrai == 1) & (pred == 0)).sum()) * C_PANNE

clf = RandomForestClassifier(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yc_tr)
reg = RandomForestRegressor(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yr_tr)

p_va, p_te = clf.predict_proba(Xva)[:, 1], clf.predict_proba(Xte)[:, 1]
r_va, r_te = reg.predict(Xva), reg.predict(Xte)

# Chaque formulation reçoit son seuil de décision, calé sur le coût, en validation
seuil_a = min(np.arange(0.02, 0.61, 0.01), key=lambda s: cout(yc_va, (p_va >= s).astype(int)))
seuil_b = min(np.arange(10, 121, 1),       key=lambda t: cout(yc_va, (r_va <= t).astype(int)))

print(f"Seuils calés sur la validation : A p >= {seuil_a:.2f}   B RUL_pred <= {seuil_b} jours")
print(f"MAE de B sur la durée de vie résiduelle : {mean_absolute_error(yr_te, r_te):.1f} jours")
print(f"Coût de référence, aucune alerte : {int(yc_te.sum()) * C_PANNE} EUR\n")

for nom, pred in [("A - classification binaire     ", (p_te >= seuil_a).astype(int)),
                  ("B - régression sur la durée vie", (r_te <= seuil_b).astype(int))]:
    print(f"{nom} precision={precision_score(yc_te, pred, zero_division=0):.3f}  "
          f"rappel={recall_score(yc_te, pred):.3f}  alertes={int(pred.sum()):3d}  "
          f"manquées={int(((yc_te == 1) & (pred == 0)).sum()):2d}  coût={cout(yc_te, pred):6d} EUR")

print("\nB - horizon d'intervention modifié sans réentraînement :")
for h in (60, 90):
    cible_h, pred_h = (yr_te <= h).astype(int), (r_te <= h).astype(int)
    print(f"   horizon {h:2d} j : precision={precision_score(cible_h, pred_h):.3f}  "
          f"rappel={recall_score(cible_h, pred_h):.3f}  alertes={int(pred_h.sum()):3d}")

Sortie

Seuils calés sur la validation : A p >= 0.05   B RUL_pred <= 40 jours
MAE de B sur la durée de vie résiduelle : 18.5 jours
Coût de référence, aucune alerte : 2076000 EUR

A - classification binaire      precision=0.431  rappel=0.954  alertes=383  manquées= 8  coût=402400 EUR
B - régression sur la durée vie precision=0.486  rappel=0.913  alertes=325  manquées=15  coût=440000 EUR

B - horizon d'intervention modifié sans réentraînement :
   horizon 60 j : precision=0.900  rappel=0.888  alertes=668
   horizon 90 j : precision=0.932  rappel=0.927  alertes=979

Interprétation

observaçãoLecture
Les deux formulations réduisent le coût de 2 076 000 € à environ 0,4 M€Le besoin est traitable dans les deux cadres ; la qualification ne se joue pas sur la faisabilité
A obtient 402 400 € contre 440 000 € pour B sur l'horizon de 30 joursLa classificação optimise directement la séparation à l'horizon considéré ; la regressão optimise l'erreur sur toute l'échelle des durées, y compris là où aucune décision ne se joue
B affiche une precisão légèrement supérieure et 58 alertes de moins, pour 7 défaillances manquées de plusLes deux formulations n'occupent pas le même point du compromis precisão-recall ; la comparaison n'a de sens qu'à fonction de coût fixée
Le seuil optimal de B est 40 jours, non 30La sortie d'un régresseur ne s'utilise pas avec le seuil métier brut : elle est régressée vers la moyenne et doit être recalée empiriquement
B traite les horizons 60 et 90 jours avec le même modelo entraînéChanger d'horizon en formulation A impose un réétiquetage et un rétreinamento complets
Le MAE de B est de 18,5 joursUne erreur moyenne de 18,5 jours rend la formulation B inexploitable pour un horizon de 7 ou 14 jours, information que la seule métrique de classificação ne révèle pas

7.3 Critères d'arbitrage entre les deux formulations

CritèreOriente vers la classificaçãoOriente vers la regressão
Horizon de décisionUnique, fixe, stable dans le tempsMultiple, variable, ou négocié au cas par cas
Disponibilité des étiquettesSeule l'occurrence de l'événement est enregistréeLes cycles de vie complets sont documentés
Censure dans l'historiqueImportante : la classificação à horizon fixe est plus robusteFaible ou traitable par analyse de survie
Volume d'événementsFaible : concentrer la capacité du modelo sur la frontièreÉlevé : la richesse de la cible continue est exploitable
Nature de la décision avalBinaire, immédiate, sans priorisationOrdonnancement, planification, allocation de ressources
Besoin de hiérarchiser les casSatisfait par le score de probabilitéSatisfait par la valeur prédite, directement interprétable
Communication au métier« 83 % de risque sous 30 jours »« environ 45 jours restants »
Sensibilité au changement de politiqueFaible : tout changement de seuil impose un rétreinamentoForte : un changement d'horizon est une constante à modifier
Contrôle du compromis d'erreursDirect, par le seuil de décisionIndirect, par le seuil appliqué à la sortie

Règle de conduite : lorsque les deux formulations sont réalisables, les construire toutes deux, les évaluer sur la même fonction de coût métier et sur le même jeu de test, puis trancher sur ce résultat. La comparaison de métriques hétérogènes — un MAE contre un F1 — ne constitue pas un arbitrage.

ANALOGIE — Le feu de signalisation et le compte à rebours

Un carrefour peut être signalé de deux façons. Le feu tricolore fournit une catégorie : rouge, orange, vert. Le compte à rebours affiche un nombre de secondes restantes.

Le feu suffit à décider s'il faut s'arrêter : la décision est binaire et son horizon est immédiat. Le compte à rebours permet en outre d'anticiper, de moduler sa vitesse et de coordonner plusieurs véhicules ; il exige en revanche une information plus riche et plus difficile à produire.

Le choix entre les deux dispositifs ne tient pas au carrefour, mais à ce que l'on veut pouvoir décider et à la precisão réellement atteignable.


8. Erreurs de raisonnement fréquentes

ERREUR — Qualifier le problème par le domaine métier

Les énoncés « le médical, c'est de la classificação » ou « la finance, c'est de la regressão » n'ont aucun fondement. Un même service hospitalier produit des problèmes de classificação (diagnostic) et de regressão (durée de séjour, posologie, taux biologique).

Formulation correcte : « Le type de problème est déterminé par la structure de l'ensemble des valeurs que peut prendre la variável alvo, indépendamment du domaine d'application. »

ERREUR — Qualifier le problème par l'algoritmo envisagé

Les familles algorithmiques majeures — arbres, forêts, boosting, k-NN, SVM, réseaux de neurones — existent dans les deux variantes. Le choix de l'algoritmo intervient après la qualification et ne peut donc la déterminer.

Formulation correcte : « La cible qualifie le problème ; le problème restreint l'ensemble des algorithmes admissibles ; l'algoritmo est choisi dans cet ensemble. »

ERREUR — Confondre regressão logistique et regressão

La regressão logistique est un modelo de classificação. Le terme « regressão » y désigne la regressão linéaire opérée sur le logit de la probabilité, non la nature de la cible, qui est catégorielle. Le chapitre 036 détaille ce point.

Formulation correcte : « La regressão logistique modélise linéairement le logarithme des cotes d'une cible binaire ; elle relève de la classificação. »

ERREUR — Déduire le type de problème du type de stockage de la cible

Un code postal, un identifiant de gamme de produit ou un code de département sont stockés en entier sans constituer des quantités. Réciproquement, un nombre de sinistres stocké en entier constitue une quantité. L'inspection du dtype ne remplace pas l'analyse sémantique.

Formulation correcte : « Le type informatique de la colonne est une propriété du format de stockage ; la structure de l'ensemble d'arrivée est une propriété du domaine. »

ERREUR — Traiter un problème de regressão comme une classificação par confort

Découper une cible numérique en tranches avant l'apprentissage réduit la puissance statistique, introduit des effets de seuil arbitraires et rend le modelo inutilisable dès que les seuils métier évoluent. La lisibilité par les équipes métier s'obtient en discrétisant la previsão, pas la cible.

Formulation correcte : « Le modelo est appris sur la cible numérique ; la mise en classes est appliquée à la sortie, dans la couche de restitution. »

ERREUR — Conclure qu'un modelo produisant des probabilités fait de la regressão

Un classifieur binaire produit un score continu dans [0, 1]. Cette sortie continue est une estimation de la probabilité conditionnelle d'appartenance à la classe positive. L'ensemble d'arrivée du problème demeure fini.

Formulation correcte : « La qualification porte sur la cible observée à l'treinamento, non sur la forme de la sortie intermédiaire du modelo. »

ERREUR — Appliquer une regressão à une durée sans traiter la censure

Restreindre l'échantillon aux équipements effectivement tombés en panne, ou remplacer les durées censurées par la durée de suivi, biaise systématiquement l'estimation vers des durées trop courtes.

Formulation correcte : « En présence de censure à droite, le cadre approprié est l'analyse de survie ; la classificação à horizon fixe constitue une alternative valide si le suivi de chaque sujet couvre l'horizon retenu. »

ERREUR — Comparer deux formulations concurrentes sur des métriques hétérogènes

Un MAE de 18,5 jours et un F1 de 0,60 ne sont pas comparables. L'arbitrage entre une formulation en classificação et une formulation en regressão exige de les ramener toutes deux à une décision et de les évaluer sur la même fonction de coût, sur le même jeu de test.

Formulation correcte : « Deux formulations d'un même besoin se comparent sur la décision qu'elles produisent et sur son coût, jamais sur leurs métriques natives respectives. »


9. Synthèse

CRITÈRE UNIQUE DE QUALIFICATION
    La structure de l'ensemble d'arrivée de la variable cible.
    Ni le domaine, ni l'algorithme, ni le type des variables d'entrée,
    ni le format de stockage.

CLASSIFICATION
    f : X -> {c1, ..., cK}, ensemble FINI et NON ORDONNÉ.
    Seule l'égalité est définie. L'erreur se dénombre.

RÉGRESSION
    f : X -> intervalle de R, ensemble ORDONNÉ et MÉTRIQUE.
    L'écart y - y_pred a un sens. L'erreur se mesure.

LE TEST DES TROIS OPÉRATIONS
    Égalité seule            -> classification
    Égalité + ordre          -> cas ordinal, traité en classification
    Égalité + ordre + écart  -> régression

LES CINQ CAS AMBIGUS
    Ordinale             -> classification, métrique sensible à l'ordre
    Comptage             -> régression, perte de Poisson
    Durée censurée       -> analyse de survie, ou classification à horizon fixe
    Probabilité          -> selon l'étiquette OBSERVÉE : binaire ou proportion
    Numérique découpée   -> régression, puis seuil appliqué à la prédiction

CE QUE LE CHOIX DÉTERMINE ENSUITE
    Algorithmes admissibles, fonction de perte, métriques d'évaluation,
    forme de la sortie, baseline, stratification, diagnostic d'erreur,
    levier de réglage post-entraînement, indicateurs de surveillance.

REFORMULATION
    Un besoin métier peut se formuler dans les deux cadres.
    Les deux formulations se comparent sur la MÊME fonction de coût
    et le MÊME jeu de test, jamais sur leurs métriques natives.

Énoncé de synthèse

Un problème d'apprentissage supervisé est une classificação lorsque sa cible prend ses valeurs dans un ensemble fini non ordonné, et une regressão lorsque sa cible prend ses valeurs sur une échelle numérique où l'écart entre deux valeurs est interprétable ; cette qualification dépend exclusivement de la nature de la variável alvo retenue, et elle détermine ensuite l'intégralité de la chaîne de modélisation, des algorithmes admissibles jusqu'aux indicateurs de surveillance em produção.


Quiz associés

  • 010.1-quiz-critere-de-qualification.md
  • 010.2-quiz-classificação.md
  • 010.3-quiz-regression.md
  • 010.4-quiz-arbre-de-decision.md
  • 010.5-quiz-cas-ambigus.md
  • 010.6-quiz-consequences-du-choix.md
  • 010.7-quiz-reformulation.md

Chapitre suivant : 011-types-de-classificação.md