Les trois paradigmes d'apprentissage

36 min
Bloc 0 — Situer l'apprentissage supervisé
Objectif
savoir déterminer, devant un problème quelconque, le paradigme d'apprentissage dont il relève ; connaître la définition rigoureuse des trois paradigmes et de leurs sous-familles ; savoir justifier ce classement par un critère unique et défendable.
Durée estimée
35 minutes
Prérequis
chapitres 001 et 002
Quiz associés
003.1-quiz-critere-classement.md à 003.6-quiz-qualification-probleme.md

1. Le critère de classement : la nature du signal d'apprentissage

Le chapitre 002 a établi le renversement propre au Machine Learning : les règles ne sont plus écrites, elles sont induites à partir d'observations. Cette induction suppose qu'un signal oriente l'apprentissage, c'est-à-dire qu'une information indique à l'algorithme dans quelle direction corriger ses paramètres.

La nature de ce signal constitue le seul critère de classement des paradigmes. Elle se détermine par une question unique :

« Dispose-t-on, pour les observations passées, de la valeur que l'on cherche à prédire ? »

1.1 Les trois réponses possibles

Réponse à la questionSignal disponibleParadigmeFormulation du problème
Oui — chaque observation historique porte la valeur cibleUne valeur cible connue, observation par observationApprentissage superviséReproduire sur des cas inédits l'association entrée-sortie observée
Non — aucune valeur cible n'est disponibleAucun signal externe ; seule la structure interne des données est exploitableApprentissage non superviséMettre en évidence une organisation latente des observations
Non, mais — une évaluation différée des actions existeUn scalaire de récompense émis par l'environnement après chaque actionApprentissage par renforcementDéterminer une stratégie d'action maximisant la récompense cumulée

Ces trois réponses sont exhaustives et mutuellement exclusives pour un problème correctement formulé. Un problème qui semble relever de deux paradigmes est un problème dont la formulation n'a pas été arrêtée : la question à trancher est alors « quelle est la variable cible », non « quel est le paradigme ».

DÉFINITION — Signal d'apprentissage et paradigme d'apprentissage

Signal d'apprentissage — définition rigoureuse

Information exploitée par un algorithme pour évaluer la qualité de l'hypothèse courante et en dériver une direction de correction de ses paramètres. Il prend la forme d'une valeur cible associée à chaque observation, d'un critère interne de cohérence défini sur les données seules, ou d'un scalaire de récompense émis par un environnement en réponse à une action.

Paradigme d'apprentissage — définition rigoureuse

Classe de problèmes définie par la nature du signal disponible et, par voie de conséquence, par la forme du problème d'optimisation posé : minimisation d'un risque empirique sur des couples étiquetés, optimisation d'un critère interne de structure, ou maximisation d'une espérance de récompense cumulée.

Traduction en langage courant

Le signal est ce qui permet à l'algorithme de savoir s'il se trompe ; le paradigme est la famille de problèmes définie par ce dont on dispose pour apprendre.

Point de vigilance

En l'absence de tout signal, il n'y a pas d'apprentissage au sens de Mitchell (1997) : sans mesure de performance P, aucune expérience E ne peut améliorer quoi que ce soit.

1.2 Taxonomie complète

Les branches mises en évidence délimitent le périmètre de ce cours. Les autres sont définies ici pour permettre le positionnement, sans être approfondies.

1.3 Ce qui ne constitue pas un critère de classement

La confusion la plus coûteuse, en cadrage de projet comme en entretien, consiste à classer un problème selon un critère qui n'en est pas un.

Critère invoqué à tortContre-exemple immédiat
Le domaine d'applicationLa santé donne lieu à du supervisé (diagnostic sur cas étiquetés), du non supervisé (typologie de patients) et du renforcement (dosage adaptatif)
Le type de donnéesUne image alimente une classification supervisée comme un regroupement non supervisé de photographies
L'architecture du modèleUn réseau profond peut être supervisé, non supervisé (auto-encodeur) ou de renforcement
La finalité métier« Comprendre nos clients » se traduit indifféremment par une segmentation ou par une prédiction d'attrition

Principe directeur : le paradigme se lit dans les données disponibles, non dans le sujet traité, ni dans l'outil retenu, ni dans l'ambition du commanditaire.


2. L'apprentissage supervisé

2.1 Définition

DÉFINITION — Apprentissage supervisé (supervised learning)

Définition rigoureuse

Soit un espace d'entrée X et un espace de sortie Y. On dispose d'un échantillon d'apprentissage de n couples

S = { (x_1, y_1), ..., (x_n, y_n) },  x_i ∈ X,  y_i ∈ Y

supposés issus d'un tirage indépendant et identiquement distribué selon une loi jointe P(X, Y) inconnue et fixe. L'apprentissage supervisé consiste à sélectionner, dans une classe d'hypothèses H, une fonction f: X → Y minimisant le risque espéré R(f) = E[ L(f(X), Y) ], où L est une fonction de perte mesurant l'écart entre valeur prédite et valeur observée. La loi P étant inconnue, l'algorithme minimise en pratique le risque empirique calculé sur S, sous contrainte de régularisation.

Traduction en langage courant

On fournit des exemples dont la bonne réponse est connue, et on demande à l'algorithme de construire la fonction qui reproduit au mieux cette correspondance, afin de l'appliquer à des cas dont la réponse est inconnue.

Le terme « supervisé »

Il renvoie à la présence d'un superviseur — opérateur, processus ou observation ultérieure — ayant fourni la valeur correcte pour chaque exemple, lors de la constitution du jeu de données et jamais pendant l'entraînement.

Point de vigilance

L'hypothèse de distribution fixe est structurante. Lorsque P(X, Y) évolue entre l'entraînement et l'exploitation, le risque empirique cesse d'estimer le risque espéré et la performance se dégrade : phénomène traité au chapitre 082.

DÉFINITION — Donnée étiquetée (labeled data)

Définition rigoureuse

Observation pour laquelle la valeur de la variable cible est renseignée, en sus des variables explicatives, cette valeur étant définie de manière univoque et homogène sur l'ensemble du jeu de données.

Traduction en langage courant

Une ligne du tableau pour laquelle la réponse est déjà connue.

Provenance des étiquettes

Observation différée (le crédit a été remboursé ou non), annotation humaine (un radiologue qualifie un cliché), enregistrement système (le client a résilié) ou mesure physique (la pièce a rompu à 412 heures).

Point de vigilance

Le coût d'obtention des étiquettes est fréquemment le facteur limitant d'un projet supervisé : les variables explicatives sont abondantes, les étiquettes rarement.

2.2 Le schéma de l'apprentissage supervisé

L'étiquette est présente à l'entraînement et absente à l'exploitation. Un dispositif où elle serait disponible au moment de la prédiction n'aurait aucune utilité prédictive.

2.3 Les deux sous-familles

Le type de la variable cible détermine la sous-famille.

ClassificationRégression
Nature de la cibleCatégorielle : ensemble fini de modalitésNumérique continue
Question posée« À quelle classe cette observation appartient-elle ? »« Quelle valeur cette grandeur prend-elle ? »
Sortie du modèleUne classe, généralement assortie d'une probabilitéUn nombre réel
Exemple de cibleDéfaut de paiement : oui / nonPrix de vente : 412 500 $
Métriques usuellesExactitude, précision, rappel, F1, AUCRMSE, MAE, MAPE, R²
Algorithmes représentatifsRégression logistique, arbres, forêts aléatoires, gradient boosting, SVMRégression linéaire, régression régularisée, arbres de régression, gradient boosting
Notion d'erreurDiscrète : la classe est correcte ou nonContinue : l'erreur possède une amplitude
DÉFINITION — Classification

Définition rigoureuse

Problème d'apprentissage supervisé dans lequel l'espace de sortie Y est un ensemble fini de modalités { c1c_1, ..., ckc_k }. Le modèle estime généralement la probabilité conditionnelle P(Y = cjc_j | X = x), la classe prédite résultant de l'application d'une règle de décision à ce vecteur de probabilités.

Traduction en langage courant

Ranger chaque observation dans l'une des catégories prévues à l'avance.

Sous-types : binaire (2 modalités exclusives), multiclasse (k modalités exclusives), multi-étiquettes (k modalités cumulables), ordinale (k modalités ordonnées, par exemple une notation de risque de A à E).

Point de vigilance

Les modalités sont définies avant l'entraînement et font partie de la spécification du problème. Un modèle de classification ne peut pas produire une classe qu'il n'a jamais rencontrée.

DÉFINITION — Régression, et avertissement terminologique

Définition rigoureuse

Problème d'apprentissage supervisé dans lequel l'espace de sortie Y est un sous-ensemble des réels. Le modèle estime une fonction de régression, le plus souvent l'espérance conditionnelle E[Y | X = x], par minimisation d'une perte quadratique ou absolue.

Traduction en langage courant

Estimer un nombre plutôt qu'une catégorie.

Avertissement terminologique

Le mot « régression » ne comporte, dans son usage moderne, aucun sens de recul ou de retour en arrière. Il est hérité des travaux de Francis Galton (1886) sur la transmission de la taille entre générations, qui décrivaient une régression vers la moyenne : les enfants de parents de très grande taille tendaient à être, en moyenne, moins grands que leurs parents. Le terme désignait un phénomène statistique particulier ; il a ensuite été étendu à la méthode d'ajustement employée pour le mettre en évidence, puis à toute prédiction d'une grandeur numérique. Aucune inférence ne doit donc être tirée du mot lui-même : « régression » signifie uniquement que la cible est un nombre.

Confusion à ne pas commettre

La régression logistique est un algorithme de classification, malgré son nom : elle régresse le logarithme du rapport de cotes sur les variables explicatives et produit une probabilité d'appartenance à une classe.

2.4 Quinze cas d'usage d'entreprise

#DomaineProblème métierTypeVariable cible
1BanqueOctroi de crédit à la consommationClassification binaireDéfaut de paiement à 12 mois : oui / non
2BanqueDétection de fraude sur transaction carteClassification binaire déséquilibréeTransaction frauduleuse : oui / non
3BanqueEstimation de la perte en cas de défautRégressionMontant non recouvré, en dollars
4SantéAide au diagnostic sur imagerieClassification multiclassePathologie identifiée parmi k catégories
5SantéAnticipation des réadmissionsClassification binaireRéadmission dans les 30 jours : oui / non
6ImmobilierEstimation de valeur d'un bienRégressionPrix de vente effectif, en dollars
7Ressources humainesPrévention du départ volontaireClassification binaireDémission dans les 6 mois : oui / non
8Ressources humainesEstimation de la durée de recrutementRégressionJours entre publication et signature
9Industrie / IoTMaintenance prédictiveClassification binairePanne dans les 7 jours : oui / non
10Industrie / IoTDurée de vie résiduelle d'un équipementRégressionHeures de fonctionnement avant défaillance
11MarketingPrévision de l'attritionClassification binaireRésiliation dans les 90 jours : oui / non
12MarketingValeur vie clientRégressionMarge cumulée attendue à 24 mois, en dollars
13TransportEstimation de durée de trajetRégressionDurée effective, en minutes
14CybersécuritéFiltrage de courriels d'hameçonnageClassification binaireCourriel malveillant : oui / non
15ÉnergiePrévision de charge du réseauRégressionConsommation à H+24, en mégawatts

Lecture du tableau : dans les quinze cas, une donnée historique porte la réponse. Le crédit a été remboursé ou non, le bien a été vendu à un prix constaté, la pièce a rompu à une heure mesurée. C'est cette disponibilité rétrospective de la cible qui rend le problème supervisé, non l'intention de prédire. La qualification technique du cas 7 ne préjuge par ailleurs en rien de sa licéité : les obligations de non-discrimination sont traitées au chapitre 095.

2.5 L'analogie de l'apprentissage avec corrigé

ANALOGIE — L'apprentissage avec corrigé

Un élève prépare un examen à partir d'annales. Chaque annale comporte un énoncé et un corrigé. L'élève résout l'énoncé, compare sa production au corrigé, identifie l'écart, ajuste sa méthode. Après un nombre suffisant d'exercices, il affronte un sujet inédit dont le corrigé n'existe pas encore.

Situation pédagogiqueApprentissage superviséNotation
L'énoncé de l'exerciceLes variables explicatives d'une observationxix_i
Le corrigé de l'exerciceL'étiquette, valeur cible connueyiy_i
Le recueil d'annalesLe jeu d'entraînementS
La méthode de résolution de l'élèveLa fonction apprisef
L'écart entre production et corrigéLa perte sur une observationL(f(xix_i), yiy_i)
La révision de la méthodeLa mise à jour des paramètresoptimisation
L'examen blancLe jeu de validation
L'examen final, sujet inéditLe jeu de test, puis la production
La note obtenue à l'examen finalLa performance en généralisationR(f)

Prolongements

L'élève qui mémorise les corrigés sans acquérir la méthode réussit les annales et échoue au sujet inédit : c'est le surapprentissage, traité au chapitre 040. L'élève qui dispose du corrigé pendant l'examen obtient une note excellente qui ne mesure rien : c'est la fuite de données, traitée au chapitre 028.

Limite de l'analogie

L'élève comprend ce qu'il fait et transpose à un domaine voisin. Le modèle n'établit qu'une correspondance statistique et ne transpose pas hors du domaine couvert par ses données d'entraînement.


3. L'apprentissage non supervisé

3.1 Définition

DÉFINITION — Apprentissage non supervisé (unsupervised learning)

Définition rigoureuse

Classe de problèmes dans lesquels on dispose d'un échantillon { x1x_1, ..., xnx_n }, xix_i ∈ X, sans variable cible associée. L'objectif est d'estimer une structure de la distribution P(X) : partition de l'espace des observations, sous-variété de faible dimension approchant le nuage de points, densité, ou régularités de co-occurrence. L'optimisation porte sur un critère défini exclusivement à partir des données, sans référence à une valeur attendue.

Traduction en langage courant

On fournit des observations sans aucune réponse associée et on demande à l'algorithme de faire apparaître l'organisation interne de ces données.

Le terme « non supervisé »

Il indique l'absence de réponse de référence, non l'absence d'intervention humaine : choix des variables, de la distance, du nombre de groupes et de la normalisation relèvent entièrement de l'analyste.

Point de vigilance

Un algorithme non supervisé produit toujours un résultat, y compris lorsque les données ne comportent aucune structure : un partitionnement en quatre groupes renverra quatre groupes sur un nuage parfaitement uniforme. La production d'un résultat n'atteste donc jamais l'existence d'une structure.

3.2 Les deux grandes familles

DÉFINITION — Clustering (partitionnement, segmentation)

Définition rigoureuse

Problème consistant à construire une partition ou un recouvrement d'un ensemble d'observations en groupes tels qu'une mesure de similarité intra-groupe soit maximale et la similarité inter-groupes minimale, au sens d'une distance spécifiée par l'analyste. Une méthode de partitionnement par inertie minimise ainsi la somme des carrés des écarts internes :

argmin  Σ      Σ      || x - μ_j ||²
   C   j=1..k  x ∈ C_j

μj\mu_j désigne le centre du groupe CjC_j.

Traduction en langage courant

Regrouper les observations qui se ressemblent, sans savoir à l'avance quels groupes existent ni combien il y en a.

Paramètres à la charge de l'analyste

Nombre de groupes, mesure de distance, normalisation, sélection des variables. Chacun de ces choix modifie le résultat ; il n'existe pas de partition « vraie » qu'un algorithme découvrirait indépendamment d'eux.

Point de vigilance

Les groupes produits n'ont pas de nom. Leur dénomination et leur interprétation sont un acte métier postérieur à l'algorithme, jamais une sortie de celui-ci.

DÉFINITION — Réduction de dimension (dimensionality reduction)

Définition rigoureuse

Problème consistant à construire une application g: X → Z, avec dim(Z) < dim(X), préservant au mieux une propriété de la distribution d'origine : variance expliquée pour l'analyse en composantes principales, structure de voisinage local pour les méthodes de plongement non linéaire, capacité de reconstruction pour les auto-encodeurs. Le critère optimisé est interne aux données.

Traduction en langage courant

Représenter les mêmes observations avec moins de variables, en perdant le moins d'information possible.

Finalités opérationnelles : visualisation, compression, débruitage, prétraitement d'un modèle supervisé, atténuation du fléau de la dimension.

Point de vigilance

Employée en amont d'un modèle supervisé, la réduction de dimension doit être ajustée sur les seules données d'entraînement puis appliquée telle quelle aux données de validation et de test. L'ajuster sur l'ensemble des données constitue une fuite de données, traitée au chapitre 028.

3.3 Exemple chiffré : segmentation d'une base client

Une enseigne de distribution dispose de 12 000 clients actifs. Aucune variable cible n'existe : la direction ne demande pas de prédire un comportement, mais de comprendre la structure de sa base. Quatre variables sont retenues — fréquence d'achat annuelle, panier moyen, ancienneté, part des achats en ligne — et un partitionnement en quatre groupes est appliqué après normalisation.

Sortie brute de l'algorithme

GroupeEffectifPartFréquence annuellePanier moyenAnciennetéPart en ligne
Groupe 14 32036 %1,2 achat38 $8 mois22 %
Groupe 23 60030 %11,4 achats42 $5,2 ans15 %
Groupe 32 88024 %4,1 achats187 $3,4 ans71 %
Groupe 41 20010 %0,4 achat25 $6,1 ans5 %

Les identifiants numériques sont dépourvus de sens : « Groupe 1 » ne signifie rien et n'est pas ordonné par rapport à « Groupe 2 ».

Interprétation métier, postérieure à l'algorithme

GroupeDénomination retenue par le métierLectureAction envisagée
Groupe 1Nouveaux clients occasionnelsAncienneté faible, engagement faibleParcours d'activation sur les 6 premiers mois
Groupe 2Habitués de proximitéFréquence élevée, panier faible, canal physiqueProgramme de fidélité, montée en panier
Groupe 3Acheteurs à fort panier en lignePanier quatre fois supérieur, canal numériqueOffre premium, service de livraison dédié
Groupe 4Clients dormantsAncienneté élevée, activité quasi nulleCampagne de réactivation ou sortie du fichier actif

Point déterminant : la deuxième colonne n'a pas été produite par l'algorithme. Elle a été formulée par des responsables métier examinant les caractéristiques statistiques de chaque groupe. Un algorithme de clustering délimite des groupes ; il ne les nomme pas et ne les explique pas.

3.4 L'absence de vérité de référence

C'est la différence structurelle la plus importante avec l'apprentissage supervisé. Chaque prédiction supervisée peut être confrontée à la valeur observée : l'exactitude est mesurable. En non supervisé, il n'existe aucune partition de référence, et la question « cette segmentation est-elle exacte ? » est mal posée. L'évaluation repose alors sur deux ordres de critères.

Ordre de critèreNatureExemplesLimite
Critères internesStatistique, calculé sur les données seulesCoefficient de silhouette, inertie intra-classe, indices de Davies-Bouldin et de Calinski-HarabaszUn score élevé n'atteste pas la pertinence métier
Critères d'utilité métierOpérationnel, évalué par les responsables du domaineGroupes interprétables, actionnables, de taille exploitable, stables dans le tempsSubjectivité, dépendance à l'expertise disponible

Point de vigilance : une segmentation au coefficient de silhouette excellent mais dont les groupes n'appellent aucune action est un échec opérationnel ; une partition au score interne médiocre dont les groupes appellent des actions différenciées et mesurables est un succès. Le critère final est l'utilité.

Conséquence sur la conduite de projet : un projet non supervisé ne peut être piloté par un seuil contractuel du type « au moins 90 % d'exactitude », mais par une revue d'interprétabilité associant le métier.

3.5 Applications réelles

DomaineApplicationSous-familleSortie exploitée
DistributionSegmentation de la base clientClusteringGroupes homogènes pour ciblage différencié
CommerceAnalyse du panier d'achatRègles d'associationProduits fréquemment co-achetés
AssuranceTypologie de profils de sinistralitéClusteringGroupes servant de base à une tarification
Bio-informatiqueRegroupement de profils d'expression géniqueClusteringSous-types moléculaires candidats
IndustrieCompression de signaux de capteursRéduction de dimensionReprésentation compacte pour surveillance
DocumentationRegroupement thématique de corpusClusteringFamilles de documents sans nomenclature préalable
CybersécuritéDétection de comportements atypiquesDétection d'anomaliesAlertes à qualifier par un analyste
MarketingRéduction d'un questionnaire à ses axes principauxRéduction de dimensionFacteurs synthétiques d'attitude

Observation professionnelle : l'apprentissage non supervisé intervient plus souvent en amont d'un projet supervisé, au titre de l'exploration, qu'en production autonome. Une segmentation peut d'ailleurs devenir une variable explicative d'un modèle supervisé ultérieur.


4. L'apprentissage par renforcement

4.1 Définition

DÉFINITION — Apprentissage par renforcement (reinforcement learning)

Définition rigoureuse

Cadre d'apprentissage dans lequel un agent interagit séquentiellement avec un environnement. À chaque pas de temps t, l'agent observe un état sts_t, choisit une action ata_t selon une politique π, reçoit une récompense scalaire rt+1r_{t+1} et observe un nouvel état st+1s_{t+1}. Le problème est le plus souvent formalisé comme un processus de décision markovien (S, A, P, R, γ), avec γ ∈ [0, 1[ le facteur d'actualisation. L'objectif est de déterminer une politique π maximisant l'espérance du gain cumulé actualisé :

J(\pi) = \mathbb{E}\left[ \sum_{t \ge 0} \gamma^{t} \, $$r_{t+1}$$ \right]

Référence de synthèse : Sutton et Barto, Reinforcement Learning: An Introduction (1998, seconde édition 2018).

Traduction en langage courant

L'agent n'apprend pas à partir de bonnes réponses fournies à l'avance mais par essais successifs : il agit, l'environnement le sanctionne ou le récompense, et il ajuste sa stratégie de façon à accumuler le plus de récompense possible.

Ce qui distingue la récompense d'une étiquette

L'étiquette indique la bonne réponse, préexiste à l'entraînement et concerne une observation isolée. La récompense évalue la réponse produite, est engendrée pendant l'interaction, porte sur une séquence d'actions et dépend des actions du modèle lui-même.

Point de vigilance

Le caractère différé de la récompense engendre le problème d'attribution du mérite : lorsqu'une récompense survient au terme de centaines d'actions, déterminer lesquelles y ont contribué constitue la difficulté centrale du paradigme.

4.2 La boucle agent-environnement

Le cycle se répète jusqu'à un état terminal ou indéfiniment. La particularité structurelle du paradigme apparaît ici : les données d'apprentissage sont produites par l'agent lui-même. Une politique médiocre engendre des trajectoires médiocres, dont l'agent doit néanmoins apprendre. De là l'arbitrage entre exploration et exploitation : une politique qui n'exploite jamais n'accumule aucune récompense, une politique qui n'explore jamais se fige sur un optimum local. Cet arbitrage n'a pas d'équivalent en apprentissage supervisé, où le jeu de données est fixe.

4.3 Vocabulaire de référence

Terme françaisTerme anglaisNotationDéfinitionExemple : robot de manutention
AgentAgentEntité qui décide et agitLe contrôleur du robot
EnvironnementEnvironmentSystème avec lequel l'agent interagit, produisant transitions et récompensesL'entrepôt, ses rayonnages, ses obstacles
ÉtatStatests_tDescription de la situation à l'instant t, suffisante pour déciderPosition, charge portée, niveau de batterie
ActionActionata_tDécision prise parmi celles disponiblesAvancer, tourner, saisir, déposer
RécompenseRewardrt+1r_{t+1}Scalaire émis par l'environnement évaluant la transition+10 colis déposé, -1 par seconde, -100 collision
PolitiquePolicyπ(a|s)Règle associant à chaque état une action ou une distribution sur les actionsLa stratégie de navigation apprise

4.4 Applications

DomaineApplicationNature de la récompenseMaturité
JeuxGo, échecs, jeux vidéoVictoire, scoreDémontrée, références académiques majeures
RobotiqueLocomotion, préhension, navigationProgression vers l'objectif, pénalité de collisionOpérationnelle en environnement contrôlé
Centres de donnéesRégulation du refroidissementÉconomie d'énergie sous contrainte de températureDéploiements industriels documentés
FinanceExécution d'ordres, allocation dynamiqueRendement ajusté du risqueUsage réel, fortement encadré
PublicitéAllocation d'affichage, bandits contextuelsClic, conversionTrès répandue sous forme de bandits
LogistiqueOrdonnancement, gestion de stockCoût total, taux de serviceÉmergente, généralement en simulation

Cas particulier des bandits manchots : forme simplifiée d'apprentissage par renforcement sans transition d'état, massivement déployée pour l'allocation de contenus et les tests adaptatifs, et principale exposition réelle des organisations à ce paradigme.

ANALOGIE — L'acquisition d'une compétence motrice

Apprendre à faire du vélo ne procède pas d'un corrigé : personne ne peut fournir, pour chaque milliseconde, la valeur exacte de l'angle du guidon et de l'inclinaison du buste. La consigne « garde l'équilibre » n'est pas une étiquette. Le signal disponible est une conséquence : l'apprenti tient debout, ou il tombe. Le lien entre le geste fautif et sa conséquence est différé de quelques secondes.

Élément de la situationCorrespondance formelle
L'apprenti cyclisteL'agent
Le vélo, la route, la gravitéL'environnement
Inclinaison, vitesse, position du guidonL'état sts_t
Corriger la trajectoire, pédaler, freinerL'action ata_t
Mètres parcourus sans chute, chuteLa récompense rt+1r_{t+1}
Les réflexes acquisLa politique π
Essayer une trajectoire inhabituelleL'exploration
Reproduire ce qui a fonctionnéL'exploitation

Ce que l'analogie met en évidence

La compétence est acquise par interaction et non par mémorisation de couples question-réponse : elle ne peut pas être transmise par un exposé, et son acquisition exige un grand nombre d'essais, y compris infructueux. Un enfant tombe quelques dizaines de fois ; un agent artificiel requiert couramment des millions d'épisodes. Lorsque chaque épisode a un coût matériel ou humain, l'entraînement en conditions réelles devient impraticable — d'où l'exigence d'un simulateur.

4.5 Les quatre obstacles à l'adoption en entreprise

L'apprentissage par renforcement occupe une place considérable dans la communication publique du domaine et une place marginale dans les portefeuilles de projets. Quatre obstacles expliquent cet écart.

ObstacleÉnoncéConséquence pratiqueSituations où l'obstacle est levé
1. Environnement simulable requisL'apprentissage exige des interactions massives, inacceptables sur le système réelIl faut un simulateur fidèle, dont la construction est un projet à part entièreJeux, systèmes physiques bien modélisés, files d'attente, environnements numériques
2. Coût computationnelLe nombre d'épisodes dépasse de plusieurs ordres de grandeur le volume d'un entraînement superviséBudget de calcul élevé, délais longs, itérations lentesProblèmes de faible dimension, bandits, simulations peu coûteuses
3. Spécification de la récompenseTraduire un objectif métier en un scalaire est risqué : l'agent optimise exactement ce qui est écritComportements dégénérés maximisant la mesure sans servir l'intentionObjectifs à mesure directe et non contournable
4. Contrôlabilité en productionLa politique explore, évolue et prend des décisions séquentielles difficiles à auditerDifficulté d'homologation, de traçabilité et de garantie de comportementDomaines à faible criticité, ou dispositifs bornés par des règles de sécurité externes

Développement de l'obstacle 3 : les comportements dégénérés

Une fonction de récompense mal spécifiée conduit l'agent à maximiser la mesure plutôt que l'objectif qu'elle représente. La littérature désigne ce phénomène par le terme de reward hacking.

Objectif viséRécompense écriteComportement dégénéré possible
Nettoyer une pièceQuantité de poussière collectéeRépandre la poussière pour la collecter à nouveau
Terminer une coursePoints accumulés sur le parcoursTourner en boucle sur une zone à points sans franchir la ligne
Maximiser l'engagementDurée de sessionFavoriser les contenus polarisants au détriment de la satisfaction
Réduire le délai de traitementDossiers clos par heureClore les dossiers difficiles sans les résoudre
Éviter les collisionsPénalité en cas de contactRester immobile

L'agent n'optimise pas l'intention du concepteur, il optimise la fonction de récompense ; tout écart entre les deux sera exploité. Ce constat rejoint la loi de Goodhart : lorsqu'une mesure devient un objectif, elle cesse d'être une bonne mesure.

Point de vigilance sur l'obstacle 4 : un modèle supervisé produit une prédiction ponctuelle qu'un processus métier peut filtrer avant action ; un agent de renforcement produit une politique d'action. Le point de contrôle humain doit donc être conçu explicitement, sous forme de contraintes de sécurité externes à l'apprentissage.


5. Les paradigmes intermédiaires

La disponibilité du signal admet des états intermédiaires : étiquettes partielles, étiquettes fabriquées, étiquettes présentes mais très rares. Trois configurations en découlent.

5.1 L'apprentissage semi-supervisé

DÉFINITION — Apprentissage semi-supervisé (semi-supervised learning)

Définition rigoureuse

Classe de problèmes dans lesquels l'échantillon réunit un sous-ensemble étiqueté SlS_l = { (xix_i, yiy_i) } de taille l et un sous-ensemble non étiqueté SuS_u = { xjx_j } de taille u, avec généralement u >> l. Les méthodes exploitent la distribution marginale P(X) estimée sur SuS_u pour contraindre l'estimation de P(Y | X) apprise sur SlS_l, sous des hypothèses de régularité : continuité, groupement, variété.

Traduction en langage courant

On dispose de beaucoup d'observations et de peu de réponses connues ; la masse non étiquetée sert à mieux tirer parti du petit nombre d'étiquettes disponibles.

Point de vigilance

Les hypothèses de régularité ne sont pas toujours satisfaites. Lorsqu'elles ne le sont pas, l'ajout de données non étiquetées peut dégrader la performance par rapport à un modèle entraîné sur les seules données étiquetées.

Cas d'école : l'imagerie médicale

Un centre hospitalier dispose de 200 000 clichés archivés, dont 2 000 seulement sont annotés : l'annotation mobilise un radiologue plusieurs minutes par cliché, et l'annotation intégrale représenterait plusieurs années-homme. L'approche supervisée stricte écarte 99 % de l'information disponible ; l'approche semi-supervisée apprend la structure de l'espace des images sur les 198 000 clichés bruts et ajuste la règle de décision sur les 2 000 clichés annotés.

5.2 L'apprentissage auto-supervisé

DÉFINITION — Apprentissage auto-supervisé (self-supervised learning)

Définition rigoureuse

Classe de méthodes dans lesquelles la variable cible est construite automatiquement à partir de la structure interne des données, sans intervention d'un annotateur. Une tâche dite prétexte est définie de sorte que son étiquette soit déductible de la donnée brute ; le modèle est entraîné sur cette tâche par minimisation d'un risque empirique classique, puis la représentation obtenue est réutilisée pour la tâche cible.

Traduction en langage courant

L'algorithme fabrique lui-même ses exercices et leurs corrigés à partir des données brutes, ce qui supprime le coût d'annotation.

Précision déterminante

La mécanique d'apprentissage demeure strictement supervisée : il existe une valeur cible, une fonction de perte, une comparaison entre prédiction et cible. Seule la provenance de l'étiquette change — extraite des données au lieu d'être fournie par un opérateur. L'auto-supervisé n'est donc pas un quatrième paradigme, mais une modalité d'obtention des étiquettes.

Point de vigilance

La qualité de la représentation dépend entièrement de la pertinence de la tâche prétexte. Une tâche résoluble par un artefact superficiel produit une représentation sans valeur pour la tâche cible.

Cas d'école : le masquage de mots

À partir d'un corpus de texte brut, non annoté, des exemples d'entraînement sont construits en masquant des mots et en demandant au modèle de les restituer.

ÉtapeContenu
Donnée brute« Le taux directeur a été relevé de vingt-cinq points de base. »
Exemple fabriqué (entrée)« Le taux directeur a été [MASQUE] de vingt-cinq points de base. »
Étiquette fabriquée (cible)« relevé »
Coût d'annotationNul : l'étiquette est le mot retiré

Ce mécanisme, popularisé par les architectures de type BERT (Devlin et al., 2018) puis généralisé par les modèles de langue autorégressifs, permet d'exploiter des corpus de très grande taille sans annotation humaine. La représentation obtenue est ensuite spécialisée sur une tâche supervisée disposant de peu d'étiquettes.

5.3 La détection d'anomalies

DÉFINITION — Détection d'anomalies (anomaly detection)

Définition rigoureuse

Problème consistant à identifier les observations dont la génération est improbable au regard de la distribution des observations dites normales. Selon la disponibilité d'exemples d'anomalies étiquetés, il se formule comme une classification supervisée fortement déséquilibrée, comme une estimation de densité ou de support non supervisée, ou comme une classification à une classe.

Traduction en langage courant

Repérer ce qui sort de l'ordinaire, que l'on dispose ou non d'exemples de cas anormaux.

Position taxonomique

La détection d'anomalies est à cheval sur deux paradigmes. Elle ne constitue pas une famille supplémentaire : elle désigne une finalité métier traitable dans l'un ou l'autre paradigme selon les données disponibles.

Configuration des donnéesParadigme applicableMéthodes usuellesÉvaluation
Historique d'anomalies confirmées et étiquetées, en très faible proportionSupervisé, en régime de fort déséquilibreGradient boosting, forêts aléatoires avec rééchantillonnage ou pondérationRappel, précision, aire sous la courbe précision-rappel
Aucune anomalie étiquetée, ou anomalies futures distinctes des anomalies passéesNon superviséIsolation Forest, estimation de densité, SVM à une classe, auto-encodeurCritères internes, taux d'alerte, qualification par un expert
Quelques anomalies étiquetées et une masse d'observations non qualifiéesSemi-superviséModélisation de la normalité, puis calibrage du seuil sur les cas étiquetésPrécision sur les cas confirmés, coût des faux positifs

Critère de choix pratique

Si les anomalies à détecter ressemblent à celles déjà observées et étiquetées, le problème est supervisé. Si les anomalies à détecter sont inconnues par nature, le problème est non supervisé.

En détection de fraude bancaire, les schémas connus se traitent en supervisé, avec les techniques de gestion du déséquilibre traitées au chapitre 050 ; les schémas nouveaux échappent par construction à un modèle entraîné sur le passé et relèvent d'une approche non supervisée. Les dispositifs en production combinent fréquemment les deux.


6. Méthode de qualification d'un problème

6.1 Arbre de décision

Lecture de la branche « Cadrage à reprendre » : l'absence d'étiquettes ne disqualifie pas le projet, elle en déplace la première étape. La question devient « comment constituer un jeu étiqueté » — annotation, collecte prospective, exploitation d'un enregistrement système — ou « quel objectif non supervisé assumer ».

6.2 Tableau comparatif des trois paradigmes

CritèreSuperviséNon superviséRenforcement
ÉtiquettesRequises pour chaque observation d'entraînementAucuneAucune ; remplacées par un signal de récompense
Question posée« Quelle est la valeur de Y pour cette observation ? »« Quelle organisation structure ces observations ? »« Quelle suite d'actions maximise le gain cumulé ? »
AnalogieL'apprentissage avec corrigéLe tri d'objets sans nomenclature préalableL'acquisition d'une compétence motrice
Mesure d'exactitudeDirecte : comparaison entre prédiction et valeur observéeImpossible au sens strict : aucune vérité de référenceIndirecte : récompense cumulée sur des épisodes
Sous-typesClassification, régressionClustering, réduction de dimension, règles d'associationMéthodes fondées sur la valeur, sur la politique, bandits
Algorithmes typiquesRégression linéaire et logistique, arbres, forêts aléatoires, gradient boosting, SVM, réseaux de neuronesk-means, classification hiérarchique, DBSCAN, ACP, UMAP, auto-encodeursQ-learning, SARSA, gradients de politique, acteur-critique
Fréquence en entreprisePrépondérante : la grande majorité des modèles en productionSignificative, principalement en exploration et en préparationMarginale hors R&D, à l'exception notable des bandits
ExemplePrédire la résiliation d'un client à 90 joursSegmenter la base client en groupes homogènesOptimiser une politique de gestion de stock en simulation
Couverture par ce coursObjet central, du chapitre 004 jusqu'au termePositionné ici, non approfondiPositionné ici, non approfondi

6.3 Distinguer classification et clustering

Les deux procédures produisent des groupes ; la ressemblance s'arrête là. La confusion entre les deux est l'une des plus fréquentes en entretien.

Point de comparaisonClassificationClustering
ParadigmeSuperviséNon supervisé
Les groupes existent-ils avant l'analyse ?Oui, ils font partie de la spécificationNon, ils résultent du calcul
Nombre de groupesFixé par le problème métierChoisi par l'analyste, souvent par exploration
Les groupes ont-ils un nom ?Oui, un sens métier défini a prioriNon, des identifiants arbitraires à interpréter
Données requisesObservations étiquetéesObservations seules
Question posée« Cette observation appartient-elle à la classe A ou B ? »« Quels groupes émergent de ces observations ? »
ÉvaluationExactitude, rappel, précision, F1, AUCSilhouette, inertie, utilité métier
Stabilité du sensStable : les classes ne changent pasInstable : une autre initialisation ou un autre k modifie les groupes
ExempleAffecter un courriel à « spam » ou « légitime »Découvrir quatre profils dans une base client
Formulation métier déclenchante« Nous savons ce que nous cherchons »« Nous voulons savoir ce qu'il y a »

Test de discrimination en une question : la liste des groupes figure-t-elle dans le cahier des charges ? Si oui, il s'agit de classification ; sinon, de clustering.


7. Erreurs de raisonnement fréquentes

ERREUR — Croire faire de l'apprentissage supervisé sans disposer d'étiquettes

Un service marketing demande un modèle prédisant « les clients à fort potentiel ». Aucune variable de ce nom n'existe dans le système d'information : l'intention de prédire ne suffit pas à créer un problème supervisé. Deux issues sont possibles, et une seule doit être choisie explicitement : définir une cible mesurable et vérifiable dans l'historique — par exemple « chiffre d'affaires des 12 mois suivants supérieur à 5 000 $ » — ou assumer une démarche exploratoire non supervisée produisant des groupes à interpréter.

Formulation correcte : « Un problème supervisé requiert une variable cible définie, mesurable et présente dans l'historique. Tant qu'elle n'est pas constituée, il n'y a pas de problème supervisé. »

ERREUR — Confondre clustering et classification

Les deux produisent des groupes, ce qui suffit à entretenir la confusion. Le critère discriminant n'est pas la sortie mais l'entrée : les classes préexistent-elles dans les données d'entraînement ? Une conséquence est régulièrement observée : un clustering présenté comme un modèle prédictif, assorti d'une prétendue mesure d'exactitude, laquelle est sans objet en l'absence de partition de référence.

Formulation correcte : « La classification affecte une observation à des classes définies au préalable et apprises sur des exemples étiquetés ; le clustering constitue des groupes à partir des seules similarités, sans classes préexistantes ni exactitude mesurable. »

ERREUR — Considérer l'apprentissage non supervisé comme plus simple

L'absence d'étiquettes allège la collecte et donne l'impression d'un problème moins exigeant. C'est l'inverse sur le plan de la validation : sans vérité de référence, le projet est privé de critère objectif d'arrêt, et le nombre de groupes, la distance et la normalisation relèvent de choix qu'aucune métrique ne tranche. Un projet supervisé se conclut par une performance chiffrée sur un jeu de test ; un projet non supervisé, par une décision d'acceptation métier.

Formulation correcte : « L'apprentissage non supervisé est moins exigeant en données étiquetées et plus exigeant en interprétation : sa difficulté est déplacée de la collecte vers la validation. »

ERREUR — Traiter le Deep Learning comme un quatrième paradigme

L'énumération « supervisé, non supervisé, renforcement, Deep Learning » mélange deux plans de classement. Les trois premiers termes désignent des paradigmes, définis par la nature du signal d'apprentissage ; le quatrième désigne une classe de modèles, définie par une architecture. Un réseau de neurones entraîné sur des images étiquetées relève du supervisé, un auto-encodeur du non supervisé, un réseau optimisant une politique par récompense du renforcement.

Formulation correcte : « Le Deep Learning est une classe de modèles mobilisable dans les trois paradigmes ; il se situe sur un autre plan de classement. »

ERREUR — Utiliser comme étiquette une variable postérieure à l'instant de prédiction

Pour prédire l'attrition à 90 jours, une équipe retient comme variable explicative le nombre d'appels au service de résiliation. La performance est excellente en validation et nulle en production : au moment où la prédiction doit être produite, cet appel n'a pas encore eu lieu. La variable n'est pas prédictive, elle est constitutive de l'événement à prédire. Cette forme de fuite de données, traitée au chapitre 028, n'est pas détectable par les métriques : elle les améliore.

Règle de contrôle : pour chaque variable explicative, vérifier que sa valeur serait effectivement disponible à l'instant où le modèle sera interrogé en production.

Formulation correcte : « L'étiquette est postérieure aux variables explicatives ; toute information contemporaine ou postérieure à la réalisation de la cible doit être exclue du jeu d'entraînement. »

ERREUR — Déduire le paradigme du domaine d'application

« La santé, c'est du supervisé » ou « le marketing, c'est du clustering » sont des énoncés sans fondement. La santé donne lieu à la prédiction d'une réadmission (supervisé), à l'identification de sous-groupes de patients (non supervisé) et à l'adaptation séquentielle d'un protocole de dosage (renforcement). Le marketing donne lieu à la prédiction d'une résiliation, à une segmentation et à l'allocation dynamique d'offres par bandits.

Formulation correcte : « Le paradigme se détermine par la nature du signal d'apprentissage disponible, jamais par le secteur d'activité. »


8. Synthèse

LE CRITÈRE UNIQUE
    « Dispose-t-on, pour les observations passées,
      de la valeur que l'on cherche à prédire ? »

    Oui ..................................... SUPERVISÉ
    Non ..................................... NON SUPERVISÉ
    Non, mais une évaluation différée
    des actions est disponible .............. RENFORCEMENT

SOUS-FAMILLES
    Supervisé      : classification (cible catégorielle)
                     régression     (cible numérique)
    Non supervisé  : clustering, réduction de dimension,
                     règles d'association
    Renforcement   : méthodes fondées sur la valeur ou sur la politique

CONFIGURATIONS INTERMÉDIAIRES
    Semi-supervisé : une fraction seulement des observations est étiquetée
    Auto-supervisé : étiquettes fabriquées à partir des données ;
                     la mécanique reste supervisée
    Anomalies      : supervisé si les anomalies passées sont étiquetées,
                     non supervisé si elles sont inconnues par nature

CE QUI N'EST PAS UN CRITÈRE DE CLASSEMENT
    le domaine, le type de données, le volume,
    l'architecture du modèle, la finalité affichée

DISTINCTION À NE JAMAIS PERDRE
    Classification : les groupes existent avant l'analyse
    Clustering     : les groupes résultent de l'analyse

CE QUE MESURE CHAQUE PARADIGME
    Supervisé      : une exactitude, par comparaison à la valeur observée
    Non supervisé  : une cohésion interne et une utilité métier
    Renforcement   : une récompense cumulée sur des épisodes

POSITION DU DEEP LEARNING
    Classe de modèles mobilisable dans les trois paradigmes.
    Ce n'est pas un quatrième paradigme.

Énoncé de synthèse

Les paradigmes d'apprentissage se distinguent par la nature du signal disponible et par rien d'autre : une valeur cible connue observation par observation définit l'apprentissage supervisé, la seule structure interne des données définit l'apprentissage non supervisé, une récompense différée émise par un environnement définit l'apprentissage par renforcement ; le domaine, le volume et l'architecture du modèle sont sans effet sur ce classement.


Quiz associés : 003.1-quiz-critere-classement.md, 003.2-quiz-apprentissage-supervise.md, 003.3-quiz-apprentissage-non-supervise.md, 003.4-quiz-apprentissage-renforcement.md, 003.5-quiz-paradigmes-intermediaires.md, 003.6-quiz-qualification-probleme.md

Chapitre suivant : 004-apprentissage-supervise.md