Le chapitre 002 a établi le renversement propre au Machine Learning : les règles ne sont plus écrites, elles sont induites à partir d'observations. Cette induction suppose qu'un signal oriente l'apprentissage, c'est-à-dire qu'une information indique à l'algorithme dans quelle direction corriger ses paramètres.
La nature de ce signal constitue le seul critère de classement des paradigmes. Elle se détermine par une question unique :
« Dispose-t-on, pour les observations passées, de la valeur que l'on cherche à prédire ? »
| Réponse à la question | Signal disponible | Paradigme | Formulation du problème |
|---|---|---|---|
| Oui — chaque observation historique porte la valeur cible | Une valeur cible connue, observation par observation | Apprentissage supervisé | Reproduire sur des cas inédits l'association entrée-sortie observée |
| Non — aucune valeur cible n'est disponible | Aucun signal externe ; seule la structure interne des données est exploitable | Apprentissage non supervisé | Mettre en évidence une organisation latente des observations |
| Non, mais — une évaluation différée des actions existe | Un scalaire de récompense émis par l'environnement après chaque action | Apprentissage par renforcement | Déterminer une stratégie d'action maximisant la récompense cumulée |
Ces trois réponses sont exhaustives et mutuellement exclusives pour un problème correctement formulé. Un problème qui semble relever de deux paradigmes est un problème dont la formulation n'a pas été arrêtée : la question à trancher est alors « quelle est la variable cible », non « quel est le paradigme ».
Signal d'apprentissage — définition rigoureuse
Information exploitée par un algorithme pour évaluer la qualité de l'hypothèse courante et en dériver une direction de correction de ses paramètres. Il prend la forme d'une valeur cible associée à chaque observation, d'un critère interne de cohérence défini sur les données seules, ou d'un scalaire de récompense émis par un environnement en réponse à une action.
Paradigme d'apprentissage — définition rigoureuse
Classe de problèmes définie par la nature du signal disponible et, par voie de conséquence, par la forme du problème d'optimisation posé : minimisation d'un risque empirique sur des couples étiquetés, optimisation d'un critère interne de structure, ou maximisation d'une espérance de récompense cumulée.
Traduction en langage courant
Le signal est ce qui permet à l'algorithme de savoir s'il se trompe ; le paradigme est la famille de problèmes définie par ce dont on dispose pour apprendre.
Point de vigilance
En l'absence de tout signal, il n'y a pas d'apprentissage au sens de Mitchell (1997) : sans mesure de performance P, aucune expérience E ne peut améliorer quoi que ce soit.
Les branches mises en évidence délimitent le périmètre de ce cours. Les autres sont définies ici pour permettre le positionnement, sans être approfondies.
La confusion la plus coûteuse, en cadrage de projet comme en entretien, consiste à classer un problème selon un critère qui n'en est pas un.
| Critère invoqué à tort | Contre-exemple immédiat |
|---|---|
| Le domaine d'application | La santé donne lieu à du supervisé (diagnostic sur cas étiquetés), du non supervisé (typologie de patients) et du renforcement (dosage adaptatif) |
| Le type de données | Une image alimente une classification supervisée comme un regroupement non supervisé de photographies |
| L'architecture du modèle | Un réseau profond peut être supervisé, non supervisé (auto-encodeur) ou de renforcement |
| La finalité métier | « Comprendre nos clients » se traduit indifféremment par une segmentation ou par une prédiction d'attrition |
Principe directeur : le paradigme se lit dans les données disponibles, non dans le sujet traité, ni dans l'outil retenu, ni dans l'ambition du commanditaire.
Définition rigoureuse
Soit un espace d'entrée X et un espace de sortie Y. On dispose d'un échantillon d'apprentissage de n couples
S = { (x_1, y_1), ..., (x_n, y_n) }, x_i ∈ X, y_i ∈ Ysupposés issus d'un tirage indépendant et identiquement distribué selon une loi jointe P(X, Y) inconnue et fixe. L'apprentissage supervisé consiste à sélectionner, dans une classe d'hypothèses H, une fonction f: X → Y minimisant le risque espéré R(f) = E[ L(f(X), Y) ], où L est une fonction de perte mesurant l'écart entre valeur prédite et valeur observée. La loi P étant inconnue, l'algorithme minimise en pratique le risque empirique calculé sur S, sous contrainte de régularisation.
Traduction en langage courant
On fournit des exemples dont la bonne réponse est connue, et on demande à l'algorithme de construire la fonction qui reproduit au mieux cette correspondance, afin de l'appliquer à des cas dont la réponse est inconnue.
Le terme « supervisé »
Il renvoie à la présence d'un superviseur — opérateur, processus ou observation ultérieure — ayant fourni la valeur correcte pour chaque exemple, lors de la constitution du jeu de données et jamais pendant l'entraînement.
Point de vigilance
L'hypothèse de distribution fixe est structurante. Lorsque P(X, Y) évolue entre l'entraînement et l'exploitation, le risque empirique cesse d'estimer le risque espéré et la performance se dégrade : phénomène traité au chapitre 082.
Définition rigoureuse
Observation pour laquelle la valeur de la variable cible est renseignée, en sus des variables explicatives, cette valeur étant définie de manière univoque et homogène sur l'ensemble du jeu de données.
Traduction en langage courant
Une ligne du tableau pour laquelle la réponse est déjà connue.
Provenance des étiquettes
Observation différée (le crédit a été remboursé ou non), annotation humaine (un radiologue qualifie un cliché), enregistrement système (le client a résilié) ou mesure physique (la pièce a rompu à 412 heures).
Point de vigilance
Le coût d'obtention des étiquettes est fréquemment le facteur limitant d'un projet supervisé : les variables explicatives sont abondantes, les étiquettes rarement.
L'étiquette est présente à l'entraînement et absente à l'exploitation. Un dispositif où elle serait disponible au moment de la prédiction n'aurait aucune utilité prédictive.
Le type de la variable cible détermine la sous-famille.
| Classification | Régression | |
|---|---|---|
| Nature de la cible | Catégorielle : ensemble fini de modalités | Numérique continue |
| Question posée | « À quelle classe cette observation appartient-elle ? » | « Quelle valeur cette grandeur prend-elle ? » |
| Sortie du modèle | Une classe, généralement assortie d'une probabilité | Un nombre réel |
| Exemple de cible | Défaut de paiement : oui / non | Prix de vente : 412 500 $ |
| Métriques usuelles | Exactitude, précision, rappel, F1, AUC | RMSE, MAE, MAPE, R² |
| Algorithmes représentatifs | Régression logistique, arbres, forêts aléatoires, gradient boosting, SVM | Régression linéaire, régression régularisée, arbres de régression, gradient boosting |
| Notion d'erreur | Discrète : la classe est correcte ou non | Continue : l'erreur possède une amplitude |
Définition rigoureuse
Problème d'apprentissage supervisé dans lequel l'espace de sortie Y est un ensemble fini de modalités { , ..., }. Le modèle estime généralement la probabilité conditionnelle P(Y = | X = x), la classe prédite résultant de l'application d'une règle de décision à ce vecteur de probabilités.
Traduction en langage courant
Ranger chaque observation dans l'une des catégories prévues à l'avance.
Sous-types : binaire (2 modalités exclusives), multiclasse (k modalités exclusives), multi-étiquettes (k modalités cumulables), ordinale (k modalités ordonnées, par exemple une notation de risque de A à E).
Point de vigilance
Les modalités sont définies avant l'entraînement et font partie de la spécification du problème. Un modèle de classification ne peut pas produire une classe qu'il n'a jamais rencontrée.
Définition rigoureuse
Problème d'apprentissage supervisé dans lequel l'espace de sortie Y est un sous-ensemble des réels. Le modèle estime une fonction de régression, le plus souvent l'espérance conditionnelle E[Y | X = x], par minimisation d'une perte quadratique ou absolue.
Traduction en langage courant
Estimer un nombre plutôt qu'une catégorie.
Avertissement terminologique
Le mot « régression » ne comporte, dans son usage moderne, aucun sens de recul ou de retour en arrière. Il est hérité des travaux de Francis Galton (1886) sur la transmission de la taille entre générations, qui décrivaient une régression vers la moyenne : les enfants de parents de très grande taille tendaient à être, en moyenne, moins grands que leurs parents. Le terme désignait un phénomène statistique particulier ; il a ensuite été étendu à la méthode d'ajustement employée pour le mettre en évidence, puis à toute prédiction d'une grandeur numérique. Aucune inférence ne doit donc être tirée du mot lui-même : « régression » signifie uniquement que la cible est un nombre.
Confusion à ne pas commettre
La régression logistique est un algorithme de classification, malgré son nom : elle régresse le logarithme du rapport de cotes sur les variables explicatives et produit une probabilité d'appartenance à une classe.
| # | Domaine | Problème métier | Type | Variable cible |
|---|---|---|---|---|
| 1 | Banque | Octroi de crédit à la consommation | Classification binaire | Défaut de paiement à 12 mois : oui / non |
| 2 | Banque | Détection de fraude sur transaction carte | Classification binaire déséquilibrée | Transaction frauduleuse : oui / non |
| 3 | Banque | Estimation de la perte en cas de défaut | Régression | Montant non recouvré, en dollars |
| 4 | Santé | Aide au diagnostic sur imagerie | Classification multiclasse | Pathologie identifiée parmi k catégories |
| 5 | Santé | Anticipation des réadmissions | Classification binaire | Réadmission dans les 30 jours : oui / non |
| 6 | Immobilier | Estimation de valeur d'un bien | Régression | Prix de vente effectif, en dollars |
| 7 | Ressources humaines | Prévention du départ volontaire | Classification binaire | Démission dans les 6 mois : oui / non |
| 8 | Ressources humaines | Estimation de la durée de recrutement | Régression | Jours entre publication et signature |
| 9 | Industrie / IoT | Maintenance prédictive | Classification binaire | Panne dans les 7 jours : oui / non |
| 10 | Industrie / IoT | Durée de vie résiduelle d'un équipement | Régression | Heures de fonctionnement avant défaillance |
| 11 | Marketing | Prévision de l'attrition | Classification binaire | Résiliation dans les 90 jours : oui / non |
| 12 | Marketing | Valeur vie client | Régression | Marge cumulée attendue à 24 mois, en dollars |
| 13 | Transport | Estimation de durée de trajet | Régression | Durée effective, en minutes |
| 14 | Cybersécurité | Filtrage de courriels d'hameçonnage | Classification binaire | Courriel malveillant : oui / non |
| 15 | Énergie | Prévision de charge du réseau | Régression | Consommation à H+24, en mégawatts |
Lecture du tableau : dans les quinze cas, une donnée historique porte la réponse. Le crédit a été remboursé ou non, le bien a été vendu à un prix constaté, la pièce a rompu à une heure mesurée. C'est cette disponibilité rétrospective de la cible qui rend le problème supervisé, non l'intention de prédire. La qualification technique du cas 7 ne préjuge par ailleurs en rien de sa licéité : les obligations de non-discrimination sont traitées au chapitre 095.
Un élève prépare un examen à partir d'annales. Chaque annale comporte un énoncé et un corrigé. L'élève résout l'énoncé, compare sa production au corrigé, identifie l'écart, ajuste sa méthode. Après un nombre suffisant d'exercices, il affronte un sujet inédit dont le corrigé n'existe pas encore.
| Situation pédagogique | Apprentissage supervisé | Notation |
|---|---|---|
| L'énoncé de l'exercice | Les variables explicatives d'une observation | |
| Le corrigé de l'exercice | L'étiquette, valeur cible connue | |
| Le recueil d'annales | Le jeu d'entraînement | S |
| La méthode de résolution de l'élève | La fonction apprise | f |
| L'écart entre production et corrigé | La perte sur une observation | L(f(), ) |
| La révision de la méthode | La mise à jour des paramètres | optimisation |
| L'examen blanc | Le jeu de validation | — |
| L'examen final, sujet inédit | Le jeu de test, puis la production | — |
| La note obtenue à l'examen final | La performance en généralisation | R(f) |
Prolongements
L'élève qui mémorise les corrigés sans acquérir la méthode réussit les annales et échoue au sujet inédit : c'est le surapprentissage, traité au chapitre 040. L'élève qui dispose du corrigé pendant l'examen obtient une note excellente qui ne mesure rien : c'est la fuite de données, traitée au chapitre 028.
Limite de l'analogie
L'élève comprend ce qu'il fait et transpose à un domaine voisin. Le modèle n'établit qu'une correspondance statistique et ne transpose pas hors du domaine couvert par ses données d'entraînement.
Définition rigoureuse
Classe de problèmes dans lesquels on dispose d'un échantillon { , ..., }, ∈ X, sans variable cible associée. L'objectif est d'estimer une structure de la distribution P(X) : partition de l'espace des observations, sous-variété de faible dimension approchant le nuage de points, densité, ou régularités de co-occurrence. L'optimisation porte sur un critère défini exclusivement à partir des données, sans référence à une valeur attendue.
Traduction en langage courant
On fournit des observations sans aucune réponse associée et on demande à l'algorithme de faire apparaître l'organisation interne de ces données.
Le terme « non supervisé »
Il indique l'absence de réponse de référence, non l'absence d'intervention humaine : choix des variables, de la distance, du nombre de groupes et de la normalisation relèvent entièrement de l'analyste.
Point de vigilance
Un algorithme non supervisé produit toujours un résultat, y compris lorsque les données ne comportent aucune structure : un partitionnement en quatre groupes renverra quatre groupes sur un nuage parfaitement uniforme. La production d'un résultat n'atteste donc jamais l'existence d'une structure.
Définition rigoureuse
Problème consistant à construire une partition ou un recouvrement d'un ensemble d'observations en groupes tels qu'une mesure de similarité intra-groupe soit maximale et la similarité inter-groupes minimale, au sens d'une distance spécifiée par l'analyste. Une méthode de partitionnement par inertie minimise ainsi la somme des carrés des écarts internes :
argmin Σ Σ || x - μ_j ||²
C j=1..k x ∈ C_joù désigne le centre du groupe .
Traduction en langage courant
Regrouper les observations qui se ressemblent, sans savoir à l'avance quels groupes existent ni combien il y en a.
Paramètres à la charge de l'analyste
Nombre de groupes, mesure de distance, normalisation, sélection des variables. Chacun de ces choix modifie le résultat ; il n'existe pas de partition « vraie » qu'un algorithme découvrirait indépendamment d'eux.
Point de vigilance
Les groupes produits n'ont pas de nom. Leur dénomination et leur interprétation sont un acte métier postérieur à l'algorithme, jamais une sortie de celui-ci.
Définition rigoureuse
Problème consistant à construire une application g: X → Z, avec dim(Z) < dim(X), préservant au mieux une propriété de la distribution d'origine : variance expliquée pour l'analyse en composantes principales, structure de voisinage local pour les méthodes de plongement non linéaire, capacité de reconstruction pour les auto-encodeurs. Le critère optimisé est interne aux données.
Traduction en langage courant
Représenter les mêmes observations avec moins de variables, en perdant le moins d'information possible.
Finalités opérationnelles : visualisation, compression, débruitage, prétraitement d'un modèle supervisé, atténuation du fléau de la dimension.
Point de vigilance
Employée en amont d'un modèle supervisé, la réduction de dimension doit être ajustée sur les seules données d'entraînement puis appliquée telle quelle aux données de validation et de test. L'ajuster sur l'ensemble des données constitue une fuite de données, traitée au chapitre 028.
Une enseigne de distribution dispose de 12 000 clients actifs. Aucune variable cible n'existe : la direction ne demande pas de prédire un comportement, mais de comprendre la structure de sa base. Quatre variables sont retenues — fréquence d'achat annuelle, panier moyen, ancienneté, part des achats en ligne — et un partitionnement en quatre groupes est appliqué après normalisation.
Sortie brute de l'algorithme
| Groupe | Effectif | Part | Fréquence annuelle | Panier moyen | Ancienneté | Part en ligne |
|---|---|---|---|---|---|---|
| Groupe 1 | 4 320 | 36 % | 1,2 achat | 38 $ | 8 mois | 22 % |
| Groupe 2 | 3 600 | 30 % | 11,4 achats | 42 $ | 5,2 ans | 15 % |
| Groupe 3 | 2 880 | 24 % | 4,1 achats | 187 $ | 3,4 ans | 71 % |
| Groupe 4 | 1 200 | 10 % | 0,4 achat | 25 $ | 6,1 ans | 5 % |
Les identifiants numériques sont dépourvus de sens : « Groupe 1 » ne signifie rien et n'est pas ordonné par rapport à « Groupe 2 ».
Interprétation métier, postérieure à l'algorithme
| Groupe | Dénomination retenue par le métier | Lecture | Action envisagée |
|---|---|---|---|
| Groupe 1 | Nouveaux clients occasionnels | Ancienneté faible, engagement faible | Parcours d'activation sur les 6 premiers mois |
| Groupe 2 | Habitués de proximité | Fréquence élevée, panier faible, canal physique | Programme de fidélité, montée en panier |
| Groupe 3 | Acheteurs à fort panier en ligne | Panier quatre fois supérieur, canal numérique | Offre premium, service de livraison dédié |
| Groupe 4 | Clients dormants | Ancienneté élevée, activité quasi nulle | Campagne de réactivation ou sortie du fichier actif |
Point déterminant : la deuxième colonne n'a pas été produite par l'algorithme. Elle a été formulée par des responsables métier examinant les caractéristiques statistiques de chaque groupe. Un algorithme de clustering délimite des groupes ; il ne les nomme pas et ne les explique pas.
C'est la différence structurelle la plus importante avec l'apprentissage supervisé. Chaque prédiction supervisée peut être confrontée à la valeur observée : l'exactitude est mesurable. En non supervisé, il n'existe aucune partition de référence, et la question « cette segmentation est-elle exacte ? » est mal posée. L'évaluation repose alors sur deux ordres de critères.
| Ordre de critère | Nature | Exemples | Limite |
|---|---|---|---|
| Critères internes | Statistique, calculé sur les données seules | Coefficient de silhouette, inertie intra-classe, indices de Davies-Bouldin et de Calinski-Harabasz | Un score élevé n'atteste pas la pertinence métier |
| Critères d'utilité métier | Opérationnel, évalué par les responsables du domaine | Groupes interprétables, actionnables, de taille exploitable, stables dans le temps | Subjectivité, dépendance à l'expertise disponible |
Point de vigilance : une segmentation au coefficient de silhouette excellent mais dont les groupes n'appellent aucune action est un échec opérationnel ; une partition au score interne médiocre dont les groupes appellent des actions différenciées et mesurables est un succès. Le critère final est l'utilité.
Conséquence sur la conduite de projet : un projet non supervisé ne peut être piloté par un seuil contractuel du type « au moins 90 % d'exactitude », mais par une revue d'interprétabilité associant le métier.
| Domaine | Application | Sous-famille | Sortie exploitée |
|---|---|---|---|
| Distribution | Segmentation de la base client | Clustering | Groupes homogènes pour ciblage différencié |
| Commerce | Analyse du panier d'achat | Règles d'association | Produits fréquemment co-achetés |
| Assurance | Typologie de profils de sinistralité | Clustering | Groupes servant de base à une tarification |
| Bio-informatique | Regroupement de profils d'expression génique | Clustering | Sous-types moléculaires candidats |
| Industrie | Compression de signaux de capteurs | Réduction de dimension | Représentation compacte pour surveillance |
| Documentation | Regroupement thématique de corpus | Clustering | Familles de documents sans nomenclature préalable |
| Cybersécurité | Détection de comportements atypiques | Détection d'anomalies | Alertes à qualifier par un analyste |
| Marketing | Réduction d'un questionnaire à ses axes principaux | Réduction de dimension | Facteurs synthétiques d'attitude |
Observation professionnelle : l'apprentissage non supervisé intervient plus souvent en amont d'un projet supervisé, au titre de l'exploration, qu'en production autonome. Une segmentation peut d'ailleurs devenir une variable explicative d'un modèle supervisé ultérieur.
Définition rigoureuse
Cadre d'apprentissage dans lequel un agent interagit séquentiellement avec un environnement. À chaque pas de temps t, l'agent observe un état , choisit une action selon une politique π, reçoit une récompense scalaire et observe un nouvel état . Le problème est le plus souvent formalisé comme un processus de décision markovien (S, A, P, R, γ), avec γ ∈ [0, 1[ le facteur d'actualisation. L'objectif est de déterminer une politique π maximisant l'espérance du gain cumulé actualisé :
J(\pi) = \mathbb{E}\left[ \sum_{t \ge 0} \gamma^{t} \, $$r_{t+1}$$ \right]Référence de synthèse : Sutton et Barto, Reinforcement Learning: An Introduction (1998, seconde édition 2018).
Traduction en langage courant
L'agent n'apprend pas à partir de bonnes réponses fournies à l'avance mais par essais successifs : il agit, l'environnement le sanctionne ou le récompense, et il ajuste sa stratégie de façon à accumuler le plus de récompense possible.
Ce qui distingue la récompense d'une étiquette
L'étiquette indique la bonne réponse, préexiste à l'entraînement et concerne une observation isolée. La récompense évalue la réponse produite, est engendrée pendant l'interaction, porte sur une séquence d'actions et dépend des actions du modèle lui-même.
Point de vigilance
Le caractère différé de la récompense engendre le problème d'attribution du mérite : lorsqu'une récompense survient au terme de centaines d'actions, déterminer lesquelles y ont contribué constitue la difficulté centrale du paradigme.
Le cycle se répète jusqu'à un état terminal ou indéfiniment. La particularité structurelle du paradigme apparaît ici : les données d'apprentissage sont produites par l'agent lui-même. Une politique médiocre engendre des trajectoires médiocres, dont l'agent doit néanmoins apprendre. De là l'arbitrage entre exploration et exploitation : une politique qui n'exploite jamais n'accumule aucune récompense, une politique qui n'explore jamais se fige sur un optimum local. Cet arbitrage n'a pas d'équivalent en apprentissage supervisé, où le jeu de données est fixe.
| Terme français | Terme anglais | Notation | Définition | Exemple : robot de manutention |
|---|---|---|---|---|
| Agent | Agent | — | Entité qui décide et agit | Le contrôleur du robot |
| Environnement | Environment | — | Système avec lequel l'agent interagit, produisant transitions et récompenses | L'entrepôt, ses rayonnages, ses obstacles |
| État | State | Description de la situation à l'instant t, suffisante pour décider | Position, charge portée, niveau de batterie | |
| Action | Action | Décision prise parmi celles disponibles | Avancer, tourner, saisir, déposer | |
| Récompense | Reward | Scalaire émis par l'environnement évaluant la transition | +10 colis déposé, -1 par seconde, -100 collision | |
| Politique | Policy | π(a|s) | Règle associant à chaque état une action ou une distribution sur les actions | La stratégie de navigation apprise |
| Domaine | Application | Nature de la récompense | Maturité |
|---|---|---|---|
| Jeux | Go, échecs, jeux vidéo | Victoire, score | Démontrée, références académiques majeures |
| Robotique | Locomotion, préhension, navigation | Progression vers l'objectif, pénalité de collision | Opérationnelle en environnement contrôlé |
| Centres de données | Régulation du refroidissement | Économie d'énergie sous contrainte de température | Déploiements industriels documentés |
| Finance | Exécution d'ordres, allocation dynamique | Rendement ajusté du risque | Usage réel, fortement encadré |
| Publicité | Allocation d'affichage, bandits contextuels | Clic, conversion | Très répandue sous forme de bandits |
| Logistique | Ordonnancement, gestion de stock | Coût total, taux de service | Émergente, généralement en simulation |
Cas particulier des bandits manchots : forme simplifiée d'apprentissage par renforcement sans transition d'état, massivement déployée pour l'allocation de contenus et les tests adaptatifs, et principale exposition réelle des organisations à ce paradigme.
Apprendre à faire du vélo ne procède pas d'un corrigé : personne ne peut fournir, pour chaque milliseconde, la valeur exacte de l'angle du guidon et de l'inclinaison du buste. La consigne « garde l'équilibre » n'est pas une étiquette. Le signal disponible est une conséquence : l'apprenti tient debout, ou il tombe. Le lien entre le geste fautif et sa conséquence est différé de quelques secondes.
| Élément de la situation | Correspondance formelle |
|---|---|
| L'apprenti cycliste | L'agent |
| Le vélo, la route, la gravité | L'environnement |
| Inclinaison, vitesse, position du guidon | L'état |
| Corriger la trajectoire, pédaler, freiner | L'action |
| Mètres parcourus sans chute, chute | La récompense |
| Les réflexes acquis | La politique π |
| Essayer une trajectoire inhabituelle | L'exploration |
| Reproduire ce qui a fonctionné | L'exploitation |
Ce que l'analogie met en évidence
La compétence est acquise par interaction et non par mémorisation de couples question-réponse : elle ne peut pas être transmise par un exposé, et son acquisition exige un grand nombre d'essais, y compris infructueux. Un enfant tombe quelques dizaines de fois ; un agent artificiel requiert couramment des millions d'épisodes. Lorsque chaque épisode a un coût matériel ou humain, l'entraînement en conditions réelles devient impraticable — d'où l'exigence d'un simulateur.
L'apprentissage par renforcement occupe une place considérable dans la communication publique du domaine et une place marginale dans les portefeuilles de projets. Quatre obstacles expliquent cet écart.
| Obstacle | Énoncé | Conséquence pratique | Situations où l'obstacle est levé |
|---|---|---|---|
| 1. Environnement simulable requis | L'apprentissage exige des interactions massives, inacceptables sur le système réel | Il faut un simulateur fidèle, dont la construction est un projet à part entière | Jeux, systèmes physiques bien modélisés, files d'attente, environnements numériques |
| 2. Coût computationnel | Le nombre d'épisodes dépasse de plusieurs ordres de grandeur le volume d'un entraînement supervisé | Budget de calcul élevé, délais longs, itérations lentes | Problèmes de faible dimension, bandits, simulations peu coûteuses |
| 3. Spécification de la récompense | Traduire un objectif métier en un scalaire est risqué : l'agent optimise exactement ce qui est écrit | Comportements dégénérés maximisant la mesure sans servir l'intention | Objectifs à mesure directe et non contournable |
| 4. Contrôlabilité en production | La politique explore, évolue et prend des décisions séquentielles difficiles à auditer | Difficulté d'homologation, de traçabilité et de garantie de comportement | Domaines à faible criticité, ou dispositifs bornés par des règles de sécurité externes |
Développement de l'obstacle 3 : les comportements dégénérés
Une fonction de récompense mal spécifiée conduit l'agent à maximiser la mesure plutôt que l'objectif qu'elle représente. La littérature désigne ce phénomène par le terme de reward hacking.
| Objectif visé | Récompense écrite | Comportement dégénéré possible |
|---|---|---|
| Nettoyer une pièce | Quantité de poussière collectée | Répandre la poussière pour la collecter à nouveau |
| Terminer une course | Points accumulés sur le parcours | Tourner en boucle sur une zone à points sans franchir la ligne |
| Maximiser l'engagement | Durée de session | Favoriser les contenus polarisants au détriment de la satisfaction |
| Réduire le délai de traitement | Dossiers clos par heure | Clore les dossiers difficiles sans les résoudre |
| Éviter les collisions | Pénalité en cas de contact | Rester immobile |
L'agent n'optimise pas l'intention du concepteur, il optimise la fonction de récompense ; tout écart entre les deux sera exploité. Ce constat rejoint la loi de Goodhart : lorsqu'une mesure devient un objectif, elle cesse d'être une bonne mesure.
Point de vigilance sur l'obstacle 4 : un modèle supervisé produit une prédiction ponctuelle qu'un processus métier peut filtrer avant action ; un agent de renforcement produit une politique d'action. Le point de contrôle humain doit donc être conçu explicitement, sous forme de contraintes de sécurité externes à l'apprentissage.
La disponibilité du signal admet des états intermédiaires : étiquettes partielles, étiquettes fabriquées, étiquettes présentes mais très rares. Trois configurations en découlent.
Définition rigoureuse
Classe de problèmes dans lesquels l'échantillon réunit un sous-ensemble étiqueté = { (, ) } de taille l et un sous-ensemble non étiqueté = { } de taille u, avec généralement u >> l. Les méthodes exploitent la distribution marginale P(X) estimée sur pour contraindre l'estimation de P(Y | X) apprise sur , sous des hypothèses de régularité : continuité, groupement, variété.
Traduction en langage courant
On dispose de beaucoup d'observations et de peu de réponses connues ; la masse non étiquetée sert à mieux tirer parti du petit nombre d'étiquettes disponibles.
Point de vigilance
Les hypothèses de régularité ne sont pas toujours satisfaites. Lorsqu'elles ne le sont pas, l'ajout de données non étiquetées peut dégrader la performance par rapport à un modèle entraîné sur les seules données étiquetées.
Cas d'école : l'imagerie médicale
Un centre hospitalier dispose de 200 000 clichés archivés, dont 2 000 seulement sont annotés : l'annotation mobilise un radiologue plusieurs minutes par cliché, et l'annotation intégrale représenterait plusieurs années-homme. L'approche supervisée stricte écarte 99 % de l'information disponible ; l'approche semi-supervisée apprend la structure de l'espace des images sur les 198 000 clichés bruts et ajuste la règle de décision sur les 2 000 clichés annotés.
Définition rigoureuse
Classe de méthodes dans lesquelles la variable cible est construite automatiquement à partir de la structure interne des données, sans intervention d'un annotateur. Une tâche dite prétexte est définie de sorte que son étiquette soit déductible de la donnée brute ; le modèle est entraîné sur cette tâche par minimisation d'un risque empirique classique, puis la représentation obtenue est réutilisée pour la tâche cible.
Traduction en langage courant
L'algorithme fabrique lui-même ses exercices et leurs corrigés à partir des données brutes, ce qui supprime le coût d'annotation.
Précision déterminante
La mécanique d'apprentissage demeure strictement supervisée : il existe une valeur cible, une fonction de perte, une comparaison entre prédiction et cible. Seule la provenance de l'étiquette change — extraite des données au lieu d'être fournie par un opérateur. L'auto-supervisé n'est donc pas un quatrième paradigme, mais une modalité d'obtention des étiquettes.
Point de vigilance
La qualité de la représentation dépend entièrement de la pertinence de la tâche prétexte. Une tâche résoluble par un artefact superficiel produit une représentation sans valeur pour la tâche cible.
Cas d'école : le masquage de mots
À partir d'un corpus de texte brut, non annoté, des exemples d'entraînement sont construits en masquant des mots et en demandant au modèle de les restituer.
| Étape | Contenu |
|---|---|
| Donnée brute | « Le taux directeur a été relevé de vingt-cinq points de base. » |
| Exemple fabriqué (entrée) | « Le taux directeur a été [MASQUE] de vingt-cinq points de base. » |
| Étiquette fabriquée (cible) | « relevé » |
| Coût d'annotation | Nul : l'étiquette est le mot retiré |
Ce mécanisme, popularisé par les architectures de type BERT (Devlin et al., 2018) puis généralisé par les modèles de langue autorégressifs, permet d'exploiter des corpus de très grande taille sans annotation humaine. La représentation obtenue est ensuite spécialisée sur une tâche supervisée disposant de peu d'étiquettes.
Définition rigoureuse
Problème consistant à identifier les observations dont la génération est improbable au regard de la distribution des observations dites normales. Selon la disponibilité d'exemples d'anomalies étiquetés, il se formule comme une classification supervisée fortement déséquilibrée, comme une estimation de densité ou de support non supervisée, ou comme une classification à une classe.
Traduction en langage courant
Repérer ce qui sort de l'ordinaire, que l'on dispose ou non d'exemples de cas anormaux.
Position taxonomique
La détection d'anomalies est à cheval sur deux paradigmes. Elle ne constitue pas une famille supplémentaire : elle désigne une finalité métier traitable dans l'un ou l'autre paradigme selon les données disponibles.
| Configuration des données | Paradigme applicable | Méthodes usuelles | Évaluation |
|---|---|---|---|
| Historique d'anomalies confirmées et étiquetées, en très faible proportion | Supervisé, en régime de fort déséquilibre | Gradient boosting, forêts aléatoires avec rééchantillonnage ou pondération | Rappel, précision, aire sous la courbe précision-rappel |
| Aucune anomalie étiquetée, ou anomalies futures distinctes des anomalies passées | Non supervisé | Isolation Forest, estimation de densité, SVM à une classe, auto-encodeur | Critères internes, taux d'alerte, qualification par un expert |
| Quelques anomalies étiquetées et une masse d'observations non qualifiées | Semi-supervisé | Modélisation de la normalité, puis calibrage du seuil sur les cas étiquetés | Précision sur les cas confirmés, coût des faux positifs |
Critère de choix pratique
Si les anomalies à détecter ressemblent à celles déjà observées et étiquetées, le problème est supervisé. Si les anomalies à détecter sont inconnues par nature, le problème est non supervisé.
En détection de fraude bancaire, les schémas connus se traitent en supervisé, avec les techniques de gestion du déséquilibre traitées au chapitre 050 ; les schémas nouveaux échappent par construction à un modèle entraîné sur le passé et relèvent d'une approche non supervisée. Les dispositifs en production combinent fréquemment les deux.
Lecture de la branche « Cadrage à reprendre » : l'absence d'étiquettes ne disqualifie pas le projet, elle en déplace la première étape. La question devient « comment constituer un jeu étiqueté » — annotation, collecte prospective, exploitation d'un enregistrement système — ou « quel objectif non supervisé assumer ».
| Critère | Supervisé | Non supervisé | Renforcement |
|---|---|---|---|
| Étiquettes | Requises pour chaque observation d'entraînement | Aucune | Aucune ; remplacées par un signal de récompense |
| Question posée | « Quelle est la valeur de Y pour cette observation ? » | « Quelle organisation structure ces observations ? » | « Quelle suite d'actions maximise le gain cumulé ? » |
| Analogie | L'apprentissage avec corrigé | Le tri d'objets sans nomenclature préalable | L'acquisition d'une compétence motrice |
| Mesure d'exactitude | Directe : comparaison entre prédiction et valeur observée | Impossible au sens strict : aucune vérité de référence | Indirecte : récompense cumulée sur des épisodes |
| Sous-types | Classification, régression | Clustering, réduction de dimension, règles d'association | Méthodes fondées sur la valeur, sur la politique, bandits |
| Algorithmes typiques | Régression linéaire et logistique, arbres, forêts aléatoires, gradient boosting, SVM, réseaux de neurones | k-means, classification hiérarchique, DBSCAN, ACP, UMAP, auto-encodeurs | Q-learning, SARSA, gradients de politique, acteur-critique |
| Fréquence en entreprise | Prépondérante : la grande majorité des modèles en production | Significative, principalement en exploration et en préparation | Marginale hors R&D, à l'exception notable des bandits |
| Exemple | Prédire la résiliation d'un client à 90 jours | Segmenter la base client en groupes homogènes | Optimiser une politique de gestion de stock en simulation |
| Couverture par ce cours | Objet central, du chapitre 004 jusqu'au terme | Positionné ici, non approfondi | Positionné ici, non approfondi |
Les deux procédures produisent des groupes ; la ressemblance s'arrête là. La confusion entre les deux est l'une des plus fréquentes en entretien.
| Point de comparaison | Classification | Clustering |
|---|---|---|
| Paradigme | Supervisé | Non supervisé |
| Les groupes existent-ils avant l'analyse ? | Oui, ils font partie de la spécification | Non, ils résultent du calcul |
| Nombre de groupes | Fixé par le problème métier | Choisi par l'analyste, souvent par exploration |
| Les groupes ont-ils un nom ? | Oui, un sens métier défini a priori | Non, des identifiants arbitraires à interpréter |
| Données requises | Observations étiquetées | Observations seules |
| Question posée | « Cette observation appartient-elle à la classe A ou B ? » | « Quels groupes émergent de ces observations ? » |
| Évaluation | Exactitude, rappel, précision, F1, AUC | Silhouette, inertie, utilité métier |
| Stabilité du sens | Stable : les classes ne changent pas | Instable : une autre initialisation ou un autre k modifie les groupes |
| Exemple | Affecter un courriel à « spam » ou « légitime » | Découvrir quatre profils dans une base client |
| Formulation métier déclenchante | « Nous savons ce que nous cherchons » | « Nous voulons savoir ce qu'il y a » |
Test de discrimination en une question : la liste des groupes figure-t-elle dans le cahier des charges ? Si oui, il s'agit de classification ; sinon, de clustering.
Un service marketing demande un modèle prédisant « les clients à fort potentiel ». Aucune variable de ce nom n'existe dans le système d'information : l'intention de prédire ne suffit pas à créer un problème supervisé. Deux issues sont possibles, et une seule doit être choisie explicitement : définir une cible mesurable et vérifiable dans l'historique — par exemple « chiffre d'affaires des 12 mois suivants supérieur à 5 000 $ » — ou assumer une démarche exploratoire non supervisée produisant des groupes à interpréter.
Formulation correcte : « Un problème supervisé requiert une variable cible définie, mesurable et présente dans l'historique. Tant qu'elle n'est pas constituée, il n'y a pas de problème supervisé. »
Les deux produisent des groupes, ce qui suffit à entretenir la confusion. Le critère discriminant n'est pas la sortie mais l'entrée : les classes préexistent-elles dans les données d'entraînement ? Une conséquence est régulièrement observée : un clustering présenté comme un modèle prédictif, assorti d'une prétendue mesure d'exactitude, laquelle est sans objet en l'absence de partition de référence.
Formulation correcte : « La classification affecte une observation à des classes définies au préalable et apprises sur des exemples étiquetés ; le clustering constitue des groupes à partir des seules similarités, sans classes préexistantes ni exactitude mesurable. »
L'absence d'étiquettes allège la collecte et donne l'impression d'un problème moins exigeant. C'est l'inverse sur le plan de la validation : sans vérité de référence, le projet est privé de critère objectif d'arrêt, et le nombre de groupes, la distance et la normalisation relèvent de choix qu'aucune métrique ne tranche. Un projet supervisé se conclut par une performance chiffrée sur un jeu de test ; un projet non supervisé, par une décision d'acceptation métier.
Formulation correcte : « L'apprentissage non supervisé est moins exigeant en données étiquetées et plus exigeant en interprétation : sa difficulté est déplacée de la collecte vers la validation. »
L'énumération « supervisé, non supervisé, renforcement, Deep Learning » mélange deux plans de classement. Les trois premiers termes désignent des paradigmes, définis par la nature du signal d'apprentissage ; le quatrième désigne une classe de modèles, définie par une architecture. Un réseau de neurones entraîné sur des images étiquetées relève du supervisé, un auto-encodeur du non supervisé, un réseau optimisant une politique par récompense du renforcement.
Formulation correcte : « Le Deep Learning est une classe de modèles mobilisable dans les trois paradigmes ; il se situe sur un autre plan de classement. »
Pour prédire l'attrition à 90 jours, une équipe retient comme variable explicative le nombre d'appels au service de résiliation. La performance est excellente en validation et nulle en production : au moment où la prédiction doit être produite, cet appel n'a pas encore eu lieu. La variable n'est pas prédictive, elle est constitutive de l'événement à prédire. Cette forme de fuite de données, traitée au chapitre 028, n'est pas détectable par les métriques : elle les améliore.
Règle de contrôle : pour chaque variable explicative, vérifier que sa valeur serait effectivement disponible à l'instant où le modèle sera interrogé en production.
Formulation correcte : « L'étiquette est postérieure aux variables explicatives ; toute information contemporaine ou postérieure à la réalisation de la cible doit être exclue du jeu d'entraînement. »
« La santé, c'est du supervisé » ou « le marketing, c'est du clustering » sont des énoncés sans fondement. La santé donne lieu à la prédiction d'une réadmission (supervisé), à l'identification de sous-groupes de patients (non supervisé) et à l'adaptation séquentielle d'un protocole de dosage (renforcement). Le marketing donne lieu à la prédiction d'une résiliation, à une segmentation et à l'allocation dynamique d'offres par bandits.
Formulation correcte : « Le paradigme se détermine par la nature du signal d'apprentissage disponible, jamais par le secteur d'activité. »
LE CRITÈRE UNIQUE
« Dispose-t-on, pour les observations passées,
de la valeur que l'on cherche à prédire ? »
Oui ..................................... SUPERVISÉ
Non ..................................... NON SUPERVISÉ
Non, mais une évaluation différée
des actions est disponible .............. RENFORCEMENT
SOUS-FAMILLES
Supervisé : classification (cible catégorielle)
régression (cible numérique)
Non supervisé : clustering, réduction de dimension,
règles d'association
Renforcement : méthodes fondées sur la valeur ou sur la politique
CONFIGURATIONS INTERMÉDIAIRES
Semi-supervisé : une fraction seulement des observations est étiquetée
Auto-supervisé : étiquettes fabriquées à partir des données ;
la mécanique reste supervisée
Anomalies : supervisé si les anomalies passées sont étiquetées,
non supervisé si elles sont inconnues par nature
CE QUI N'EST PAS UN CRITÈRE DE CLASSEMENT
le domaine, le type de données, le volume,
l'architecture du modèle, la finalité affichée
DISTINCTION À NE JAMAIS PERDRE
Classification : les groupes existent avant l'analyse
Clustering : les groupes résultent de l'analyse
CE QUE MESURE CHAQUE PARADIGME
Supervisé : une exactitude, par comparaison à la valeur observée
Non supervisé : une cohésion interne et une utilité métier
Renforcement : une récompense cumulée sur des épisodes
POSITION DU DEEP LEARNING
Classe de modèles mobilisable dans les trois paradigmes.
Ce n'est pas un quatrième paradigme.Énoncé de synthèse
Les paradigmes d'apprentissage se distinguent par la nature du signal disponible et par rien d'autre : une valeur cible connue observation par observation définit l'apprentissage supervisé, la seule structure interne des données définit l'apprentissage non supervisé, une récompense différée émise par un environnement définit l'apprentissage par renforcement ; le domaine, le volume et l'architecture du modèle sont sans effet sur ce classement.
Quiz associés :
003.1-quiz-critere-classement.md,
003.2-quiz-apprentissage-supervise.md,
003.3-quiz-apprentissage-non-supervise.md,
003.4-quiz-apprentissage-renforcement.md,
003.5-quiz-paradigmes-intermediaires.md,
003.6-quiz-qualification-probleme.md
Chapitre suivant : 004-apprentissage-supervise.md