Les termes suivants sont utilisés dans la presse et sur les réseaux comme s'ils étaient interchangeables. Ils ne le sont pas.
Intelligence artificielle · Machine Learning · Deep Learning
Data Science · Big Data · Algorithme · Réseau de neuronesTant que la taxonomie n'est pas claire, le reste du domaine reste confus. Ce chapitre la fixe définitivement.
Relation d'inclusion stricte :
Deep Learning ⊂ Machine Learning ⊂ Intelligence Artificielle
Toute technique de Deep Learning est du Machine Learning. Toute technique de Machine Learning relève de l'Intelligence Artificielle. Les réciproques sont fausses.
Définition rigoureuse
Champ de l'informatique visant à concevoir des systèmes capables d'accomplir des tâches qui, réalisées par un être humain, seraient qualifiées de cognitives : perception, raisonnement, apprentissage, planification, décision, compréhension du langage.
Définition opérationnelle
Un système d'IA est un système qui, à partir d'entrées issues de son environnement, produit des sorties (prédictions, recommandations, décisions, actions) influant sur cet environnement, selon des objectifs explicites ou implicites définis par un humain.
Cette seconde formulation est proche de la définition retenue par l'OCDE et reprise dans plusieurs cadres réglementaires. Elle est utile en contexte professionnel car elle est vérifiable.
Traduction en langage courant
Faire exécuter par une machine une tâche qui, chez un humain, exigerait de réfléchir.
Nature du concept
L'IA est un objectif, pas une technique. Elle regroupe des approches hétérogènes, dont certaines n'impliquent aucun apprentissage.
Point de datation
Le terme est forgé en 1956 lors de la conférence de Dartmouth. Le domaine est donc antérieur de plusieurs décennies au Machine Learning appliqué moderne.
C'est le contresens le plus fréquent.
| Technique | Principe | Apprentissage |
|---|---|---|
| Système à base de règles | Un expert humain formalise les règles | Non |
| Recherche arborescente | Exploration exhaustive ou heuristique de l'espace des états | Non |
| Logique formelle | Inférence à partir d'axiomes et de règles de déduction | Non |
| Optimisation combinatoire | Recherche d'un optimum sous contraintes | Non |
| Machine Learning | Induction de règles à partir d'observations | Oui |
Exemple d'IA sans apprentissage — un thermostat programmable
Le système décide. Aucune règle n'a été induite à partir de données : elles ont été écrites par un ingénieur. Le comportement sera identique dans dix ans.
Exemple d'IA sans apprentissage — Deep Blue (1997)
Le système qui a battu Garry Kasparov évaluait environ 200 millions de positions par seconde à l'aide d'une fonction d'évaluation conçue par des humains et des grands maîtres. Il n'apprenait pas de ses parties. Il cherchait dans un espace d'états.
Définition rigoureuse (Tom Mitchell, 1997)
Un programme informatique apprend d'une expérience E, relativement à une classe de tâches T et une mesure de performance P, si sa performance sur les tâches de T, mesurée par P, s'améliore avec l'expérience E.
Cette définition est la référence académique. Elle a le mérite d'être opératoire : elle impose de nommer explicitement les trois composantes.
Application de la définition à un cas concret
Détection de spam :
Définition alternative (Arthur Samuel, 1959)
Champ d'étude donnant aux ordinateurs la capacité d'apprendre sans avoir été explicitement programmés pour la tâche considérée.
Traduction en langage courant
Au lieu d'écrire les règles, on fournit un grand nombre d'exemples et l'algorithme induit les règles lui-même.
Nature du concept
Le Machine Learning est une approche au sein de l'IA. Le concept central est l'induction : passer de cas particuliers observés à une règle générale.
| Entrées fournies | Sortie produite | |
|---|---|---|
| Programmation classique | Règles + Données | Réponses |
| Machine Learning | Données + Réponses | Règles |
Ce renversement est développé au chapitre 002.
Tâche : déterminer si une image contient un chat.
Tentative de formalisation par règles :
SI oreilles triangulaires ET moustaches ET fourrure ALORS chatContre-exemples immédiats :
| Contre-exemple | Défaillance de la règle |
|---|---|
| Un renard | Satisfait les trois conditions, n'est pas un chat |
| Un chat de dos | Moustaches non visibles |
| Un chat sphynx | Absence de fourrure |
| Un chat en boule | Aucune structure identifiable |
| Un chaton | Proportions différentes |
Le nombre de règles nécessaires diverge sans jamais atteindre une couverture satisfaisante. La tâche relève de la perception, dont les critères ne sont pas verbalisables par les humains eux-mêmes.
Formulation en Machine Learning
Aucun adulte ne transmet à un enfant de trois ans la définition suivante :
« Un chat est un mammifère quadrupède de la famille des félidés, caractérisé par des oreilles triangulaires érigées, des vibrisses faciales et des pupilles à fente verticale. »
L'enfant est exposé à des centaines d'occurrences accompagnées d'une étiquette verbale : « regarde, un chat ». Il finit par étiqueter correctement un individu qu'il n'a jamais vu.
La règle n'a pas été transmise. Elle a été induite à partir d'exemples étiquetés. C'est exactement la structure de l'apprentissage supervisé.
| Condition | Justification | Illustration |
|---|---|---|
| La règle n'est pas formalisable | Les critères ne sont pas verbalisables | Reconnaissance faciale |
| Le nombre de facteurs et d'interactions est élevé | L'écriture manuelle diverge | Scoring de risque client |
| L'environnement évolue | Les règles se périment | Détection de fraude, spam |
| La personnalisation doit être massive | Une règle par individu est impossible | Recommandation à grande échelle |
| Une réponse approchée est acceptable | Le modèle produit une estimation, jamais une certitude | Estimation immobilière |
| Un volume suffisant de données étiquetées existe | L'induction requiert des observations | Historique de transactions |
| Situation | Raison | Alternative |
|---|---|---|
| La règle exacte est connue et stable | Le modèle introduirait une approximation inutile | Implémenter la formule |
| L'exactitude est une obligation légale | Une approximation est juridiquement irrecevable | Règle explicite auditée |
| Le volume de données est insuffisant | L'induction n'est pas fondée statistiquement | Expertise métier, collecte préalable |
| L'erreur est catastrophique et non rattrapable | Aucun modèle n'atteint 100 % | Supervision humaine obligatoire |
| Aucune donnée historique n'existe | Rien à induire | Étude de marché, prototypage |
Principe directeur : le Machine Learning est un outil d'approximation statistique. Il ne doit être mobilisé que lorsque l'approximation est acceptable et que la formalisation directe est impraticable.
Définition rigoureuse
Sous-ensemble du Machine Learning fondé sur des réseaux de neurones artificiels comportant plusieurs couches de transformation non linéaires successives, chaque couche produisant une représentation des données à un niveau d'abstraction croissant, ces représentations étant apprises et non spécifiées manuellement.
Le point discriminant
Ce qui caractérise le Deep Learning n'est pas la profondeur en soi, mais l'apprentissage automatique des représentations (representation learning). En Machine Learning classique, l'ingénieur conçoit les variables explicatives. En Deep Learning, le réseau construit lui-même une hiérarchie de représentations intermédiaires.
Origine du terme « profond »
Le qualificatif renvoie au nombre de couches empilées entre l'entrée et la sortie, c'est-à-dire à la profondeur du graphe de calcul. Il ne comporte aucune connotation qualitative.
Traduction en langage courant
Un réseau à nombreux étages qui construit lui-même, étage par étage, les caractéristiques pertinentes des données.
Point essentiel : aucune de ces couches n'a été spécifiée manuellement. L'assignation « couche 1 = contours » est une interprétation a posteriori de ce que le réseau a appris. C'est précisément cette propriété qui rend le Deep Learning puissant et difficilement interprétable.
| Critère | ML classique | Deep Learning |
|---|---|---|
| Volume de données requis | 10² à 10⁵ observations | 10⁴ à 10⁷ et au-delà |
| Ressources de calcul | CPU standard | GPU ou accélérateurs dédiés |
| Type de données de prédilection | Données tabulaires structurées | Données non structurées : image, son, texte, vidéo |
| Ingénierie des variables | À la charge de l'ingénieur | Apprise par le réseau |
| Interprétabilité | Élevée à moyenne | Faible sans outillage dédié |
| Délai de mise en oeuvre | Minutes à heures | Heures à semaines |
| Algorithmes représentatifs | Régression, arbres, forêts aléatoires, gradient boosting | CNN, RNN, Transformers |
Constat établi par la pratique industrielle et la littérature comparative : sur données tabulaires, les méthodes d'ensemble à base d'arbres (gradient boosting, forêts aléatoires) demeurent très compétitives face aux architectures profondes, tout en offrant des temps d'entraînement inférieurs de plusieurs ordres de grandeur et une interprétabilité supérieure.
Le Deep Learning conserve un avantage décisif sur les données non structurées : vision par ordinateur, traitement du signal audio, traitement automatique du langage naturel, vidéo.
Ce cours porte sur le Machine Learning supervisé appliqué à des données tabulaires, qui constitue la majorité des cas d'usage en entreprise.
Un marteau et une pelle mécanique sont tous deux des outils valides. Le choix ne dépend pas de la puissance intrinsèque de l'outil mais de l'adéquation à la tâche.
Planter un clou avec une pelle mécanique est techniquement possible et opérationnellement absurde : coût de mobilisation disproportionné, précision insuffisante, dommages collatéraux.
Raser un immeuble avec un marteau est impossible quel que soit l'effort.
La compétence professionnelle ne consiste pas à maîtriser l'outil le plus puissant, mais à sélectionner l'outil adapté au problème posé.
Définition rigoureuse
Discipline interdisciplinaire combinant statistique, informatique et connaissance du domaine applicatif, ayant pour objet l'extraction de connaissances et d'aide à la décision à partir de données, sur l'ensemble de la chaîne : acquisition, préparation, exploration, modélisation, validation, communication.
Périmètre
La Data Science englobe le Machine Learning comme l'une de ses composantes, aux côtés de la préparation des données, de l'analyse exploratoire, de l'inférence statistique et de la restitution aux décideurs.
Répartition empirique de l'effort
Les enquêtes professionnelles situent généralement entre 50 % et 80 % du temps d'un praticien sur l'acquisition, le nettoyage et la préparation des données. La modélisation proprement dite représente une fraction minoritaire de l'activité.
Définition rigoureuse
Ensemble des méthodes visant à décrire, résumer et interpréter un ensemble de données afin de caractériser des phénomènes observés.
Distinction centrale
L'analyse de données porte principalement sur l'explication du passé et la caractérisation du présent. La modélisation prédictive porte sur l'estimation de valeurs non observées, généralement futures.
Définition rigoureuse
Ensemble de données dont le volume, la vélocité ou la variété excèdent les capacités de traitement des systèmes de gestion de données conventionnels, imposant des architectures distribuées.
Les dimensions caractéristiques
Le modèle classique retient trois dimensions, souvent étendues :
Point de vigilance
Big Data et Machine Learning sont des notions orthogonales. Le Big Data qualifie une échelle et une architecture, non une finalité analytique. On peut exploiter du Big Data sans aucun modèle prédictif, et construire des modèles performants sur quelques milliers d'observations.
Illustration sur un cas unique : un opérateur télécom constate une érosion de sa base client.
| Niveau | Question | Livrable | Outillage |
|---|---|---|---|
| Descriptif | Que s'est-il passé ? | « Le taux d'attrition trimestriel s'établit à 8,2 % » | Requêtage, tableaux de bord |
| Diagnostic | Pourquoi ? | « L'attrition est concentrée sur les forfaits mensuels avec plus de deux contacts au support » | Segmentation, tests statistiques |
| Prédictif | Que va-t-il se passer ? | « 1 240 clients présentent une probabilité de résiliation supérieure à 0,70 à 30 jours » | Apprentissage supervisé |
| Prescriptif | Que faire ? | « Cibler 300 clients avec une remise de 15 % ; gain net attendu 84 000 $ » | Optimisation sous contrainte |
L'apprentissage supervisé, objet de ce cours, opère au niveau prédictif.
Point de vigilance récurrent : le Deep Learning ne constitue pas une quatrième famille aux côtés du supervisé, du non supervisé et du renforcement. Il s'agit d'une classe de modèles mobilisable dans les trois paradigmes.
| Terme | Traduction | Nature du concept | Définition condensée | Illustration |
|---|---|---|---|---|
| Intelligence artificielle | Intelligence artificielle | Objectif | Automatiser des tâches cognitives | Planificateur d'itinéraire |
| Machine Learning | Apprentissage automatique | Approche | Induire des règles à partir de données | Filtrage de courriels |
| Deep Learning | Apprentissage profond | Classe de modèles | Réseaux multicouches apprenant leurs représentations | Reconnaissance d'images |
| Apprentissage supervisé | — | Paradigme | Induction à partir d'exemples étiquetés | Estimation de prix |
| Apprentissage non supervisé | — | Paradigme | Découverte de structure sans étiquettes | Segmentation client |
| Apprentissage par renforcement | — | Paradigme | Optimisation d'une politique par récompense | Contrôle robotique |
| Data Science | Science des données | Discipline | Chaîne complète de valorisation des données | Fonction métier |
| Analyse de données | — | Activité | Description et interprétation de l'existant | Tableau de bord |
| Big Data | Mégadonnées | Échelle et architecture | Volumétrie excédant les systèmes conventionnels | Journalisation massive |
| Algorithme | — | Procédure | Suite finie d'opérations produisant un résultat | Random Forest |
| Modèle | — | Artefact | Résultat paramétré de l'application d'un algorithme aux données | Fichier sérialisé |
L'IA désigne un objectif, le Machine Learning une approche parmi d'autres pour l'atteindre. Un système expert à base de règles relève de l'IA sans relever du Machine Learning.
Formulation correcte : « Le Machine Learning est une approche de l'intelligence artificielle fondée sur l'induction à partir de données. »
La performance relative dépend de la nature des données. Sur données tabulaires, les méthodes d'ensemble à base d'arbres restent très compétitives, avec un coût computationnel et une opacité nettement moindres.
Formulation correcte : « Le choix entre Deep Learning et méthodes classiques se détermine par la nature des données, le volume disponible, les contraintes d'interprétabilité et le budget computationnel. »
Le volume nécessaire dépend de la complexité du phénomène modélisé et du nombre de variables explicatives, non d'un seuil absolu. De nombreux modèles en production reposent sur quelques milliers d'observations.
Formulation correcte : « La qualité et la représentativité des données priment sur le volume brut. »
Le Deep Learning est une classe de modèles. Un réseau de neurones entraîné sur des données étiquetées relève de l'apprentissage supervisé ; un auto-encodeur relève de l'apprentissage non supervisé ; un réseau optimisé par récompense relève du renforcement.
Un modèle statistique identifie des régularités dans une représentation numérique. Il ne dispose d'aucune représentation sémantique du domaine.
Conséquence opérationnelle : les modes de défaillance d'un modèle ne coïncident pas avec ceux d'un opérateur humain. Un modèle peut échouer sur des cas triviaux pour un humain, tout en réussissant sur des cas difficiles. Cette asymétrie doit être anticipée dans la conception des garde-fous.
TAXONOMIE
Deep Learning ⊂ Machine Learning ⊂ Intelligence Artificielle
NATURE DES CONCEPTS
IA : un objectif
Machine Learning: une approche fondée sur l'induction
Deep Learning : une classe de modèles
CRITÈRE DISCRIMINANT DU MACHINE LEARNING
Les règles sont induites à partir d'observations,
non spécifiées par un concepteur.
CRITÈRE DISCRIMINANT DU DEEP LEARNING
Les représentations intermédiaires sont apprises,
non conçues manuellement.
NIVEAUX ANALYTIQUES
Descriptif → Diagnostic → PRÉDICTIF → Prescriptif
L'apprentissage supervisé opère au niveau prédictif.
DÉFINITION DE RÉFÉRENCE (Mitchell, 1997)
Un programme apprend d'une expérience E relativement à une tâche T
et une mesure de performance P si sa performance sur T, mesurée
par P, s'améliore avec E.Énoncé de synthèse
Le Machine Learning consiste à induire une règle de décision à partir d'observations plutôt qu'à la spécifier explicitement ; l'apprentissage supervisé en est le paradigme dans lequel les observations sont accompagnées de la valeur cible à prédire.
Quiz et questions d'entrevue : 001.1-quiz-ia-ml-deep-learning.md
Chapitre suivant : 002-programmation-classique-vs-ml.md