Intelligence artificielle, Machine Learning et Deep Learning

14 min
Bloc 0 — Situer l'apprentissage supervisé
Objectif
maîtriser la taxonomie du domaine, savoir définir rigoureusement chaque terme, et savoir positionner l'apprentissage supervisé dans cet ensemble.
Durée estimée
25 minutes
Prérequis
aucun
Quiz associé
001.1-quiz-ia-ml-deep-learning.md

1. Le problème du vocabulaire

Les termes suivants sont utilisés dans la presse et sur les réseaux comme s'ils étaient interchangeables. Ils ne le sont pas.

Intelligence artificielle · Machine Learning · Deep Learning
Data Science · Big Data · Algorithme · Réseau de neurones

Tant que la taxonomie n'est pas claire, le reste du domaine reste confus. Ce chapitre la fixe définitivement.


2. La taxonomie d'ensemble

Relation d'inclusion stricte :

Deep Learning ⊂ Machine Learning ⊂ Intelligence Artificielle

Toute technique de Deep Learning est du Machine Learning. Toute technique de Machine Learning relève de l'Intelligence Artificielle. Les réciproques sont fausses.


3. Intelligence artificielle

DÉFINITION — Intelligence artificielle (Artificial Intelligence, AI)

Définition rigoureuse

Champ de l'informatique visant à concevoir des systèmes capables d'accomplir des tâches qui, réalisées par un être humain, seraient qualifiées de cognitives : perception, raisonnement, apprentissage, planification, décision, compréhension du langage.

Définition opérationnelle

Un système d'IA est un système qui, à partir d'entrées issues de son environnement, produit des sorties (prédictions, recommandations, décisions, actions) influant sur cet environnement, selon des objectifs explicites ou implicites définis par un humain.

Cette seconde formulation est proche de la définition retenue par l'OCDE et reprise dans plusieurs cadres réglementaires. Elle est utile en contexte professionnel car elle est vérifiable.

Traduction en langage courant

Faire exécuter par une machine une tâche qui, chez un humain, exigerait de réfléchir.

Nature du concept

L'IA est un objectif, pas une technique. Elle regroupe des approches hétérogènes, dont certaines n'impliquent aucun apprentissage.

Point de datation

Le terme est forgé en 1956 lors de la conférence de Dartmouth. Le domaine est donc antérieur de plusieurs décennies au Machine Learning appliqué moderne.

3.1 L'IA n'implique pas l'apprentissage

C'est le contresens le plus fréquent.

TechniquePrincipeApprentissage
Système à base de règlesUn expert humain formalise les règlesNon
Recherche arborescenteExploration exhaustive ou heuristique de l'espace des étatsNon
Logique formelleInférence à partir d'axiomes et de règles de déductionNon
Optimisation combinatoireRecherche d'un optimum sous contraintesNon
Machine LearningInduction de règles à partir d'observationsOui

Exemple d'IA sans apprentissage — un thermostat programmable

Le système décide. Aucune règle n'a été induite à partir de données : elles ont été écrites par un ingénieur. Le comportement sera identique dans dix ans.

Exemple d'IA sans apprentissage — Deep Blue (1997)

Le système qui a battu Garry Kasparov évaluait environ 200 millions de positions par seconde à l'aide d'une fonction d'évaluation conçue par des humains et des grands maîtres. Il n'apprenait pas de ses parties. Il cherchait dans un espace d'états.


4. Machine Learning

DÉFINITION — Machine Learning (apprentissage automatique)

Définition rigoureuse (Tom Mitchell, 1997)

Un programme informatique apprend d'une expérience E, relativement à une classe de tâches T et une mesure de performance P, si sa performance sur les tâches de T, mesurée par P, s'améliore avec l'expérience E.

Cette définition est la référence académique. Elle a le mérite d'être opératoire : elle impose de nommer explicitement les trois composantes.

Application de la définition à un cas concret

Détection de spam :

  • T (tâche) : classer un courriel en spam ou non-spam
  • E (expérience) : un corpus de courriels préalablement étiquetés
  • P (performance) : la proportion de courriels correctement classés

Définition alternative (Arthur Samuel, 1959)

Champ d'étude donnant aux ordinateurs la capacité d'apprendre sans avoir été explicitement programmés pour la tâche considérée.

Traduction en langage courant

Au lieu d'écrire les règles, on fournit un grand nombre d'exemples et l'algorithme induit les règles lui-même.

Nature du concept

Le Machine Learning est une approche au sein de l'IA. Le concept central est l'induction : passer de cas particuliers observés à une règle générale.

4.1 Le renversement du paradigme de programmation

Entrées fourniesSortie produite
Programmation classiqueRègles + DonnéesRéponses
Machine LearningDonnées + RéponsesRègles

Ce renversement est développé au chapitre 002.

4.2 Illustration : la limite de l'approche par règles

Tâche : déterminer si une image contient un chat.

Tentative de formalisation par règles :

SI oreilles triangulaires ET moustaches ET fourrure ALORS chat

Contre-exemples immédiats :

Contre-exempleDéfaillance de la règle
Un renardSatisfait les trois conditions, n'est pas un chat
Un chat de dosMoustaches non visibles
Un chat sphynxAbsence de fourrure
Un chat en bouleAucune structure identifiable
Un chatonProportions différentes

Le nombre de règles nécessaires diverge sans jamais atteindre une couverture satisfaisante. La tâche relève de la perception, dont les critères ne sont pas verbalisables par les humains eux-mêmes.

Formulation en Machine Learning

ANALOGIE — L'acquisition du langage chez l'enfant

Aucun adulte ne transmet à un enfant de trois ans la définition suivante :

« Un chat est un mammifère quadrupède de la famille des félidés, caractérisé par des oreilles triangulaires érigées, des vibrisses faciales et des pupilles à fente verticale. »

L'enfant est exposé à des centaines d'occurrences accompagnées d'une étiquette verbale : « regarde, un chat ». Il finit par étiqueter correctement un individu qu'il n'a jamais vu.

La règle n'a pas été transmise. Elle a été induite à partir d'exemples étiquetés. C'est exactement la structure de l'apprentissage supervisé.

4.3 Conditions d'applicabilité du Machine Learning

ConditionJustificationIllustration
La règle n'est pas formalisableLes critères ne sont pas verbalisablesReconnaissance faciale
Le nombre de facteurs et d'interactions est élevéL'écriture manuelle divergeScoring de risque client
L'environnement évolueLes règles se périmentDétection de fraude, spam
La personnalisation doit être massiveUne règle par individu est impossibleRecommandation à grande échelle
Une réponse approchée est acceptableLe modèle produit une estimation, jamais une certitudeEstimation immobilière
Un volume suffisant de données étiquetées existeL'induction requiert des observationsHistorique de transactions

4.4 Contre-indications

SituationRaisonAlternative
La règle exacte est connue et stableLe modèle introduirait une approximation inutileImplémenter la formule
L'exactitude est une obligation légaleUne approximation est juridiquement irrecevableRègle explicite auditée
Le volume de données est insuffisantL'induction n'est pas fondée statistiquementExpertise métier, collecte préalable
L'erreur est catastrophique et non rattrapableAucun modèle n'atteint 100 %Supervision humaine obligatoire
Aucune donnée historique n'existeRien à induireÉtude de marché, prototypage

Principe directeur : le Machine Learning est un outil d'approximation statistique. Il ne doit être mobilisé que lorsque l'approximation est acceptable et que la formalisation directe est impraticable.


5. Deep Learning

DÉFINITION — Deep Learning (apprentissage profond)

Définition rigoureuse

Sous-ensemble du Machine Learning fondé sur des réseaux de neurones artificiels comportant plusieurs couches de transformation non linéaires successives, chaque couche produisant une représentation des données à un niveau d'abstraction croissant, ces représentations étant apprises et non spécifiées manuellement.

Le point discriminant

Ce qui caractérise le Deep Learning n'est pas la profondeur en soi, mais l'apprentissage automatique des représentations (representation learning). En Machine Learning classique, l'ingénieur conçoit les variables explicatives. En Deep Learning, le réseau construit lui-même une hiérarchie de représentations intermédiaires.

Origine du terme « profond »

Le qualificatif renvoie au nombre de couches empilées entre l'entrée et la sortie, c'est-à-dire à la profondeur du graphe de calcul. Il ne comporte aucune connotation qualitative.

Traduction en langage courant

Un réseau à nombreux étages qui construit lui-même, étage par étage, les caractéristiques pertinentes des données.

5.1 La hiérarchie de représentations

Point essentiel : aucune de ces couches n'a été spécifiée manuellement. L'assignation « couche 1 = contours » est une interprétation a posteriori de ce que le réseau a appris. C'est précisément cette propriété qui rend le Deep Learning puissant et difficilement interprétable.

5.2 Comparaison Machine Learning classique / Deep Learning

CritèreML classiqueDeep Learning
Volume de données requis10² à 10⁵ observations10⁴ à 10⁷ et au-delà
Ressources de calculCPU standardGPU ou accélérateurs dédiés
Type de données de prédilectionDonnées tabulaires structuréesDonnées non structurées : image, son, texte, vidéo
Ingénierie des variablesÀ la charge de l'ingénieurApprise par le réseau
InterprétabilitéÉlevée à moyenneFaible sans outillage dédié
Délai de mise en oeuvreMinutes à heuresHeures à semaines
Algorithmes représentatifsRégression, arbres, forêts aléatoires, gradient boostingCNN, RNN, Transformers

5.3 Positionnement pratique

Constat établi par la pratique industrielle et la littérature comparative : sur données tabulaires, les méthodes d'ensemble à base d'arbres (gradient boosting, forêts aléatoires) demeurent très compétitives face aux architectures profondes, tout en offrant des temps d'entraînement inférieurs de plusieurs ordres de grandeur et une interprétabilité supérieure.

Le Deep Learning conserve un avantage décisif sur les données non structurées : vision par ordinateur, traitement du signal audio, traitement automatique du langage naturel, vidéo.

Ce cours porte sur le Machine Learning supervisé appliqué à des données tabulaires, qui constitue la majorité des cas d'usage en entreprise.

ANALOGIE — Adéquation de l'outil au problème

Un marteau et une pelle mécanique sont tous deux des outils valides. Le choix ne dépend pas de la puissance intrinsèque de l'outil mais de l'adéquation à la tâche.

Planter un clou avec une pelle mécanique est techniquement possible et opérationnellement absurde : coût de mobilisation disproportionné, précision insuffisante, dommages collatéraux.

Raser un immeuble avec un marteau est impossible quel que soit l'effort.

La compétence professionnelle ne consiste pas à maîtriser l'outil le plus puissant, mais à sélectionner l'outil adapté au problème posé.


6. Data Science, analyse de données, Big Data

DÉFINITION — Data Science (science des données)

Définition rigoureuse

Discipline interdisciplinaire combinant statistique, informatique et connaissance du domaine applicatif, ayant pour objet l'extraction de connaissances et d'aide à la décision à partir de données, sur l'ensemble de la chaîne : acquisition, préparation, exploration, modélisation, validation, communication.

Périmètre

La Data Science englobe le Machine Learning comme l'une de ses composantes, aux côtés de la préparation des données, de l'analyse exploratoire, de l'inférence statistique et de la restitution aux décideurs.

Répartition empirique de l'effort

Les enquêtes professionnelles situent généralement entre 50 % et 80 % du temps d'un praticien sur l'acquisition, le nettoyage et la préparation des données. La modélisation proprement dite représente une fraction minoritaire de l'activité.

DÉFINITION — Analyse de données (Data Analysis)

Définition rigoureuse

Ensemble des méthodes visant à décrire, résumer et interpréter un ensemble de données afin de caractériser des phénomènes observés.

Distinction centrale

L'analyse de données porte principalement sur l'explication du passé et la caractérisation du présent. La modélisation prédictive porte sur l'estimation de valeurs non observées, généralement futures.

DÉFINITION — Big Data

Définition rigoureuse

Ensemble de données dont le volume, la vélocité ou la variété excèdent les capacités de traitement des systèmes de gestion de données conventionnels, imposant des architectures distribuées.

Les dimensions caractéristiques

Le modèle classique retient trois dimensions, souvent étendues :

  • Volume : la quantité de données
  • Vélocité : le débit de production et l'exigence de traitement
  • Variété : l'hétérogénéité des formats
  • Extensions fréquentes : Véracité (fiabilité), Valeur (utilité métier)

Point de vigilance

Big Data et Machine Learning sont des notions orthogonales. Le Big Data qualifie une échelle et une architecture, non une finalité analytique. On peut exploiter du Big Data sans aucun modèle prédictif, et construire des modèles performants sur quelques milliers d'observations.


7. Les quatre niveaux de maturité analytique

Illustration sur un cas unique : un opérateur télécom constate une érosion de sa base client.

NiveauQuestionLivrableOutillage
DescriptifQue s'est-il passé ?« Le taux d'attrition trimestriel s'établit à 8,2 % »Requêtage, tableaux de bord
DiagnosticPourquoi ?« L'attrition est concentrée sur les forfaits mensuels avec plus de deux contacts au support »Segmentation, tests statistiques
PrédictifQue va-t-il se passer ?« 1 240 clients présentent une probabilité de résiliation supérieure à 0,70 à 30 jours »Apprentissage supervisé
PrescriptifQue faire ?« Cibler 300 clients avec une remise de 15 % ; gain net attendu 84 000 $ »Optimisation sous contrainte

L'apprentissage supervisé, objet de ce cours, opère au niveau prédictif.


8. Positionnement de l'apprentissage supervisé

Point de vigilance récurrent : le Deep Learning ne constitue pas une quatrième famille aux côtés du supervisé, du non supervisé et du renforcement. Il s'agit d'une classe de modèles mobilisable dans les trois paradigmes.


9. Tableau de synthèse terminologique

TermeTraductionNature du conceptDéfinition condenséeIllustration
Intelligence artificielleIntelligence artificielleObjectifAutomatiser des tâches cognitivesPlanificateur d'itinéraire
Machine LearningApprentissage automatiqueApprocheInduire des règles à partir de donnéesFiltrage de courriels
Deep LearningApprentissage profondClasse de modèlesRéseaux multicouches apprenant leurs représentationsReconnaissance d'images
Apprentissage superviséParadigmeInduction à partir d'exemples étiquetésEstimation de prix
Apprentissage non superviséParadigmeDécouverte de structure sans étiquettesSegmentation client
Apprentissage par renforcementParadigmeOptimisation d'une politique par récompenseContrôle robotique
Data ScienceScience des donnéesDisciplineChaîne complète de valorisation des donnéesFonction métier
Analyse de donnéesActivitéDescription et interprétation de l'existantTableau de bord
Big DataMégadonnéesÉchelle et architectureVolumétrie excédant les systèmes conventionnelsJournalisation massive
AlgorithmeProcédureSuite finie d'opérations produisant un résultatRandom Forest
ModèleArtefactRésultat paramétré de l'application d'un algorithme aux donnéesFichier sérialisé

10. Erreurs de raisonnement fréquentes

ERREUR — Assimiler IA et Machine Learning

L'IA désigne un objectif, le Machine Learning une approche parmi d'autres pour l'atteindre. Un système expert à base de règles relève de l'IA sans relever du Machine Learning.

Formulation correcte : « Le Machine Learning est une approche de l'intelligence artificielle fondée sur l'induction à partir de données. »

ERREUR — Poser une supériorité générale du Deep Learning

La performance relative dépend de la nature des données. Sur données tabulaires, les méthodes d'ensemble à base d'arbres restent très compétitives, avec un coût computationnel et une opacité nettement moindres.

Formulation correcte : « Le choix entre Deep Learning et méthodes classiques se détermine par la nature des données, le volume disponible, les contraintes d'interprétabilité et le budget computationnel. »

ERREUR — Conditionner le Machine Learning au Big Data

Le volume nécessaire dépend de la complexité du phénomène modélisé et du nombre de variables explicatives, non d'un seuil absolu. De nombreux modèles en production reposent sur quelques milliers d'observations.

Formulation correcte : « La qualité et la représentativité des données priment sur le volume brut. »

ERREUR — Traiter le Deep Learning comme un paradigme d'apprentissage

Le Deep Learning est une classe de modèles. Un réseau de neurones entraîné sur des données étiquetées relève de l'apprentissage supervisé ; un auto-encodeur relève de l'apprentissage non supervisé ; un réseau optimisé par récompense relève du renforcement.

ERREUR — Attribuer une compréhension sémantique au modèle

Un modèle statistique identifie des régularités dans une représentation numérique. Il ne dispose d'aucune représentation sémantique du domaine.

Conséquence opérationnelle : les modes de défaillance d'un modèle ne coïncident pas avec ceux d'un opérateur humain. Un modèle peut échouer sur des cas triviaux pour un humain, tout en réussissant sur des cas difficiles. Cette asymétrie doit être anticipée dans la conception des garde-fous.


11. Synthèse

TAXONOMIE
    Deep Learning ⊂ Machine Learning ⊂ Intelligence Artificielle

NATURE DES CONCEPTS
    IA              : un objectif
    Machine Learning: une approche fondée sur l'induction
    Deep Learning   : une classe de modèles

CRITÈRE DISCRIMINANT DU MACHINE LEARNING
    Les règles sont induites à partir d'observations,
    non spécifiées par un concepteur.

CRITÈRE DISCRIMINANT DU DEEP LEARNING
    Les représentations intermédiaires sont apprises,
    non conçues manuellement.

NIVEAUX ANALYTIQUES
    Descriptif → Diagnostic → PRÉDICTIF → Prescriptif
    L'apprentissage supervisé opère au niveau prédictif.

DÉFINITION DE RÉFÉRENCE (Mitchell, 1997)
    Un programme apprend d'une expérience E relativement à une tâche T
    et une mesure de performance P si sa performance sur T, mesurée
    par P, s'améliore avec E.

Énoncé de synthèse

Le Machine Learning consiste à induire une règle de décision à partir d'observations plutôt qu'à la spécifier explicitement ; l'apprentissage supervisé en est le paradigme dans lequel les observations sont accompagnées de la valeur cible à prédire.


Quiz et questions d'entrevue : 001.1-quiz-ia-ml-deep-learning.md

Chapitre suivant : 002-programmation-classique-vs-ml.md