Inteligencia artificial, Machine Learning y Deep Learning

14 min
Bloque 0 — Situar el aprendizaje supervisado
Objetivo
dominar la taxonomía del dominio, saber definir con rigor cada término, y saber posicionar el aprendizaje supervisado dentro de este conjunto.
Duración estimada
25 minutos
Requisitos previos
ninguno
Quiz asociado
001.1-quiz-ia-ml-deep-learning.md

1. El problema del vocabulario

Los términos siguientes se utilizan en la prensa y en las redes como si fueran intercambiables. No lo son.

Inteligencia artificial · Machine Learning · Deep Learning
Data Science · Big Data · Algoritmo · Red neuronal

Mientras la taxonomía no esté clara, el resto del dominio sigue siendo confuso. Este capítulo la fija definitivamente.


2. La taxonomía de conjunto

Relación de inclusión estricta:

Deep Learning ⊂ Machine Learning ⊂ Inteligencia Artificial

Toda técnica de Deep Learning es Machine Learning. Toda técnica de Machine Learning pertenece a la Inteligencia Artificial. Las recíprocas son falsas.


3. Inteligencia artificial

DEFINICIÓN — Inteligencia artificial (Artificial Intelligence, AI)

Definición rigurosa

Campo de la informática que busca diseñar sistemas capaces de realizar tareas que, ejecutadas por un ser humano, se calificarían de cognitivas: percepción, razonamiento, aprendizaje, planificación, decisión, comprensión del lenguaje.

Definición operativa

Un sistema de IA es un sistema que, a partir de entradas procedentes de su entorno, produce salidas (predicciones, recomendaciones, decisiones, acciones) que influyen en ese entorno, según objetivos explícitos o implícitos definidos por un humano.

Esta segunda formulación es cercana a la definición adoptada por la OCDE y retomada en varios marcos regulatorios. Es útil en contexto profesional porque es verificable.

Traducción al lenguaje corriente

Hacer que una máquina ejecute una tarea que, en un humano, exigiría reflexionar.

Naturaleza del concepto

La IA es un objetivo, no una técnica. Agrupa enfoques heterogéneos, algunos de los cuales no implican ningún aprendizaje.

Punto de datación

El término se acuña en 1956 durante la conferencia de Dartmouth. El dominio es por tanto anterior en varias décadas al Machine Learning aplicado moderno.

3.1 La IA no implica aprendizaje

Es el contrasentido más frecuente.

TécnicaPrincipioAprendizaje
Sistema basado en reglasUn experto humano formaliza las reglasNo
Búsqueda en árbolExploración exhaustiva o heurística del espacio de estadosNo
Lógica formalInferencia a partir de axiomas y reglas de deducciónNo
Optimización combinatoriaBúsqueda de un óptimo bajo restriccionesNo
Machine LearningInducción de reglas a partir de observaciones

Ejemplo de IA sin aprendizaje — un termostato programable

El sistema decide. Ninguna regla ha sido inducida a partir de datos: fueron escritas por un ingeniero. El comportamiento será idéntico dentro de diez años.

Ejemplo de IA sin aprendizaje — Deep Blue (1997)

El sistema que venció a Garry Kasparov evaluaba alrededor de 200 millones de posiciones por segundo con ayuda de una función de evaluación diseñada por humanos y grandes maestros. No aprendía de sus partidas. Buscaba en un espacio de estados.


4. Machine Learning

DEFINICIÓN — Machine Learning (aprendizaje automático)

Definición rigurosa (Tom Mitchell, 1997)

Un programa informático aprende de una experiencia E, con respecto a una clase de tareas T y una medida de rendimiento P, si su rendimiento en las tareas de T, medido por P, mejora con la experiencia E.

Esta definición es la referencia académica. Tiene el mérito de ser operativa: obliga a nombrar explícitamente los tres componentes.

Aplicación de la definición a un caso concreto

Detección de spam:

  • T (tarea): clasificar un correo electrónico como spam o no spam
  • E (experiencia): un corpus de correos previamente etiquetados
  • P (rendimiento): la proporción de correos correctamente clasificados

Definición alternativa (Arthur Samuel, 1959)

Campo de estudio que da a los ordenadores la capacidad de aprender sin haber sido explícitamente programados para la tarea considerada.

Traducción al lenguaje corriente

En lugar de escribir las reglas, se proporciona un gran número de ejemplos y el algoritmo induce las reglas por sí mismo.

Naturaleza del concepto

El Machine Learning es un enfoque dentro de la IA. El concepto central es la inducción: pasar de casos particulares observados a una regla general.

4.1 La inversión del paradigma de programación

Entradas proporcionadasSalida producida
Programación clásicaReglas + DatosRespuestas
Machine LearningDatos + RespuestasReglas

Esta inversión se desarrolla en el capítulo 002.

4.2 Ilustración: el límite del enfoque por reglas

Tarea: determinar si una imagen contiene un gato.

Intento de formalización por reglas:

SI orejas triangulares Y bigotes Y pelaje ENTONCES gato

Contraejemplos inmediatos:

ContraejemploFallo de la regla
Un zorroCumple las tres condiciones, no es un gato
Un gato de espaldasBigotes no visibles
Un gato sphynxAusencia de pelaje
Un gato hecho una bolaNinguna estructura identificable
Un gatitoProporciones diferentes

El número de reglas necesarias diverge sin alcanzar nunca una cobertura satisfactoria. La tarea pertenece a la percepción, cuyos criterios no son verbalizables ni por los propios humanos.

Formulación en Machine Learning

ANALOGÍA — La adquisición del lenguaje en el niño

Ningún adulto transmite a un niño de tres años la definición siguiente:

«Un gato es un mamífero cuadrúpedo de la familia de los félidos, caracterizado por orejas triangulares erguidas, vibrisas faciales y pupilas de hendidura vertical.»

El niño está expuesto a centenares de ocurrencias acompañadas de una etiqueta verbal: «mira, un gato». Termina por etiquetar correctamente un individuo que nunca ha visto.

La regla no fue transmitida. Fue inducida a partir de ejemplos etiquetados. Esa es exactamente la estructura del aprendizaje supervisado.

4.3 Condiciones de aplicabilidad del Machine Learning

CondiciónJustificaciónIlustración
La regla no es formalizableLos criterios no son verbalizablesReconocimiento facial
El número de factores e interacciones es elevadoLa escritura manual divergeScoring de riesgo de cliente
El entorno evolucionaLas reglas caducanDetección de fraude, spam
La personalización debe ser masivaUna regla por individuo es imposibleRecomendación a gran escala
Una respuesta aproximada es aceptableEl modelo produce una estimación, nunca una certezaTasación inmobiliaria
Existe un volumen suficiente de datos etiquetadosLa inducción requiere observacionesHistórico de transacciones

4.4 Contraindicaciones

SituaciónRazónAlternativa
La regla exacta es conocida y estableEl modelo introduciría una aproximación inútilImplementar la fórmula
La exactitud es una obligación legalUna aproximación es jurídicamente inadmisibleRegla explícita auditada
El volumen de datos es insuficienteLa inducción no está fundamentada estadísticamenteExperiencia de negocio, recolección previa
El error es catastrófico e irrecuperableNingún modelo alcanza el 100 %Supervisión humana obligatoria
No existe ningún dato históricoNada que inducirEstudio de mercado, prototipado

Principio director: el Machine Learning es una herramienta de aproximación estadística. Solo debe movilizarse cuando la aproximación es aceptable y la formalización directa es impracticable.


5. Deep Learning

DEFINICIÓN — Deep Learning (aprendizaje profundo)

Definición rigurosa

Subconjunto del Machine Learning basado en redes neuronales artificiales que comprenden varias capas de transformación no lineales sucesivas, donde cada capa produce una representación de los datos a un nivel de abstracción creciente, siendo estas representaciones aprendidas y no especificadas manualmente.

El punto discriminante

Lo que caracteriza al Deep Learning no es la profundidad en sí, sino el aprendizaje automático de las representaciones (representation learning). En Machine Learning clásico, el ingeniero diseña las variables explicativas. En Deep Learning, la red construye por sí misma una jerarquía de representaciones intermedias.

Origen del término «profundo»

El calificativo remite al número de capas apiladas entre la entrada y la salida, es decir, a la profundidad del grafo de cálculo. No conlleva ninguna connotación cualitativa.

Traducción al lenguaje corriente

Una red de numerosos pisos que construye por sí misma, piso a piso, las características pertinentes de los datos.

5.1 La jerarquía de representaciones

Punto esencial: ninguna de estas capas fue especificada manualmente. La asignación «capa 1 = contornos» es una interpretación a posteriori de lo que la red aprendió. Es precisamente esta propiedad la que hace al Deep Learning potente y difícilmente interpretable.

5.2 Comparación Machine Learning clásico / Deep Learning

CriterioML clásicoDeep Learning
Volumen de datos requerido10² a 10⁵ observaciones10⁴ a 10⁷ y más
Recursos de cálculoCPU estándarGPU o aceleradores dedicados
Tipo de datos preferenteDatos tabulares estructuradosDatos no estructurados: imagen, sonido, texto, vídeo
Ingeniería de variablesA cargo del ingenieroAprendida por la red
InterpretabilidadAlta a mediaBaja sin herramientas dedicadas
Plazo de implementaciónMinutos a horasHoras a semanas
Algoritmos representativosRegresión, árboles, bosques aleatorios, gradient boostingCNN, RNN, Transformers

5.3 Posicionamiento práctico

Constatación establecida por la práctica industrial y la literatura comparativa: en datos tabulares, los métodos de ensamble basados en árboles (gradient boosting, bosques aleatorios) siguen siendo muy competitivos frente a las arquitecturas profundas, ofreciendo además tiempos de entrenamiento inferiores en varios órdenes de magnitud y una interpretabilidad superior.

El Deep Learning conserva una ventaja decisiva en los datos no estructurados: visión por computador, procesamiento de señal de audio, procesamiento del lenguaje natural, vídeo.

Este curso trata del Machine Learning supervisado aplicado a datos tabulares, que constituye la mayoría de los casos de uso en la empresa.

ANALOGÍA — Adecuación de la herramienta al problema

Un martillo y una excavadora son ambos herramientas válidas. La elección no depende de la potencia intrínseca de la herramienta sino de su adecuación a la tarea.

Clavar un clavo con una excavadora es técnicamente posible y operativamente absurdo: coste de movilización desproporcionado, precisión insuficiente, daños colaterales.

Demoler un edificio con un martillo es imposible sea cual sea el esfuerzo.

La competencia profesional no consiste en dominar la herramienta más potente, sino en seleccionar la herramienta adecuada al problema planteado.


6. Data Science, análisis de datos, Big Data

DEFINICIÓN — Data Science (ciencia de datos)

Definición rigurosa

Disciplina interdisciplinaria que combina estadística, informática y conocimiento del dominio de aplicación, cuyo objeto es la extracción de conocimiento y el apoyo a la decisión a partir de datos, a lo largo de toda la cadena: adquisición, preparación, exploración, modelado, validación, comunicación.

Perímetro

La Data Science engloba el Machine Learning como uno de sus componentes, junto con la preparación de los datos, el análisis exploratorio, la inferencia estadística y la restitución a los decisores.

Distribución empírica del esfuerzo

Las encuestas profesionales sitúan generalmente entre el 50 % y el 80 % del tiempo de un practicante en la adquisición, la limpieza y la preparación de los datos. El modelado propiamente dicho representa una fracción minoritaria de la actividad.

DEFINICIÓN — Análisis de datos (Data Analysis)

Definición rigurosa

Conjunto de métodos que buscan describir, resumir e interpretar un conjunto de datos con el fin de caracterizar fenómenos observados.

Distinción central

El análisis de datos se centra principalmente en la explicación del pasado y la caracterización del presente. El modelado predictivo se centra en la estimación de valores no observados, generalmente futuros.

DEFINICIÓN — Big Data

Definición rigurosa

Conjunto de datos cuyo volumen, velocidad o variedad exceden las capacidades de procesamiento de los sistemas de gestión de datos convencionales, imponiendo arquitecturas distribuidas.

Las dimensiones características

El modelo clásico retiene tres dimensiones, a menudo extendidas:

  • Volumen: la cantidad de datos
  • Velocidad: el ritmo de producción y la exigencia de procesamiento
  • Variedad: la heterogeneidad de los formatos
  • Extensiones frecuentes: Veracidad (fiabilidad), Valor (utilidad de negocio)

Punto de vigilancia

Big Data y Machine Learning son nociones ortogonales. El Big Data califica una escala y una arquitectura, no una finalidad analítica. Se puede explotar Big Data sin ningún modelo predictivo, y construir modelos eficaces con unos pocos miles de observaciones.


7. Los cuatro niveles de madurez analítica

Ilustración sobre un caso único: un operador de telecomunicaciones constata una erosión de su base de clientes.

NivelPreguntaEntregableHerramientas
Descriptivo¿Qué ocurrió?«La tasa de abandono trimestral se sitúa en el 8,2 %»Consultas, cuadros de mando
Diagnóstico¿Por qué?«El abandono se concentra en los planes mensuales con más de dos contactos con soporte»Segmentación, pruebas estadísticas
Predictivo¿Qué va a ocurrir?«1 240 clientes presentan una probabilidad de cancelación superior a 0,70 a 30 días»Aprendizaje supervisado
Prescriptivo¿Qué hacer?«Dirigirse a 300 clientes con un descuento del 15 %; ganancia neta esperada 84 000 $»Optimización bajo restricciones

El aprendizaje supervisado, objeto de este curso, opera en el nivel predictivo.


8. Posicionamiento del aprendizaje supervisado

Punto de vigilancia recurrente: el Deep Learning no constituye una cuarta familia junto al supervisado, el no supervisado y el refuerzo. Se trata de una clase de modelos movilizable en los tres paradigmas.


9. Tabla de síntesis terminológica

TérminoTraducciónNaturaleza del conceptoDefinición condensadaIlustración
Inteligencia artificialInteligencia artificialObjetivoAutomatizar tareas cognitivasPlanificador de itinerarios
Machine LearningAprendizaje automáticoEnfoqueInducir reglas a partir de datosFiltrado de correos electrónicos
Deep LearningAprendizaje profundoClase de modelosRedes multicapa que aprenden sus representacionesReconocimiento de imágenes
Aprendizaje supervisadoParadigmaInducción a partir de ejemplos etiquetadosEstimación de precios
Aprendizaje no supervisadoParadigmaDescubrimiento de estructura sin etiquetasSegmentación de clientes
Aprendizaje por refuerzoParadigmaOptimización de una política mediante recompensaControl robótico
Data ScienceCiencia de datosDisciplinaCadena completa de valorización de los datosFunción de negocio
Análisis de datosActividadDescripción e interpretación de lo existenteCuadro de mando
Big DataMacrodatosEscala y arquitecturaVolumetría que excede los sistemas convencionalesRegistro masivo de logs
AlgoritmoProcedimientoSecuencia finita de operaciones que produce un resultadoRandom Forest
ModeloArtefactoResultado parametrizado de la aplicación de un algoritmo a los datosArchivo serializado

10. Errores de razonamiento frecuentes

ERROR — Asimilar IA y Machine Learning

La IA designa un objetivo, el Machine Learning un enfoque entre otros para alcanzarlo. Un sistema experto basado en reglas pertenece a la IA sin pertenecer al Machine Learning.

Formulación correcta: «El Machine Learning es un enfoque de la inteligencia artificial basado en la inducción a partir de datos.»

ERROR — Postular una superioridad general del Deep Learning

El rendimiento relativo depende de la naturaleza de los datos. En datos tabulares, los métodos de ensamble basados en árboles siguen siendo muy competitivos, con un coste computacional y una opacidad claramente menores.

Formulación correcta: «La elección entre Deep Learning y métodos clásicos se determina por la naturaleza de los datos, el volumen disponible, las restricciones de interpretabilidad y el presupuesto computacional.»

ERROR — Condicionar el Machine Learning al Big Data

El volumen necesario depende de la complejidad del fenómeno modelado y del número de variables explicativas, no de un umbral absoluto. Numerosos modelos en producción se apoyan en unos pocos miles de observaciones.

Formulación correcta: «La calidad y la representatividad de los datos priman sobre el volumen bruto.»

ERROR — Tratar el Deep Learning como un paradigma de aprendizaje

El Deep Learning es una clase de modelos. Una red neuronal entrenada con datos etiquetados pertenece al aprendizaje supervisado; un autoencoder pertenece al aprendizaje no supervisado; una red optimizada por recompensa pertenece al refuerzo.

ERROR — Atribuir una comprensión semántica al modelo

Un modelo estadístico identifica regularidades en una representación numérica. No dispone de ninguna representación semántica del dominio.

Consecuencia operativa: los modos de fallo de un modelo no coinciden con los de un operador humano. Un modelo puede fallar en casos triviales para un humano, y a la vez tener éxito en casos difíciles. Esta asimetría debe anticiparse en el diseño de las salvaguardas.


11. Síntesis

TAXONOMÍA
    Deep Learning ⊂ Machine Learning ⊂ Inteligencia Artificial

NATURALEZA DE LOS CONCEPTOS
    IA              : un objetivo
    Machine Learning: un enfoque basado en la inducción
    Deep Learning   : una clase de modelos

CRITERIO DISCRIMINANTE DEL MACHINE LEARNING
    Las reglas se inducen a partir de observaciones,
    no las especifica un diseñador.

CRITERIO DISCRIMINANTE DEL DEEP LEARNING
    Las representaciones intermedias se aprenden,
    no se diseñan manualmente.

NIVELES ANALÍTICOS
    Descriptivo → Diagnóstico → PREDICTIVO → Prescriptivo
    El aprendizaje supervisado opera en el nivel predictivo.

DEFINICIÓN DE REFERENCIA (Mitchell, 1997)
    Un programa aprende de una experiencia E con respecto a una tarea T
    y una medida de rendimiento P si su rendimiento en T, medido
    por P, mejora con E.

Enunciado de síntesis

El Machine Learning consiste en inducir una regla de decisión a partir de observaciones en lugar de especificarla explícitamente; el aprendizaje supervisado es el paradigma en el que las observaciones van acompañadas del valor objetivo a predecir.


Quiz y preguntas de entrevista: 001.1-quiz-ia-ml-deep-learning.md

Capítulo siguiente: 002-programmation-classique-vs-ml.md