Los términos siguientes se utilizan en la prensa y en las redes como si fueran intercambiables. No lo son.
Inteligencia artificial · Machine Learning · Deep Learning
Data Science · Big Data · Algoritmo · Red neuronalMientras la taxonomía no esté clara, el resto del dominio sigue siendo confuso. Este capítulo la fija definitivamente.
Relación de inclusión estricta:
Deep Learning ⊂ Machine Learning ⊂ Inteligencia Artificial
Toda técnica de Deep Learning es Machine Learning. Toda técnica de Machine Learning pertenece a la Inteligencia Artificial. Las recíprocas son falsas.
Definición rigurosa
Campo de la informática que busca diseñar sistemas capaces de realizar tareas que, ejecutadas por un ser humano, se calificarían de cognitivas: percepción, razonamiento, aprendizaje, planificación, decisión, comprensión del lenguaje.
Definición operativa
Un sistema de IA es un sistema que, a partir de entradas procedentes de su entorno, produce salidas (predicciones, recomendaciones, decisiones, acciones) que influyen en ese entorno, según objetivos explícitos o implícitos definidos por un humano.
Esta segunda formulación es cercana a la definición adoptada por la OCDE y retomada en varios marcos regulatorios. Es útil en contexto profesional porque es verificable.
Traducción al lenguaje corriente
Hacer que una máquina ejecute una tarea que, en un humano, exigiría reflexionar.
Naturaleza del concepto
La IA es un objetivo, no una técnica. Agrupa enfoques heterogéneos, algunos de los cuales no implican ningún aprendizaje.
Punto de datación
El término se acuña en 1956 durante la conferencia de Dartmouth. El dominio es por tanto anterior en varias décadas al Machine Learning aplicado moderno.
Es el contrasentido más frecuente.
| Técnica | Principio | Aprendizaje |
|---|---|---|
| Sistema basado en reglas | Un experto humano formaliza las reglas | No |
| Búsqueda en árbol | Exploración exhaustiva o heurística del espacio de estados | No |
| Lógica formal | Inferencia a partir de axiomas y reglas de deducción | No |
| Optimización combinatoria | Búsqueda de un óptimo bajo restricciones | No |
| Machine Learning | Inducción de reglas a partir de observaciones | Sí |
Ejemplo de IA sin aprendizaje — un termostato programable
El sistema decide. Ninguna regla ha sido inducida a partir de datos: fueron escritas por un ingeniero. El comportamiento será idéntico dentro de diez años.
Ejemplo de IA sin aprendizaje — Deep Blue (1997)
El sistema que venció a Garry Kasparov evaluaba alrededor de 200 millones de posiciones por segundo con ayuda de una función de evaluación diseñada por humanos y grandes maestros. No aprendía de sus partidas. Buscaba en un espacio de estados.
Definición rigurosa (Tom Mitchell, 1997)
Un programa informático aprende de una experiencia E, con respecto a una clase de tareas T y una medida de rendimiento P, si su rendimiento en las tareas de T, medido por P, mejora con la experiencia E.
Esta definición es la referencia académica. Tiene el mérito de ser operativa: obliga a nombrar explícitamente los tres componentes.
Aplicación de la definición a un caso concreto
Detección de spam:
Definición alternativa (Arthur Samuel, 1959)
Campo de estudio que da a los ordenadores la capacidad de aprender sin haber sido explícitamente programados para la tarea considerada.
Traducción al lenguaje corriente
En lugar de escribir las reglas, se proporciona un gran número de ejemplos y el algoritmo induce las reglas por sí mismo.
Naturaleza del concepto
El Machine Learning es un enfoque dentro de la IA. El concepto central es la inducción: pasar de casos particulares observados a una regla general.
| Entradas proporcionadas | Salida producida | |
|---|---|---|
| Programación clásica | Reglas + Datos | Respuestas |
| Machine Learning | Datos + Respuestas | Reglas |
Esta inversión se desarrolla en el capítulo 002.
Tarea: determinar si una imagen contiene un gato.
Intento de formalización por reglas:
SI orejas triangulares Y bigotes Y pelaje ENTONCES gatoContraejemplos inmediatos:
| Contraejemplo | Fallo de la regla |
|---|---|
| Un zorro | Cumple las tres condiciones, no es un gato |
| Un gato de espaldas | Bigotes no visibles |
| Un gato sphynx | Ausencia de pelaje |
| Un gato hecho una bola | Ninguna estructura identificable |
| Un gatito | Proporciones diferentes |
El número de reglas necesarias diverge sin alcanzar nunca una cobertura satisfactoria. La tarea pertenece a la percepción, cuyos criterios no son verbalizables ni por los propios humanos.
Formulación en Machine Learning
Ningún adulto transmite a un niño de tres años la definición siguiente:
«Un gato es un mamífero cuadrúpedo de la familia de los félidos, caracterizado por orejas triangulares erguidas, vibrisas faciales y pupilas de hendidura vertical.»
El niño está expuesto a centenares de ocurrencias acompañadas de una etiqueta verbal: «mira, un gato». Termina por etiquetar correctamente un individuo que nunca ha visto.
La regla no fue transmitida. Fue inducida a partir de ejemplos etiquetados. Esa es exactamente la estructura del aprendizaje supervisado.
| Condición | Justificación | Ilustración |
|---|---|---|
| La regla no es formalizable | Los criterios no son verbalizables | Reconocimiento facial |
| El número de factores e interacciones es elevado | La escritura manual diverge | Scoring de riesgo de cliente |
| El entorno evoluciona | Las reglas caducan | Detección de fraude, spam |
| La personalización debe ser masiva | Una regla por individuo es imposible | Recomendación a gran escala |
| Una respuesta aproximada es aceptable | El modelo produce una estimación, nunca una certeza | Tasación inmobiliaria |
| Existe un volumen suficiente de datos etiquetados | La inducción requiere observaciones | Histórico de transacciones |
| Situación | Razón | Alternativa |
|---|---|---|
| La regla exacta es conocida y estable | El modelo introduciría una aproximación inútil | Implementar la fórmula |
| La exactitud es una obligación legal | Una aproximación es jurídicamente inadmisible | Regla explícita auditada |
| El volumen de datos es insuficiente | La inducción no está fundamentada estadísticamente | Experiencia de negocio, recolección previa |
| El error es catastrófico e irrecuperable | Ningún modelo alcanza el 100 % | Supervisión humana obligatoria |
| No existe ningún dato histórico | Nada que inducir | Estudio de mercado, prototipado |
Principio director: el Machine Learning es una herramienta de aproximación estadística. Solo debe movilizarse cuando la aproximación es aceptable y la formalización directa es impracticable.
Definición rigurosa
Subconjunto del Machine Learning basado en redes neuronales artificiales que comprenden varias capas de transformación no lineales sucesivas, donde cada capa produce una representación de los datos a un nivel de abstracción creciente, siendo estas representaciones aprendidas y no especificadas manualmente.
El punto discriminante
Lo que caracteriza al Deep Learning no es la profundidad en sí, sino el aprendizaje automático de las representaciones (representation learning). En Machine Learning clásico, el ingeniero diseña las variables explicativas. En Deep Learning, la red construye por sí misma una jerarquía de representaciones intermedias.
Origen del término «profundo»
El calificativo remite al número de capas apiladas entre la entrada y la salida, es decir, a la profundidad del grafo de cálculo. No conlleva ninguna connotación cualitativa.
Traducción al lenguaje corriente
Una red de numerosos pisos que construye por sí misma, piso a piso, las características pertinentes de los datos.
Punto esencial: ninguna de estas capas fue especificada manualmente. La asignación «capa 1 = contornos» es una interpretación a posteriori de lo que la red aprendió. Es precisamente esta propiedad la que hace al Deep Learning potente y difícilmente interpretable.
| Criterio | ML clásico | Deep Learning |
|---|---|---|
| Volumen de datos requerido | 10² a 10⁵ observaciones | 10⁴ a 10⁷ y más |
| Recursos de cálculo | CPU estándar | GPU o aceleradores dedicados |
| Tipo de datos preferente | Datos tabulares estructurados | Datos no estructurados: imagen, sonido, texto, vídeo |
| Ingeniería de variables | A cargo del ingeniero | Aprendida por la red |
| Interpretabilidad | Alta a media | Baja sin herramientas dedicadas |
| Plazo de implementación | Minutos a horas | Horas a semanas |
| Algoritmos representativos | Regresión, árboles, bosques aleatorios, gradient boosting | CNN, RNN, Transformers |
Constatación establecida por la práctica industrial y la literatura comparativa: en datos tabulares, los métodos de ensamble basados en árboles (gradient boosting, bosques aleatorios) siguen siendo muy competitivos frente a las arquitecturas profundas, ofreciendo además tiempos de entrenamiento inferiores en varios órdenes de magnitud y una interpretabilidad superior.
El Deep Learning conserva una ventaja decisiva en los datos no estructurados: visión por computador, procesamiento de señal de audio, procesamiento del lenguaje natural, vídeo.
Este curso trata del Machine Learning supervisado aplicado a datos tabulares, que constituye la mayoría de los casos de uso en la empresa.
Un martillo y una excavadora son ambos herramientas válidas. La elección no depende de la potencia intrínseca de la herramienta sino de su adecuación a la tarea.
Clavar un clavo con una excavadora es técnicamente posible y operativamente absurdo: coste de movilización desproporcionado, precisión insuficiente, daños colaterales.
Demoler un edificio con un martillo es imposible sea cual sea el esfuerzo.
La competencia profesional no consiste en dominar la herramienta más potente, sino en seleccionar la herramienta adecuada al problema planteado.
Definición rigurosa
Disciplina interdisciplinaria que combina estadística, informática y conocimiento del dominio de aplicación, cuyo objeto es la extracción de conocimiento y el apoyo a la decisión a partir de datos, a lo largo de toda la cadena: adquisición, preparación, exploración, modelado, validación, comunicación.
Perímetro
La Data Science engloba el Machine Learning como uno de sus componentes, junto con la preparación de los datos, el análisis exploratorio, la inferencia estadística y la restitución a los decisores.
Distribución empírica del esfuerzo
Las encuestas profesionales sitúan generalmente entre el 50 % y el 80 % del tiempo de un practicante en la adquisición, la limpieza y la preparación de los datos. El modelado propiamente dicho representa una fracción minoritaria de la actividad.
Definición rigurosa
Conjunto de métodos que buscan describir, resumir e interpretar un conjunto de datos con el fin de caracterizar fenómenos observados.
Distinción central
El análisis de datos se centra principalmente en la explicación del pasado y la caracterización del presente. El modelado predictivo se centra en la estimación de valores no observados, generalmente futuros.
Definición rigurosa
Conjunto de datos cuyo volumen, velocidad o variedad exceden las capacidades de procesamiento de los sistemas de gestión de datos convencionales, imponiendo arquitecturas distribuidas.
Las dimensiones características
El modelo clásico retiene tres dimensiones, a menudo extendidas:
Punto de vigilancia
Big Data y Machine Learning son nociones ortogonales. El Big Data califica una escala y una arquitectura, no una finalidad analítica. Se puede explotar Big Data sin ningún modelo predictivo, y construir modelos eficaces con unos pocos miles de observaciones.
Ilustración sobre un caso único: un operador de telecomunicaciones constata una erosión de su base de clientes.
| Nivel | Pregunta | Entregable | Herramientas |
|---|---|---|---|
| Descriptivo | ¿Qué ocurrió? | «La tasa de abandono trimestral se sitúa en el 8,2 %» | Consultas, cuadros de mando |
| Diagnóstico | ¿Por qué? | «El abandono se concentra en los planes mensuales con más de dos contactos con soporte» | Segmentación, pruebas estadísticas |
| Predictivo | ¿Qué va a ocurrir? | «1 240 clientes presentan una probabilidad de cancelación superior a 0,70 a 30 días» | Aprendizaje supervisado |
| Prescriptivo | ¿Qué hacer? | «Dirigirse a 300 clientes con un descuento del 15 %; ganancia neta esperada 84 000 $» | Optimización bajo restricciones |
El aprendizaje supervisado, objeto de este curso, opera en el nivel predictivo.
Punto de vigilancia recurrente: el Deep Learning no constituye una cuarta familia junto al supervisado, el no supervisado y el refuerzo. Se trata de una clase de modelos movilizable en los tres paradigmas.
| Término | Traducción | Naturaleza del concepto | Definición condensada | Ilustración |
|---|---|---|---|---|
| Inteligencia artificial | Inteligencia artificial | Objetivo | Automatizar tareas cognitivas | Planificador de itinerarios |
| Machine Learning | Aprendizaje automático | Enfoque | Inducir reglas a partir de datos | Filtrado de correos electrónicos |
| Deep Learning | Aprendizaje profundo | Clase de modelos | Redes multicapa que aprenden sus representaciones | Reconocimiento de imágenes |
| Aprendizaje supervisado | — | Paradigma | Inducción a partir de ejemplos etiquetados | Estimación de precios |
| Aprendizaje no supervisado | — | Paradigma | Descubrimiento de estructura sin etiquetas | Segmentación de clientes |
| Aprendizaje por refuerzo | — | Paradigma | Optimización de una política mediante recompensa | Control robótico |
| Data Science | Ciencia de datos | Disciplina | Cadena completa de valorización de los datos | Función de negocio |
| Análisis de datos | — | Actividad | Descripción e interpretación de lo existente | Cuadro de mando |
| Big Data | Macrodatos | Escala y arquitectura | Volumetría que excede los sistemas convencionales | Registro masivo de logs |
| Algoritmo | — | Procedimiento | Secuencia finita de operaciones que produce un resultado | Random Forest |
| Modelo | — | Artefacto | Resultado parametrizado de la aplicación de un algoritmo a los datos | Archivo serializado |
La IA designa un objetivo, el Machine Learning un enfoque entre otros para alcanzarlo. Un sistema experto basado en reglas pertenece a la IA sin pertenecer al Machine Learning.
Formulación correcta: «El Machine Learning es un enfoque de la inteligencia artificial basado en la inducción a partir de datos.»
El rendimiento relativo depende de la naturaleza de los datos. En datos tabulares, los métodos de ensamble basados en árboles siguen siendo muy competitivos, con un coste computacional y una opacidad claramente menores.
Formulación correcta: «La elección entre Deep Learning y métodos clásicos se determina por la naturaleza de los datos, el volumen disponible, las restricciones de interpretabilidad y el presupuesto computacional.»
El volumen necesario depende de la complejidad del fenómeno modelado y del número de variables explicativas, no de un umbral absoluto. Numerosos modelos en producción se apoyan en unos pocos miles de observaciones.
Formulación correcta: «La calidad y la representatividad de los datos priman sobre el volumen bruto.»
El Deep Learning es una clase de modelos. Una red neuronal entrenada con datos etiquetados pertenece al aprendizaje supervisado; un autoencoder pertenece al aprendizaje no supervisado; una red optimizada por recompensa pertenece al refuerzo.
Un modelo estadístico identifica regularidades en una representación numérica. No dispone de ninguna representación semántica del dominio.
Consecuencia operativa: los modos de fallo de un modelo no coinciden con los de un operador humano. Un modelo puede fallar en casos triviales para un humano, y a la vez tener éxito en casos difíciles. Esta asimetría debe anticiparse en el diseño de las salvaguardas.
TAXONOMÍA
Deep Learning ⊂ Machine Learning ⊂ Inteligencia Artificial
NATURALEZA DE LOS CONCEPTOS
IA : un objetivo
Machine Learning: un enfoque basado en la inducción
Deep Learning : una clase de modelos
CRITERIO DISCRIMINANTE DEL MACHINE LEARNING
Las reglas se inducen a partir de observaciones,
no las especifica un diseñador.
CRITERIO DISCRIMINANTE DEL DEEP LEARNING
Las representaciones intermedias se aprenden,
no se diseñan manualmente.
NIVELES ANALÍTICOS
Descriptivo → Diagnóstico → PREDICTIVO → Prescriptivo
El aprendizaje supervisado opera en el nivel predictivo.
DEFINICIÓN DE REFERENCIA (Mitchell, 1997)
Un programa aprende de una experiencia E con respecto a una tarea T
y una medida de rendimiento P si su rendimiento en T, medido
por P, mejora con E.Enunciado de síntesis
El Machine Learning consiste en inducir una regla de decisión a partir de observaciones en lugar de especificarla explícitamente; el aprendizaje supervisado es el paradigma en el que las observaciones van acompañadas del valor objetivo a predecir.
Quiz y preguntas de entrevista: 001.1-quiz-ia-ml-deep-learning.md
Capítulo siguiente: 002-programmation-classique-vs-ml.md