Los tres paradigmas de aprendizaje

36 min
Bloque 0 — Situar el aprendizaje supervisado
Objetivo
saber determinar, ante un problema cualquiera, el paradigma de aprendizaje al que pertenece; conocer la definición rigurosa de los tres paradigmas y de sus subfamilias; saber justificar esa clasificación mediante un criterio único y defendible.
Duración estimada
35 minutos
Requisitos previos
capítulos 001 y 002
Quiz asociados
003.1-quiz-critere-classement.md a 003.6-quiz-qualification-probleme.md

1. El criterio de clasificación: la naturaleza de la señal de aprendizaje

El capítulo 002 estableció la inversión propia del Machine Learning: las reglas ya no se escriben, se inducen a partir de observaciones. Esta inducción supone que una señal orienta el aprendizaje, es decir, que una información indica al algoritmo en qué dirección corregir sus parámetros.

La naturaleza de esta señal constituye el único criterio de clasificación de los paradigmas. Se determina mediante una pregunta única:

«¿Se dispone, para las observaciones pasadas, del valor que se busca predecir?»

1.1 Las tres respuestas posibles

Respuesta a la preguntaSeñal disponibleParadigmaFormulación del problema
— cada observación histórica lleva el valor objetivoUn valor objetivo conocido, observación por observaciónAprendizaje supervisadoReproducir en casos inéditos la asociación entrada-salida observada
No — ningún valor objetivo está disponibleNinguna señal externa; solo la estructura interna de los datos es explotableAprendizaje no supervisadoPoner de manifiesto una organización latente de las observaciones
No, pero — existe una evaluación diferida de las accionesUn escalar de recompensa emitido por el entorno después de cada acciónAprendizaje por refuerzoDeterminar una estrategia de acción que maximice la recompensa acumulada

Estas tres respuestas son exhaustivas y mutuamente excluyentes para un problema correctamente formulado. Un problema que parece pertenecer a dos paradigmas es un problema cuya formulación no se ha cerrado: la cuestión a resolver es entonces «cuál es la variable objetivo», no «cuál es el paradigma».

DEFINICIÓN — Señal de aprendizaje y paradigma de aprendizaje

Señal de aprendizaje — definición rigurosa

Información explotada por un algoritmo para evaluar la calidad de la hipótesis actual y derivar de ella una dirección de corrección de sus parámetros. Toma la forma de un valor objetivo asociado a cada observación, de un criterio interno de coherencia definido solo sobre los datos, o de un escalar de recompensa emitido por un entorno en respuesta a una acción.

Paradigma de aprendizaje — definición rigurosa

Clase de problemas definida por la naturaleza de la señal disponible y, por consiguiente, por la forma del problema de optimización planteado: minimización de un riesgo empírico sobre pares etiquetados, optimización de un criterio interno de estructura, o maximización de una esperanza de recompensa acumulada.

Traducción al lenguaje corriente

La señal es lo que permite al algoritmo saber si se equivoca; el paradigma es la familia de problemas definida por aquello de lo que se dispone para aprender.

Punto de vigilancia

En ausencia de toda señal, no hay aprendizaje en el sentido de Mitchell (1997): sin medida de rendimiento P, ninguna experiencia E puede mejorar nada.

1.2 Taxonomía completa

Las ramas resaltadas delimitan el perímetro de este curso. Las demás se definen aquí para permitir el posicionamiento, sin ser profundizadas.

1.3 Lo que no constituye un criterio de clasificación

La confusión más costosa, tanto en el encuadre de proyecto como en entrevista, consiste en clasificar un problema según un criterio que no lo es.

Criterio invocado erróneamenteContraejemplo inmediato
El dominio de aplicaciónLa salud da lugar a supervisado (diagnóstico sobre casos etiquetados), no supervisado (tipología de pacientes) y refuerzo (dosificación adaptativa)
El tipo de datosUna imagen alimenta tanto una clasificación supervisada como un agrupamiento no supervisado de fotografías
La arquitectura del modeloUna red profunda puede ser supervisada, no supervisada (autoencoder) o de refuerzo
La finalidad de negocio«Comprender a nuestros clientes» se traduce indistintamente en una segmentación o en una predicción de abandono

Principio director: el paradigma se lee en los datos disponibles, no en el tema tratado, ni en la herramienta elegida, ni en la ambición del solicitante.


2. El aprendizaje supervisado

2.1 Definición

DEFINICIÓN — Aprendizaje supervisado (supervised learning)

Definición rigurosa

Sea un espacio de entrada X y un espacio de salida Y. Se dispone de una muestra de aprendizaje de n pares

S = { (x_1, y_1), ..., (x_n, y_n) },  x_i ∈ X,  y_i ∈ Y

supuestamente procedentes de un muestreo independiente e idénticamente distribuido según una ley conjunta P(X, Y) desconocida y fija. El aprendizaje supervisado consiste en seleccionar, dentro de una clase de hipótesis H, una función f: X → Y que minimice el riesgo esperado R(f) = E[ L(f(X), Y) ], donde L es una función de pérdida que mide la desviación entre valor predicho y valor observado. Al ser la ley P desconocida, el algoritmo minimiza en la práctica el riesgo empírico calculado sobre S, bajo restricción de regularización.

Traducción al lenguaje corriente

Se proporcionan ejemplos cuya respuesta correcta es conocida, y se pide al algoritmo que construya la función que mejor reproduce esa correspondencia, para aplicarla a casos cuya respuesta es desconocida.

El término «supervisado»

Remite a la presencia de un supervisor —operador, proceso u observación posterior— que ha proporcionado el valor correcto para cada ejemplo, durante la constitución del conjunto de datos y nunca durante el entrenamiento.

Punto de vigilancia

La hipótesis de distribución fija es estructurante. Cuando P(X, Y) evoluciona entre el entrenamiento y la explotación, el riesgo empírico deja de estimar el riesgo esperado y el rendimiento se degrada: fenómeno tratado en el capítulo 082.

DEFINICIÓN — Dato etiquetado (labeled data)

Definición rigurosa

Observación para la cual el valor de la variable objetivo está informado, además de las variables explicativas, estando ese valor definido de manera unívoca y homogénea en el conjunto de los datos.

Traducción al lenguaje corriente

Una fila de la tabla para la cual la respuesta ya es conocida.

Procedencia de las etiquetas

Observación diferida (el crédito fue reembolsado o no), anotación humana (un radiólogo califica una placa), registro del sistema (el cliente canceló) o medida física (la pieza se rompió a las 412 horas).

Punto de vigilancia

El coste de obtención de las etiquetas es con frecuencia el factor limitante de un proyecto supervisado: las variables explicativas son abundantes, las etiquetas raramente lo son.

2.2 El esquema del aprendizaje supervisado

La etiqueta está presente en el entrenamiento y ausente en la explotación. Un dispositivo en el que estuviera disponible en el momento de la predicción no tendría ninguna utilidad predictiva.

2.3 Las dos subfamilias

El tipo de la variable objetivo determina la subfamilia.

ClasificaciónRegresión
Naturaleza del objetivoCategórica: conjunto finito de modalidadesNumérica continua
Pregunta planteada«¿A qué clase pertenece esta observación?»«¿Qué valor toma esta magnitud?»
Salida del modeloUna clase, generalmente acompañada de una probabilidadUn número real
Ejemplo de objetivoImpago: sí / noPrecio de venta: 412 500 $
Métricas habitualesExactitud, precisión, recall, F1, AUCRMSE, MAE, MAPE, R²
Algoritmos representativosRegresión logística, árboles, bosques aleatorios, gradient boosting, SVMRegresión lineal, regresión regularizada, árboles de regresión, gradient boosting
Noción de errorDiscreta: la clase es correcta o noContinua: el error posee una amplitud
DEFINICIÓN — Clasificación

Definición rigurosa

Problema de aprendizaje supervisado en el que el espacio de salida Y es un conjunto finito de modalidades { c1c_1, ..., ckc_k }. El modelo estima generalmente la probabilidad condicional P(Y = cjc_j | X = x), resultando la clase predicha de la aplicación de una regla de decisión a ese vector de probabilidades.

Traducción al lenguaje corriente

Colocar cada observación en una de las categorías previstas de antemano.

Subtipos: binaria (2 modalidades excluyentes), multiclase (k modalidades excluyentes), multietiqueta (k modalidades acumulables), ordinal (k modalidades ordenadas, por ejemplo una calificación de riesgo de A a E).

Punto de vigilancia

Las modalidades se definen antes del entrenamiento y forman parte de la especificación del problema. Un modelo de clasificación no puede producir una clase que nunca ha encontrado.

DEFINICIÓN — Regresión, y advertencia terminológica

Definición rigurosa

Problema de aprendizaje supervisado en el que el espacio de salida Y es un subconjunto de los reales. El modelo estima una función de regresión, la mayoría de las veces la esperanza condicional E[Y | X = x], mediante minimización de una pérdida cuadrática o absoluta.

Traducción al lenguaje corriente

Estimar un número en lugar de una categoría.

Advertencia terminológica

La palabra «regresión» no conlleva, en su uso moderno, ningún sentido de retroceso o de vuelta atrás. Se hereda de los trabajos de Francis Galton (1886) sobre la transmisión de la estatura entre generaciones, que describían una regresión hacia la media: los hijos de padres de estatura muy alta tendían a ser, en promedio, menos altos que sus padres. El término designaba un fenómeno estadístico particular; luego se extendió al método de ajuste empleado para ponerlo de manifiesto, y después a toda predicción de una magnitud numérica. Por tanto, no debe extraerse ninguna inferencia de la palabra misma: «regresión» significa únicamente que el objetivo es un número.

Confusión que no hay que cometer

La regresión logística es un algoritmo de clasificación, a pesar de su nombre: regresa el logaritmo de la razón de probabilidades (odds) sobre las variables explicativas y produce una probabilidad de pertenencia a una clase.

2.4 Quince casos de uso empresariales

#DominioProblema de negocioTipoVariable objetivo
1BancaConcesión de crédito al consumoClasificación binariaImpago a 12 meses: sí / no
2BancaDetección de fraude en transacción con tarjetaClasificación binaria desequilibradaTransacción fraudulenta: sí / no
3BancaEstimación de la pérdida en caso de impagoRegresiónImporte no recuperado, en dólares
4SaludApoyo al diagnóstico en imagen médicaClasificación multiclasePatología identificada entre k categorías
5SaludAnticipación de los reingresosClasificación binariaReingreso en los 30 días: sí / no
6InmobiliarioEstimación del valor de un inmuebleRegresiónPrecio de venta efectivo, en dólares
7Recursos humanosPrevención de la salida voluntariaClasificación binariaRenuncia en los 6 meses: sí / no
8Recursos humanosEstimación de la duración de la contrataciónRegresiónDías entre publicación y firma
9Industria / IoTMantenimiento predictivoClasificación binariaAvería en los 7 días: sí / no
10Industria / IoTVida útil residual de un equipoRegresiónHoras de funcionamiento antes del fallo
11MarketingPrevisión del abandono (churn)Clasificación binariaCancelación en los 90 días: sí / no
12MarketingValor de vida del clienteRegresiónMargen acumulado esperado a 24 meses, en dólares
13TransporteEstimación de la duración del trayectoRegresiónDuración efectiva, en minutos
14CiberseguridadFiltrado de correos de phishingClasificación binariaCorreo malicioso: sí / no
15EnergíaPrevisión de carga de la redRegresiónConsumo a H+24, en megavatios

Lectura de la tabla: en los quince casos, un dato histórico lleva la respuesta. El crédito fue reembolsado o no, el inmueble se vendió a un precio constatado, la pieza se rompió a una hora medida. Es esta disponibilidad retrospectiva del objetivo la que hace supervisado el problema, no la intención de predecir. La calificación técnica del caso 7 no prejuzga por otra parte en nada su licitud: las obligaciones de no discriminación se tratan en el capítulo 095.

2.5 La analogía del aprendizaje con solucionario

ANALOGÍA — El aprendizaje con solucionario

Un alumno prepara un examen a partir de exámenes de años anteriores. Cada examen incluye un enunciado y una solución. El alumno resuelve el enunciado, compara su producción con la solución, identifica la desviación, ajusta su método. Después de un número suficiente de ejercicios, afronta un tema inédito cuya solución aún no existe.

Situación pedagógicaAprendizaje supervisadoNotación
El enunciado del ejercicioLas variables explicativas de una observaciónxix_i
La solución del ejercicioLa etiqueta, valor objetivo conocidoyiy_i
La colección de exámenes anterioresEl conjunto de entrenamientoS
El método de resolución del alumnoLa función aprendidaf
La desviación entre producción y soluciónLa pérdida sobre una observaciónL(f(xix_i), yiy_i)
La revisión del métodoLa actualización de los parámetrosoptimización
El simulacro de examenEl conjunto de validación
El examen final, tema inéditoEl conjunto de test, luego la producción
La nota obtenida en el examen finalEl rendimiento en generalizaciónR(f)

Prolongaciones

El alumno que memoriza las soluciones sin adquirir el método aprueba los exámenes anteriores y fracasa en el tema inédito: es el sobreajuste (overfitting), tratado en el capítulo 040. El alumno que dispone de la solución durante el examen obtiene una nota excelente que no mide nada: es la fuga de datos, tratada en el capítulo 028.

Límite de la analogía

El alumno comprende lo que hace y transpone a un dominio vecino. El modelo solo establece una correspondencia estadística y no transpone fuera del dominio cubierto por sus datos de entrenamiento.


3. El aprendizaje no supervisado

3.1 Definición

DEFINICIÓN — Aprendizaje no supervisado (unsupervised learning)

Definición rigurosa

Clase de problemas en los que se dispone de una muestra { x1x_1, ..., xnx_n }, xix_i ∈ X, sin variable objetivo asociada. El objetivo es estimar una estructura de la distribución P(X): partición del espacio de las observaciones, subvariedad de baja dimensión que aproxima la nube de puntos, densidad, o regularidades de coocurrencia. La optimización recae sobre un criterio definido exclusivamente a partir de los datos, sin referencia a un valor esperado.

Traducción al lenguaje corriente

Se proporcionan observaciones sin ninguna respuesta asociada y se pide al algoritmo que haga aparecer la organización interna de esos datos.

El término «no supervisado»

Indica la ausencia de respuesta de referencia, no la ausencia de intervención humana: la elección de las variables, de la distancia, del número de grupos y de la normalización corresponde enteramente al analista.

Punto de vigilancia

Un algoritmo no supervisado siempre produce un resultado, incluso cuando los datos no contienen ninguna estructura: una partición en cuatro grupos devolverá cuatro grupos sobre una nube perfectamente uniforme. La producción de un resultado nunca atestigua, por tanto, la existencia de una estructura.

3.2 Las dos grandes familias

DEFINICIÓN — Clustering (partición, segmentación)

Definición rigurosa

Problema que consiste en construir una partición o un recubrimiento de un conjunto de observaciones en grupos tales que una medida de similitud intragrupo sea máxima y la similitud intergrupos mínima, en el sentido de una distancia especificada por el analista. Un método de partición por inercia minimiza así la suma de los cuadrados de las desviaciones internas:

argmin  Σ      Σ      || x - μ_j ||²
   C   j=1..k  x ∈ C_j

donde μj\mu_j designa el centro del grupo CjC_j.

Traducción al lenguaje corriente

Agrupar las observaciones que se parecen, sin saber de antemano qué grupos existen ni cuántos hay.

Parámetros a cargo del analista

Número de grupos, medida de distancia, normalización, selección de las variables. Cada una de estas elecciones modifica el resultado; no existe una partición «verdadera» que un algoritmo descubriría independientemente de ellas.

Punto de vigilancia

Los grupos producidos no tienen nombre. Su denominación y su interpretación son un acto de negocio posterior al algoritmo, nunca una salida de este.

DEFINICIÓN — Reducción de dimensión (dimensionality reduction)

Definición rigurosa

Problema que consiste en construir una aplicación g: X → Z, con dim(Z) < dim(X), que preserve lo mejor posible una propiedad de la distribución de origen: varianza explicada para el análisis de componentes principales, estructura de vecindad local para los métodos de embedding no lineal, capacidad de reconstrucción para los autoencoders. El criterio optimizado es interno a los datos.

Traducción al lenguaje corriente

Representar las mismas observaciones con menos variables, perdiendo la menor información posible.

Finalidades operativas: visualización, compresión, eliminación de ruido, preprocesamiento de un modelo supervisado, atenuación de la maldición de la dimensionalidad.

Punto de vigilancia

Empleada antes de un modelo supervisado, la reducción de dimensión debe ajustarse únicamente sobre los datos de entrenamiento y luego aplicarse tal cual a los datos de validación y de test. Ajustarla sobre el conjunto de los datos constituye una fuga de datos, tratada en el capítulo 028.

3.3 Ejemplo con cifras: segmentación de una base de clientes

Una cadena de distribución dispone de 12 000 clientes activos. No existe ninguna variable objetivo: la dirección no pide predecir un comportamiento, sino comprender la estructura de su base. Se retienen cuatro variables —frecuencia de compra anual, cesta media, antigüedad, proporción de compras en línea— y se aplica una partición en cuatro grupos tras normalización.

Salida bruta del algoritmo

GrupoEfectivoProporciónFrecuencia anualCesta mediaAntigüedadProporción en línea
Grupo 14 32036 %1,2 compras38 $8 meses22 %
Grupo 23 60030 %11,4 compras42 $5,2 años15 %
Grupo 32 88024 %4,1 compras187 $3,4 años71 %
Grupo 41 20010 %0,4 compras25 $6,1 años5 %

Los identificadores numéricos carecen de sentido: «Grupo 1» no significa nada y no está ordenado con respecto a «Grupo 2».

Interpretación de negocio, posterior al algoritmo

GrupoDenominación adoptada por el negocioLecturaAcción prevista
Grupo 1Nuevos clientes ocasionalesAntigüedad baja, compromiso bajoRecorrido de activación en los 6 primeros meses
Grupo 2Habituales de proximidadFrecuencia alta, cesta baja, canal físicoPrograma de fidelización, aumento de la cesta
Grupo 3Compradores de cesta alta en líneaCesta cuatro veces superior, canal digitalOferta premium, servicio de entrega dedicado
Grupo 4Clientes durmientesAntigüedad alta, actividad casi nulaCampaña de reactivación o salida del fichero activo

Punto determinante: la segunda columna no fue producida por el algoritmo. Fue formulada por responsables de negocio que examinaron las características estadísticas de cada grupo. Un algoritmo de clustering delimita grupos; no los nombra ni los explica.

3.4 La ausencia de verdad de referencia

Es la diferencia estructural más importante con el aprendizaje supervisado. Cada predicción supervisada puede confrontarse con el valor observado: la exactitud es medible. En no supervisado, no existe ninguna partición de referencia, y la pregunta «¿esta segmentación es exacta?» está mal planteada. La evaluación se apoya entonces en dos órdenes de criterios.

Orden de criterioNaturalezaEjemplosLímite
Criterios internosEstadístico, calculado solo sobre los datosCoeficiente de silueta, inercia intraclase, índices de Davies-Bouldin y de Calinski-HarabaszUna puntuación alta no atestigua la pertinencia de negocio
Criterios de utilidad de negocioOperativo, evaluado por los responsables del dominioGrupos interpretables, accionables, de tamaño explotable, estables en el tiempoSubjetividad, dependencia de la experiencia disponible

Punto de vigilancia: una segmentación con un coeficiente de silueta excelente pero cuyos grupos no requieren ninguna acción es un fracaso operativo; una partición con una puntuación interna mediocre cuyos grupos requieren acciones diferenciadas y medibles es un éxito. El criterio final es la utilidad.

Consecuencia sobre la conducción del proyecto: un proyecto no supervisado no puede pilotarse mediante un umbral contractual del tipo «al menos 90 % de exactitud», sino mediante una revisión de interpretabilidad que involucre al negocio.

3.5 Aplicaciones reales

DominioAplicaciónSubfamiliaSalida explotada
DistribuciónSegmentación de la base de clientesClusteringGrupos homogéneos para segmentación diferenciada
ComercioAnálisis de la cesta de compraReglas de asociaciónProductos frecuentemente comprados juntos
SegurosTipología de perfiles de siniestralidadClusteringGrupos que sirven de base a una tarificación
BioinformáticaAgrupamiento de perfiles de expresión génicaClusteringSubtipos moleculares candidatos
IndustriaCompresión de señales de sensoresReducción de dimensiónRepresentación compacta para supervisión
DocumentaciónAgrupamiento temático de corpusClusteringFamilias de documentos sin nomenclatura previa
CiberseguridadDetección de comportamientos atípicosDetección de anomalíasAlertas a calificar por un analista
MarketingReducción de un cuestionario a sus ejes principalesReducción de dimensiónFactores sintéticos de actitud

Observación profesional: el aprendizaje no supervisado interviene más a menudo en las fases previas de un proyecto supervisado, a título de exploración, que en producción autónoma. Una segmentación puede, por otra parte, convertirse en una variable explicativa de un modelo supervisado posterior.


4. El aprendizaje por refuerzo

4.1 Definición

DEFINICIÓN — Aprendizaje por refuerzo (reinforcement learning)

Definición rigurosa

Marco de aprendizaje en el que un agente interactúa secuencialmente con un entorno. En cada paso de tiempo t, el agente observa un estado sts_t, elige una acción ata_t según una política π, recibe una recompensa escalar rt+1r_{t+1} y observa un nuevo estado st+1s_{t+1}. El problema se formaliza la mayoría de las veces como un proceso de decisión de Markov (S, A, P, R, γ), con γ ∈ [0, 1[ el factor de descuento. El objetivo es determinar una política π que maximice la esperanza de la ganancia acumulada descontada:

J(\pi) = \mathbb{E}\left[ \sum_{t \ge 0} \gamma^{t} \, $$r_{t+1}$$ \right]

Referencia de síntesis: Sutton y Barto, Reinforcement Learning: An Introduction (1998, segunda edición 2018).

Traducción al lenguaje corriente

El agente no aprende a partir de respuestas correctas proporcionadas de antemano sino por ensayos sucesivos: actúa, el entorno lo sanciona o lo recompensa, y ajusta su estrategia de modo que acumule la mayor recompensa posible.

Lo que distingue la recompensa de una etiqueta

La etiqueta indica la respuesta correcta, preexiste al entrenamiento y concierne a una observación aislada. La recompensa evalúa la respuesta producida, se genera durante la interacción, recae sobre una secuencia de acciones y depende de las acciones del propio modelo.

Punto de vigilancia

El carácter diferido de la recompensa genera el problema de asignación del mérito (credit assignment): cuando una recompensa sobreviene al término de centenares de acciones, determinar cuáles contribuyeron a ella constituye la dificultad central del paradigma.

4.2 El bucle agente-entorno

El ciclo se repite hasta un estado terminal o indefinidamente. La particularidad estructural del paradigma aparece aquí: los datos de aprendizaje son producidos por el propio agente. Una política mediocre genera trayectorias mediocres, de las que el agente debe no obstante aprender. De ahí el arbitraje entre exploración y explotación: una política que nunca explota no acumula ninguna recompensa, una política que nunca explora se fija en un óptimo local. Este arbitraje no tiene equivalente en aprendizaje supervisado, donde el conjunto de datos es fijo.

4.3 Vocabulario de referencia

Término españolTérmino inglésNotaciónDefiniciónEjemplo: robot de manipulación
AgenteAgentEntidad que decide y actúaEl controlador del robot
EntornoEnvironmentSistema con el que el agente interactúa, produciendo transiciones y recompensasEl almacén, sus estanterías, sus obstáculos
EstadoStatests_tDescripción de la situación en el instante t, suficiente para decidirPosición, carga transportada, nivel de batería
AcciónActionata_tDecisión tomada entre las disponiblesAvanzar, girar, agarrar, depositar
RecompensaRewardrt+1r_{t+1}Escalar emitido por el entorno que evalúa la transición+10 paquete depositado, -1 por segundo, -100 colisión
PolíticaPolicyπ(a|s)Regla que asocia a cada estado una acción o una distribución sobre las accionesLa estrategia de navegación aprendida

4.4 Aplicaciones

DominioAplicaciónNaturaleza de la recompensaMadurez
JuegosGo, ajedrez, videojuegosVictoria, puntuaciónDemostrada, referencias académicas mayores
RobóticaLocomoción, prensión, navegaciónProgresión hacia el objetivo, penalización por colisiónOperativa en entorno controlado
Centros de datosRegulación de la refrigeraciónAhorro de energía bajo restricción de temperaturaDespliegues industriales documentados
FinanzasEjecución de órdenes, asignación dinámicaRendimiento ajustado al riesgoUso real, fuertemente regulado
PublicidadAsignación de impresiones, bandits contextualesClic, conversiónMuy extendida en forma de bandits
LogísticaProgramación, gestión de inventarioCoste total, tasa de servicioEmergente, generalmente en simulación

Caso particular de los bandits multibrazo: forma simplificada de aprendizaje por refuerzo sin transición de estado, masivamente desplegada para la asignación de contenidos y las pruebas adaptativas, y principal exposición real de las organizaciones a este paradigma.

ANALOGÍA — La adquisición de una competencia motriz

Aprender a montar en bicicleta no procede de un solucionario: nadie puede proporcionar, para cada milisegundo, el valor exacto del ángulo del manillar y de la inclinación del torso. La consigna «mantén el equilibrio» no es una etiqueta. La señal disponible es una consecuencia: el aprendiz se mantiene en pie, o se cae. El vínculo entre el gesto erróneo y su consecuencia está diferido unos segundos.

Elemento de la situaciónCorrespondencia formal
El aprendiz ciclistaEl agente
La bicicleta, la carretera, la gravedadEl entorno
Inclinación, velocidad, posición del manillarEl estado sts_t
Corregir la trayectoria, pedalear, frenarLa acción ata_t
Metros recorridos sin caída, caídaLa recompensa rt+1r_{t+1}
Los reflejos adquiridosLa política π
Probar una trayectoria inhabitualLa exploración
Reproducir lo que funcionóLa explotación

Lo que la analogía pone de manifiesto

La competencia se adquiere por interacción y no por memorización de pares pregunta-respuesta: no puede transmitirse mediante una exposición, y su adquisición exige un gran número de ensayos, incluidos los infructuosos. Un niño se cae unas decenas de veces; un agente artificial requiere habitualmente millones de episodios. Cuando cada episodio tiene un coste material o humano, el entrenamiento en condiciones reales se vuelve impracticable —de ahí la exigencia de un simulador.

4.5 Los cuatro obstáculos a la adopción en la empresa

El aprendizaje por refuerzo ocupa un lugar considerable en la comunicación pública del dominio y un lugar marginal en las carteras de proyectos. Cuatro obstáculos explican esa brecha.

ObstáculoEnunciadoConsecuencia prácticaSituaciones en que el obstáculo se supera
1. Entorno simulable requeridoEl aprendizaje exige interacciones masivas, inaceptables sobre el sistema realHace falta un simulador fiel, cuya construcción es un proyecto por sí mismoJuegos, sistemas físicos bien modelados, colas de espera, entornos digitales
2. Coste computacionalEl número de episodios supera en varios órdenes de magnitud el volumen de un entrenamiento supervisadoPresupuesto de cálculo elevado, plazos largos, iteraciones lentasProblemas de baja dimensión, bandits, simulaciones poco costosas
3. Especificación de la recompensaTraducir un objetivo de negocio en un escalar es arriesgado: el agente optimiza exactamente lo que está escritoComportamientos degenerados que maximizan la medida sin servir a la intenciónObjetivos con medida directa y no eludible
4. Controlabilidad en producciónLa política explora, evoluciona y toma decisiones secuenciales difíciles de auditarDificultad de homologación, de trazabilidad y de garantía de comportamientoDominios de baja criticidad, o dispositivos acotados por reglas de seguridad externas

Desarrollo del obstáculo 3: los comportamientos degenerados

Una función de recompensa mal especificada lleva al agente a maximizar la medida en lugar del objetivo que representa. La literatura designa este fenómeno con el término reward hacking.

Objetivo perseguidoRecompensa escritaComportamiento degenerado posible
Limpiar una habitaciónCantidad de polvo recogidaEsparcir el polvo para recogerlo de nuevo
Terminar una carreraPuntos acumulados en el recorridoGirar en bucle sobre una zona de puntos sin cruzar la línea
Maximizar el compromisoDuración de la sesiónFavorecer los contenidos polarizantes en detrimento de la satisfacción
Reducir el plazo de tramitaciónExpedientes cerrados por horaCerrar los expedientes difíciles sin resolverlos
Evitar las colisionesPenalización en caso de contactoPermanecer inmóvil

El agente no optimiza la intención del diseñador, optimiza la función de recompensa; toda brecha entre ambas será explotada. Esta constatación coincide con la ley de Goodhart: cuando una medida se convierte en un objetivo, deja de ser una buena medida.

Punto de vigilancia sobre el obstáculo 4: un modelo supervisado produce una predicción puntual que un proceso de negocio puede filtrar antes de actuar; un agente de refuerzo produce una política de acción. El punto de control humano debe, por tanto, diseñarse explícitamente, en forma de restricciones de seguridad externas al aprendizaje.


5. Los paradigmas intermedios

La disponibilidad de la señal admite estados intermedios: etiquetas parciales, etiquetas fabricadas, etiquetas presentes pero muy raras. De ello se derivan tres configuraciones.

5.1 El aprendizaje semisupervisado

DEFINICIÓN — Aprendizaje semisupervisado (semi-supervised learning)

Definición rigurosa

Clase de problemas en los que la muestra reúne un subconjunto etiquetado SlS_l = { (xix_i, yiy_i) } de tamaño l y un subconjunto no etiquetado SuS_u = { xjx_j } de tamaño u, con generalmente u >> l. Los métodos explotan la distribución marginal P(X) estimada sobre SuS_u para restringir la estimación de P(Y | X) aprendida sobre SlS_l, bajo hipótesis de regularidad: continuidad, agrupamiento, variedad.

Traducción al lenguaje corriente

Se dispone de muchas observaciones y de pocas respuestas conocidas; la masa no etiquetada sirve para aprovechar mejor el pequeño número de etiquetas disponibles.

Punto de vigilancia

Las hipótesis de regularidad no siempre se satisfacen. Cuando no lo hacen, la adición de datos no etiquetados puede degradar el rendimiento con respecto a un modelo entrenado solo con los datos etiquetados.

Caso de estudio: la imagen médica

Un centro hospitalario dispone de 200 000 placas archivadas, de las cuales solo 2 000 están anotadas: la anotación moviliza a un radiólogo varios minutos por placa, y la anotación íntegra representaría varios años-persona. El enfoque supervisado estricto descarta el 99 % de la información disponible; el enfoque semisupervisado aprende la estructura del espacio de las imágenes sobre las 198 000 placas brutas y ajusta la regla de decisión sobre las 2 000 placas anotadas.

5.2 El aprendizaje autosupervisado

DEFINICIÓN — Aprendizaje autosupervisado (self-supervised learning)

Definición rigurosa

Clase de métodos en los que la variable objetivo se construye automáticamente a partir de la estructura interna de los datos, sin intervención de un anotador. Se define una tarea llamada pretexto de modo que su etiqueta sea deducible del dato bruto; el modelo se entrena en esa tarea mediante minimización de un riesgo empírico clásico, y luego la representación obtenida se reutiliza para la tarea objetivo.

Traducción al lenguaje corriente

El algoritmo fabrica por sí mismo sus ejercicios y sus soluciones a partir de los datos brutos, lo que elimina el coste de anotación.

Precisión determinante

La mecánica de aprendizaje sigue siendo estrictamente supervisada: existe un valor objetivo, una función de pérdida, una comparación entre predicción y objetivo. Solo cambia la procedencia de la etiqueta —extraída de los datos en lugar de ser proporcionada por un operador. El autosupervisado no es, por tanto, un cuarto paradigma, sino una modalidad de obtención de las etiquetas.

Punto de vigilancia

La calidad de la representación depende enteramente de la pertinencia de la tarea pretexto. Una tarea resoluble mediante un artefacto superficial produce una representación sin valor para la tarea objetivo.

Caso de estudio: el enmascaramiento de palabras

A partir de un corpus de texto bruto, no anotado, se construyen ejemplos de entrenamiento enmascarando palabras y pidiendo al modelo que las restituya.

EtapaContenido
Dato bruto«El tipo de interés de referencia fue elevado veinticinco puntos básicos.»
Ejemplo fabricado (entrada)«El tipo de interés de referencia fue [MÁSCARA] veinticinco puntos básicos.»
Etiqueta fabricada (objetivo)«elevado»
Coste de anotaciónNulo: la etiqueta es la palabra retirada

Este mecanismo, popularizado por las arquitecturas de tipo BERT (Devlin et al., 2018) y luego generalizado por los modelos de lenguaje autorregresivos, permite explotar corpus de muy gran tamaño sin anotación humana. La representación obtenida se especializa después en una tarea supervisada que dispone de pocas etiquetas.

5.3 La detección de anomalías

DEFINICIÓN — Detección de anomalías (anomaly detection)

Definición rigurosa

Problema que consiste en identificar las observaciones cuya generación es improbable con respecto a la distribución de las observaciones llamadas normales. Según la disponibilidad de ejemplos de anomalías etiquetados, se formula como una clasificación supervisada fuertemente desequilibrada, como una estimación de densidad o de soporte no supervisada, o como una clasificación de una clase.

Traducción al lenguaje corriente

Detectar lo que se sale de lo ordinario, se disponga o no de ejemplos de casos anormales.

Posición taxonómica

La detección de anomalías se sitúa a caballo entre dos paradigmas. No constituye una familia adicional: designa una finalidad de negocio tratable en uno u otro paradigma según los datos disponibles.

Configuración de los datosParadigma aplicableMétodos habitualesEvaluación
Histórico de anomalías confirmadas y etiquetadas, en muy baja proporciónSupervisado, en régimen de fuerte desequilibrioGradient boosting, bosques aleatorios con remuestreo o ponderaciónRecall, precisión, área bajo la curva precisión-recall
Ninguna anomalía etiquetada, o anomalías futuras distintas de las anomalías pasadasNo supervisadoIsolation Forest, estimación de densidad, SVM de una clase, autoencoderCriterios internos, tasa de alerta, calificación por un experto
Algunas anomalías etiquetadas y una masa de observaciones no calificadasSemisupervisadoModelado de la normalidad, luego calibración del umbral sobre los casos etiquetadosPrecisión sobre los casos confirmados, coste de los falsos positivos

Criterio de elección práctico

Si las anomalías a detectar se parecen a las ya observadas y etiquetadas, el problema es supervisado. Si las anomalías a detectar son desconocidas por naturaleza, el problema es no supervisado.

En detección de fraude bancario, los esquemas conocidos se tratan en supervisado, con las técnicas de gestión del desequilibrio tratadas en el capítulo 050; los esquemas nuevos escapan por construcción a un modelo entrenado sobre el pasado y pertenecen a un enfoque no supervisado. Los dispositivos en producción combinan frecuentemente ambos.


6. Método de calificación de un problema

6.1 Árbol de decisión

Lectura de la rama «Encuadre a retomar»: la ausencia de etiquetas no descalifica el proyecto, desplaza su primera etapa. La pregunta se convierte en «cómo constituir un conjunto etiquetado» —anotación, recolección prospectiva, explotación de un registro del sistema— o «qué objetivo no supervisado asumir».

6.2 Tabla comparativa de los tres paradigmas

CriterioSupervisadoNo supervisadoRefuerzo
EtiquetasRequeridas para cada observación de entrenamientoNingunaNinguna; sustituidas por una señal de recompensa
Pregunta planteada«¿Cuál es el valor de Y para esta observación?»«¿Qué organización estructura estas observaciones?»«¿Qué secuencia de acciones maximiza la ganancia acumulada?»
AnalogíaEl aprendizaje con solucionarioLa clasificación de objetos sin nomenclatura previaLa adquisición de una competencia motriz
Medida de exactitudDirecta: comparación entre predicción y valor observadoImposible en sentido estricto: ninguna verdad de referenciaIndirecta: recompensa acumulada sobre episodios
SubtiposClasificación, regresiónClustering, reducción de dimensión, reglas de asociaciónMétodos basados en el valor, en la política, bandits
Algoritmos típicosRegresión lineal y logística, árboles, bosques aleatorios, gradient boosting, SVM, redes neuronalesk-means, clasificación jerárquica, DBSCAN, PCA, UMAP, autoencodersQ-learning, SARSA, gradientes de política, actor-crítico
Frecuencia en la empresaPreponderante: la gran mayoría de los modelos en producciónSignificativa, principalmente en exploración y en preparaciónMarginal fuera de I+D, con la notable excepción de los bandits
EjemploPredecir la cancelación de un cliente a 90 díasSegmentar la base de clientes en grupos homogéneosOptimizar una política de gestión de inventario en simulación
Cobertura por este cursoObjeto central, del capítulo 004 hasta el finalPosicionado aquí, no profundizadoPosicionado aquí, no profundizado

6.3 Distinguir clasificación y clustering

Los dos procedimientos producen grupos; la semejanza termina ahí. La confusión entre ambos es una de las más frecuentes en entrevista.

Punto de comparaciónClasificaciónClustering
ParadigmaSupervisadoNo supervisado
¿Los grupos existen antes del análisis?Sí, forman parte de la especificaciónNo, resultan del cálculo
Número de gruposFijado por el problema de negocioElegido por el analista, a menudo por exploración
¿Los grupos tienen nombre?Sí, un sentido de negocio definido a prioriNo, identificadores arbitrarios a interpretar
Datos requeridosObservaciones etiquetadasSolo observaciones
Pregunta planteada«¿Esta observación pertenece a la clase A o B?»«¿Qué grupos emergen de estas observaciones?»
EvaluaciónExactitud, recall, precisión, F1, AUCSilueta, inercia, utilidad de negocio
Estabilidad del sentidoEstable: las clases no cambianInestable: otra inicialización u otro k modifica los grupos
EjemploAsignar un correo a «spam» o «legítimo»Descubrir cuatro perfiles en una base de clientes
Formulación de negocio desencadenante«Sabemos lo que buscamos»«Queremos saber qué hay»

Test de discriminación en una pregunta: ¿la lista de los grupos figura en el pliego de condiciones? Si sí, se trata de clasificación; si no, de clustering.


7. Errores de razonamiento frecuentes

ERROR — Creer que se hace aprendizaje supervisado sin disponer de etiquetas

Un departamento de marketing solicita un modelo que prediga «los clientes de alto potencial». Ninguna variable con ese nombre existe en el sistema de información: la intención de predecir no basta para crear un problema supervisado. Son posibles dos salidas, y solo una debe elegirse explícitamente: definir un objetivo medible y verificable en el histórico —por ejemplo «facturación de los 12 meses siguientes superior a 5 000 $»— o asumir un enfoque exploratorio no supervisado que produzca grupos a interpretar.

Formulación correcta: «Un problema supervisado requiere una variable objetivo definida, medible y presente en el histórico. Mientras no esté constituida, no hay problema supervisado.»

ERROR — Confundir clustering y clasificación

Ambos producen grupos, lo que basta para alimentar la confusión. El criterio discriminante no es la salida sino la entrada: ¿las clases preexisten en los datos de entrenamiento? Se observa regularmente una consecuencia: un clustering presentado como un modelo predictivo, acompañado de una supuesta medida de exactitud, la cual carece de objeto en ausencia de partición de referencia.

Formulación correcta: «La clasificación asigna una observación a clases definidas previamente y aprendidas sobre ejemplos etiquetados; el clustering constituye grupos a partir únicamente de las similitudes, sin clases preexistentes ni exactitud medible.»

ERROR — Considerar el aprendizaje no supervisado como más simple

La ausencia de etiquetas aligera la recolección y da la impresión de un problema menos exigente. Es lo contrario en el plano de la validación: sin verdad de referencia, el proyecto se ve privado de criterio objetivo de parada, y el número de grupos, la distancia y la normalización corresponden a elecciones que ninguna métrica resuelve. Un proyecto supervisado concluye con un rendimiento cuantificado sobre un conjunto de test; un proyecto no supervisado, con una decisión de aceptación de negocio.

Formulación correcta: «El aprendizaje no supervisado es menos exigente en datos etiquetados y más exigente en interpretación: su dificultad se desplaza de la recolección a la validación.»

ERROR — Tratar el Deep Learning como un cuarto paradigma

La enumeración «supervisado, no supervisado, refuerzo, Deep Learning» mezcla dos planos de clasificación. Los tres primeros términos designan paradigmas, definidos por la naturaleza de la señal de aprendizaje; el cuarto designa una clase de modelos, definida por una arquitectura. Una red neuronal entrenada con imágenes etiquetadas pertenece al supervisado, un autoencoder al no supervisado, una red que optimiza una política mediante recompensa al refuerzo.

Formulación correcta: «El Deep Learning es una clase de modelos movilizable en los tres paradigmas; se sitúa en otro plano de clasificación.»

ERROR — Utilizar como etiqueta una variable posterior al instante de predicción

Para predecir el abandono a 90 días, un equipo retiene como variable explicativa el número de llamadas al servicio de cancelación. El rendimiento es excelente en validación y nulo en producción: en el momento en que la predicción debe producirse, esa llamada aún no ha tenido lugar. La variable no es predictiva, es constitutiva del evento a predecir. Esta forma de fuga de datos, tratada en el capítulo 028, no es detectable por las métricas: las mejora.

Regla de control: para cada variable explicativa, verificar que su valor estaría efectivamente disponible en el instante en que el modelo será consultado en producción.

Formulación correcta: «La etiqueta es posterior a las variables explicativas; toda información contemporánea o posterior a la realización del objetivo debe excluirse del conjunto de entrenamiento.»

ERROR — Deducir el paradigma del dominio de aplicación

«La salud es supervisado» o «el marketing es clustering» son enunciados sin fundamento. La salud da lugar a la predicción de un reingreso (supervisado), a la identificación de subgrupos de pacientes (no supervisado) y a la adaptación secuencial de un protocolo de dosificación (refuerzo). El marketing da lugar a la predicción de una cancelación, a una segmentación y a la asignación dinámica de ofertas mediante bandits.

Formulación correcta: «El paradigma se determina por la naturaleza de la señal de aprendizaje disponible, nunca por el sector de actividad.»


8. Síntesis

EL CRITERIO ÚNICO
    « ¿Se dispone, para las observaciones pasadas,
      del valor que se busca predecir? »

    Sí ...................................... SUPERVISADO
    No ...................................... NO SUPERVISADO
    No, pero hay disponible una evaluación
    diferida de las acciones ................ REFUERZO

SUBFAMILIAS
    Supervisado    : clasificación (objetivo categórico)
                     regresión     (objetivo numérico)
    No supervisado : clustering, reducción de dimensión,
                     reglas de asociación
    Refuerzo       : métodos basados en el valor o en la política

CONFIGURACIONES INTERMEDIAS
    Semisupervisado : solo una fracción de las observaciones está etiquetada
    Autosupervisado : etiquetas fabricadas a partir de los datos ;
                      la mecánica sigue siendo supervisada
    Anomalías       : supervisado si las anomalías pasadas están etiquetadas,
                      no supervisado si son desconocidas por naturaleza

LO QUE NO ES UN CRITERIO DE CLASIFICACIÓN
    el dominio, el tipo de datos, el volumen,
    la arquitectura del modelo, la finalidad declarada

DISTINCIÓN QUE NUNCA HAY QUE PERDER
    Clasificación : los grupos existen antes del análisis
    Clustering    : los grupos resultan del análisis

LO QUE MIDE CADA PARADIGMA
    Supervisado    : una exactitud, por comparación con el valor observado
    No supervisado : una cohesión interna y una utilidad de negocio
    Refuerzo       : una recompensa acumulada sobre episodios

POSICIÓN DEL DEEP LEARNING
    Clase de modelos movilizable en los tres paradigmas.
    No es un cuarto paradigma.

Enunciado de síntesis

Los paradigmas de aprendizaje se distinguen por la naturaleza de la señal disponible y por nada más: un valor objetivo conocido observación por observación define el aprendizaje supervisado, la sola estructura interna de los datos define el aprendizaje no supervisado, una recompensa diferida emitida por un entorno define el aprendizaje por refuerzo; el dominio, el volumen y la arquitectura del modelo no tienen efecto sobre esta clasificación.


Quiz asociados: 003.1-quiz-critere-classement.md, 003.2-quiz-apprentissage-supervise.md, 003.3-quiz-apprentissage-non-supervise.md, 003.4-quiz-apprentissage-renforcement.md, 003.5-quiz-paradigmes-intermediaires.md, 003.6-quiz-qualification-probleme.md

Capítulo siguiente: 004-apprentissage-supervise.md