El capítulo 002 estableció la inversión propia del Machine Learning: las reglas ya no se escriben, se inducen a partir de observaciones. Esta inducción supone que una señal orienta el aprendizaje, es decir, que una información indica al algoritmo en qué dirección corregir sus parámetros.
La naturaleza de esta señal constituye el único criterio de clasificación de los paradigmas. Se determina mediante una pregunta única:
«¿Se dispone, para las observaciones pasadas, del valor que se busca predecir?»
| Respuesta a la pregunta | Señal disponible | Paradigma | Formulación del problema |
|---|---|---|---|
| Sí — cada observación histórica lleva el valor objetivo | Un valor objetivo conocido, observación por observación | Aprendizaje supervisado | Reproducir en casos inéditos la asociación entrada-salida observada |
| No — ningún valor objetivo está disponible | Ninguna señal externa; solo la estructura interna de los datos es explotable | Aprendizaje no supervisado | Poner de manifiesto una organización latente de las observaciones |
| No, pero — existe una evaluación diferida de las acciones | Un escalar de recompensa emitido por el entorno después de cada acción | Aprendizaje por refuerzo | Determinar una estrategia de acción que maximice la recompensa acumulada |
Estas tres respuestas son exhaustivas y mutuamente excluyentes para un problema correctamente formulado. Un problema que parece pertenecer a dos paradigmas es un problema cuya formulación no se ha cerrado: la cuestión a resolver es entonces «cuál es la variable objetivo», no «cuál es el paradigma».
Señal de aprendizaje — definición rigurosa
Información explotada por un algoritmo para evaluar la calidad de la hipótesis actual y derivar de ella una dirección de corrección de sus parámetros. Toma la forma de un valor objetivo asociado a cada observación, de un criterio interno de coherencia definido solo sobre los datos, o de un escalar de recompensa emitido por un entorno en respuesta a una acción.
Paradigma de aprendizaje — definición rigurosa
Clase de problemas definida por la naturaleza de la señal disponible y, por consiguiente, por la forma del problema de optimización planteado: minimización de un riesgo empírico sobre pares etiquetados, optimización de un criterio interno de estructura, o maximización de una esperanza de recompensa acumulada.
Traducción al lenguaje corriente
La señal es lo que permite al algoritmo saber si se equivoca; el paradigma es la familia de problemas definida por aquello de lo que se dispone para aprender.
Punto de vigilancia
En ausencia de toda señal, no hay aprendizaje en el sentido de Mitchell (1997): sin medida de rendimiento P, ninguna experiencia E puede mejorar nada.
Las ramas resaltadas delimitan el perímetro de este curso. Las demás se definen aquí para permitir el posicionamiento, sin ser profundizadas.
La confusión más costosa, tanto en el encuadre de proyecto como en entrevista, consiste en clasificar un problema según un criterio que no lo es.
| Criterio invocado erróneamente | Contraejemplo inmediato |
|---|---|
| El dominio de aplicación | La salud da lugar a supervisado (diagnóstico sobre casos etiquetados), no supervisado (tipología de pacientes) y refuerzo (dosificación adaptativa) |
| El tipo de datos | Una imagen alimenta tanto una clasificación supervisada como un agrupamiento no supervisado de fotografías |
| La arquitectura del modelo | Una red profunda puede ser supervisada, no supervisada (autoencoder) o de refuerzo |
| La finalidad de negocio | «Comprender a nuestros clientes» se traduce indistintamente en una segmentación o en una predicción de abandono |
Principio director: el paradigma se lee en los datos disponibles, no en el tema tratado, ni en la herramienta elegida, ni en la ambición del solicitante.
Definición rigurosa
Sea un espacio de entrada X y un espacio de salida Y. Se dispone de una muestra de aprendizaje de n pares
S = { (x_1, y_1), ..., (x_n, y_n) }, x_i ∈ X, y_i ∈ Ysupuestamente procedentes de un muestreo independiente e idénticamente distribuido según una ley conjunta P(X, Y) desconocida y fija. El aprendizaje supervisado consiste en seleccionar, dentro de una clase de hipótesis H, una función f: X → Y que minimice el riesgo esperado R(f) = E[ L(f(X), Y) ], donde L es una función de pérdida que mide la desviación entre valor predicho y valor observado. Al ser la ley P desconocida, el algoritmo minimiza en la práctica el riesgo empírico calculado sobre S, bajo restricción de regularización.
Traducción al lenguaje corriente
Se proporcionan ejemplos cuya respuesta correcta es conocida, y se pide al algoritmo que construya la función que mejor reproduce esa correspondencia, para aplicarla a casos cuya respuesta es desconocida.
El término «supervisado»
Remite a la presencia de un supervisor —operador, proceso u observación posterior— que ha proporcionado el valor correcto para cada ejemplo, durante la constitución del conjunto de datos y nunca durante el entrenamiento.
Punto de vigilancia
La hipótesis de distribución fija es estructurante. Cuando P(X, Y) evoluciona entre el entrenamiento y la explotación, el riesgo empírico deja de estimar el riesgo esperado y el rendimiento se degrada: fenómeno tratado en el capítulo 082.
Definición rigurosa
Observación para la cual el valor de la variable objetivo está informado, además de las variables explicativas, estando ese valor definido de manera unívoca y homogénea en el conjunto de los datos.
Traducción al lenguaje corriente
Una fila de la tabla para la cual la respuesta ya es conocida.
Procedencia de las etiquetas
Observación diferida (el crédito fue reembolsado o no), anotación humana (un radiólogo califica una placa), registro del sistema (el cliente canceló) o medida física (la pieza se rompió a las 412 horas).
Punto de vigilancia
El coste de obtención de las etiquetas es con frecuencia el factor limitante de un proyecto supervisado: las variables explicativas son abundantes, las etiquetas raramente lo son.
La etiqueta está presente en el entrenamiento y ausente en la explotación. Un dispositivo en el que estuviera disponible en el momento de la predicción no tendría ninguna utilidad predictiva.
El tipo de la variable objetivo determina la subfamilia.
| Clasificación | Regresión | |
|---|---|---|
| Naturaleza del objetivo | Categórica: conjunto finito de modalidades | Numérica continua |
| Pregunta planteada | «¿A qué clase pertenece esta observación?» | «¿Qué valor toma esta magnitud?» |
| Salida del modelo | Una clase, generalmente acompañada de una probabilidad | Un número real |
| Ejemplo de objetivo | Impago: sí / no | Precio de venta: 412 500 $ |
| Métricas habituales | Exactitud, precisión, recall, F1, AUC | RMSE, MAE, MAPE, R² |
| Algoritmos representativos | Regresión logística, árboles, bosques aleatorios, gradient boosting, SVM | Regresión lineal, regresión regularizada, árboles de regresión, gradient boosting |
| Noción de error | Discreta: la clase es correcta o no | Continua: el error posee una amplitud |
Definición rigurosa
Problema de aprendizaje supervisado en el que el espacio de salida Y es un conjunto finito de modalidades { , ..., }. El modelo estima generalmente la probabilidad condicional P(Y = | X = x), resultando la clase predicha de la aplicación de una regla de decisión a ese vector de probabilidades.
Traducción al lenguaje corriente
Colocar cada observación en una de las categorías previstas de antemano.
Subtipos: binaria (2 modalidades excluyentes), multiclase (k modalidades excluyentes), multietiqueta (k modalidades acumulables), ordinal (k modalidades ordenadas, por ejemplo una calificación de riesgo de A a E).
Punto de vigilancia
Las modalidades se definen antes del entrenamiento y forman parte de la especificación del problema. Un modelo de clasificación no puede producir una clase que nunca ha encontrado.
Definición rigurosa
Problema de aprendizaje supervisado en el que el espacio de salida Y es un subconjunto de los reales. El modelo estima una función de regresión, la mayoría de las veces la esperanza condicional E[Y | X = x], mediante minimización de una pérdida cuadrática o absoluta.
Traducción al lenguaje corriente
Estimar un número en lugar de una categoría.
Advertencia terminológica
La palabra «regresión» no conlleva, en su uso moderno, ningún sentido de retroceso o de vuelta atrás. Se hereda de los trabajos de Francis Galton (1886) sobre la transmisión de la estatura entre generaciones, que describían una regresión hacia la media: los hijos de padres de estatura muy alta tendían a ser, en promedio, menos altos que sus padres. El término designaba un fenómeno estadístico particular; luego se extendió al método de ajuste empleado para ponerlo de manifiesto, y después a toda predicción de una magnitud numérica. Por tanto, no debe extraerse ninguna inferencia de la palabra misma: «regresión» significa únicamente que el objetivo es un número.
Confusión que no hay que cometer
La regresión logística es un algoritmo de clasificación, a pesar de su nombre: regresa el logaritmo de la razón de probabilidades (odds) sobre las variables explicativas y produce una probabilidad de pertenencia a una clase.
| # | Dominio | Problema de negocio | Tipo | Variable objetivo |
|---|---|---|---|---|
| 1 | Banca | Concesión de crédito al consumo | Clasificación binaria | Impago a 12 meses: sí / no |
| 2 | Banca | Detección de fraude en transacción con tarjeta | Clasificación binaria desequilibrada | Transacción fraudulenta: sí / no |
| 3 | Banca | Estimación de la pérdida en caso de impago | Regresión | Importe no recuperado, en dólares |
| 4 | Salud | Apoyo al diagnóstico en imagen médica | Clasificación multiclase | Patología identificada entre k categorías |
| 5 | Salud | Anticipación de los reingresos | Clasificación binaria | Reingreso en los 30 días: sí / no |
| 6 | Inmobiliario | Estimación del valor de un inmueble | Regresión | Precio de venta efectivo, en dólares |
| 7 | Recursos humanos | Prevención de la salida voluntaria | Clasificación binaria | Renuncia en los 6 meses: sí / no |
| 8 | Recursos humanos | Estimación de la duración de la contratación | Regresión | Días entre publicación y firma |
| 9 | Industria / IoT | Mantenimiento predictivo | Clasificación binaria | Avería en los 7 días: sí / no |
| 10 | Industria / IoT | Vida útil residual de un equipo | Regresión | Horas de funcionamiento antes del fallo |
| 11 | Marketing | Previsión del abandono (churn) | Clasificación binaria | Cancelación en los 90 días: sí / no |
| 12 | Marketing | Valor de vida del cliente | Regresión | Margen acumulado esperado a 24 meses, en dólares |
| 13 | Transporte | Estimación de la duración del trayecto | Regresión | Duración efectiva, en minutos |
| 14 | Ciberseguridad | Filtrado de correos de phishing | Clasificación binaria | Correo malicioso: sí / no |
| 15 | Energía | Previsión de carga de la red | Regresión | Consumo a H+24, en megavatios |
Lectura de la tabla: en los quince casos, un dato histórico lleva la respuesta. El crédito fue reembolsado o no, el inmueble se vendió a un precio constatado, la pieza se rompió a una hora medida. Es esta disponibilidad retrospectiva del objetivo la que hace supervisado el problema, no la intención de predecir. La calificación técnica del caso 7 no prejuzga por otra parte en nada su licitud: las obligaciones de no discriminación se tratan en el capítulo 095.
Un alumno prepara un examen a partir de exámenes de años anteriores. Cada examen incluye un enunciado y una solución. El alumno resuelve el enunciado, compara su producción con la solución, identifica la desviación, ajusta su método. Después de un número suficiente de ejercicios, afronta un tema inédito cuya solución aún no existe.
| Situación pedagógica | Aprendizaje supervisado | Notación |
|---|---|---|
| El enunciado del ejercicio | Las variables explicativas de una observación | |
| La solución del ejercicio | La etiqueta, valor objetivo conocido | |
| La colección de exámenes anteriores | El conjunto de entrenamiento | S |
| El método de resolución del alumno | La función aprendida | f |
| La desviación entre producción y solución | La pérdida sobre una observación | L(f(), ) |
| La revisión del método | La actualización de los parámetros | optimización |
| El simulacro de examen | El conjunto de validación | — |
| El examen final, tema inédito | El conjunto de test, luego la producción | — |
| La nota obtenida en el examen final | El rendimiento en generalización | R(f) |
Prolongaciones
El alumno que memoriza las soluciones sin adquirir el método aprueba los exámenes anteriores y fracasa en el tema inédito: es el sobreajuste (overfitting), tratado en el capítulo 040. El alumno que dispone de la solución durante el examen obtiene una nota excelente que no mide nada: es la fuga de datos, tratada en el capítulo 028.
Límite de la analogía
El alumno comprende lo que hace y transpone a un dominio vecino. El modelo solo establece una correspondencia estadística y no transpone fuera del dominio cubierto por sus datos de entrenamiento.
Definición rigurosa
Clase de problemas en los que se dispone de una muestra { , ..., }, ∈ X, sin variable objetivo asociada. El objetivo es estimar una estructura de la distribución P(X): partición del espacio de las observaciones, subvariedad de baja dimensión que aproxima la nube de puntos, densidad, o regularidades de coocurrencia. La optimización recae sobre un criterio definido exclusivamente a partir de los datos, sin referencia a un valor esperado.
Traducción al lenguaje corriente
Se proporcionan observaciones sin ninguna respuesta asociada y se pide al algoritmo que haga aparecer la organización interna de esos datos.
El término «no supervisado»
Indica la ausencia de respuesta de referencia, no la ausencia de intervención humana: la elección de las variables, de la distancia, del número de grupos y de la normalización corresponde enteramente al analista.
Punto de vigilancia
Un algoritmo no supervisado siempre produce un resultado, incluso cuando los datos no contienen ninguna estructura: una partición en cuatro grupos devolverá cuatro grupos sobre una nube perfectamente uniforme. La producción de un resultado nunca atestigua, por tanto, la existencia de una estructura.
Definición rigurosa
Problema que consiste en construir una partición o un recubrimiento de un conjunto de observaciones en grupos tales que una medida de similitud intragrupo sea máxima y la similitud intergrupos mínima, en el sentido de una distancia especificada por el analista. Un método de partición por inercia minimiza así la suma de los cuadrados de las desviaciones internas:
argmin Σ Σ || x - μ_j ||²
C j=1..k x ∈ C_jdonde designa el centro del grupo .
Traducción al lenguaje corriente
Agrupar las observaciones que se parecen, sin saber de antemano qué grupos existen ni cuántos hay.
Parámetros a cargo del analista
Número de grupos, medida de distancia, normalización, selección de las variables. Cada una de estas elecciones modifica el resultado; no existe una partición «verdadera» que un algoritmo descubriría independientemente de ellas.
Punto de vigilancia
Los grupos producidos no tienen nombre. Su denominación y su interpretación son un acto de negocio posterior al algoritmo, nunca una salida de este.
Definición rigurosa
Problema que consiste en construir una aplicación g: X → Z, con dim(Z) < dim(X), que preserve lo mejor posible una propiedad de la distribución de origen: varianza explicada para el análisis de componentes principales, estructura de vecindad local para los métodos de embedding no lineal, capacidad de reconstrucción para los autoencoders. El criterio optimizado es interno a los datos.
Traducción al lenguaje corriente
Representar las mismas observaciones con menos variables, perdiendo la menor información posible.
Finalidades operativas: visualización, compresión, eliminación de ruido, preprocesamiento de un modelo supervisado, atenuación de la maldición de la dimensionalidad.
Punto de vigilancia
Empleada antes de un modelo supervisado, la reducción de dimensión debe ajustarse únicamente sobre los datos de entrenamiento y luego aplicarse tal cual a los datos de validación y de test. Ajustarla sobre el conjunto de los datos constituye una fuga de datos, tratada en el capítulo 028.
Una cadena de distribución dispone de 12 000 clientes activos. No existe ninguna variable objetivo: la dirección no pide predecir un comportamiento, sino comprender la estructura de su base. Se retienen cuatro variables —frecuencia de compra anual, cesta media, antigüedad, proporción de compras en línea— y se aplica una partición en cuatro grupos tras normalización.
Salida bruta del algoritmo
| Grupo | Efectivo | Proporción | Frecuencia anual | Cesta media | Antigüedad | Proporción en línea |
|---|---|---|---|---|---|---|
| Grupo 1 | 4 320 | 36 % | 1,2 compras | 38 $ | 8 meses | 22 % |
| Grupo 2 | 3 600 | 30 % | 11,4 compras | 42 $ | 5,2 años | 15 % |
| Grupo 3 | 2 880 | 24 % | 4,1 compras | 187 $ | 3,4 años | 71 % |
| Grupo 4 | 1 200 | 10 % | 0,4 compras | 25 $ | 6,1 años | 5 % |
Los identificadores numéricos carecen de sentido: «Grupo 1» no significa nada y no está ordenado con respecto a «Grupo 2».
Interpretación de negocio, posterior al algoritmo
| Grupo | Denominación adoptada por el negocio | Lectura | Acción prevista |
|---|---|---|---|
| Grupo 1 | Nuevos clientes ocasionales | Antigüedad baja, compromiso bajo | Recorrido de activación en los 6 primeros meses |
| Grupo 2 | Habituales de proximidad | Frecuencia alta, cesta baja, canal físico | Programa de fidelización, aumento de la cesta |
| Grupo 3 | Compradores de cesta alta en línea | Cesta cuatro veces superior, canal digital | Oferta premium, servicio de entrega dedicado |
| Grupo 4 | Clientes durmientes | Antigüedad alta, actividad casi nula | Campaña de reactivación o salida del fichero activo |
Punto determinante: la segunda columna no fue producida por el algoritmo. Fue formulada por responsables de negocio que examinaron las características estadísticas de cada grupo. Un algoritmo de clustering delimita grupos; no los nombra ni los explica.
Es la diferencia estructural más importante con el aprendizaje supervisado. Cada predicción supervisada puede confrontarse con el valor observado: la exactitud es medible. En no supervisado, no existe ninguna partición de referencia, y la pregunta «¿esta segmentación es exacta?» está mal planteada. La evaluación se apoya entonces en dos órdenes de criterios.
| Orden de criterio | Naturaleza | Ejemplos | Límite |
|---|---|---|---|
| Criterios internos | Estadístico, calculado solo sobre los datos | Coeficiente de silueta, inercia intraclase, índices de Davies-Bouldin y de Calinski-Harabasz | Una puntuación alta no atestigua la pertinencia de negocio |
| Criterios de utilidad de negocio | Operativo, evaluado por los responsables del dominio | Grupos interpretables, accionables, de tamaño explotable, estables en el tiempo | Subjetividad, dependencia de la experiencia disponible |
Punto de vigilancia: una segmentación con un coeficiente de silueta excelente pero cuyos grupos no requieren ninguna acción es un fracaso operativo; una partición con una puntuación interna mediocre cuyos grupos requieren acciones diferenciadas y medibles es un éxito. El criterio final es la utilidad.
Consecuencia sobre la conducción del proyecto: un proyecto no supervisado no puede pilotarse mediante un umbral contractual del tipo «al menos 90 % de exactitud», sino mediante una revisión de interpretabilidad que involucre al negocio.
| Dominio | Aplicación | Subfamilia | Salida explotada |
|---|---|---|---|
| Distribución | Segmentación de la base de clientes | Clustering | Grupos homogéneos para segmentación diferenciada |
| Comercio | Análisis de la cesta de compra | Reglas de asociación | Productos frecuentemente comprados juntos |
| Seguros | Tipología de perfiles de siniestralidad | Clustering | Grupos que sirven de base a una tarificación |
| Bioinformática | Agrupamiento de perfiles de expresión génica | Clustering | Subtipos moleculares candidatos |
| Industria | Compresión de señales de sensores | Reducción de dimensión | Representación compacta para supervisión |
| Documentación | Agrupamiento temático de corpus | Clustering | Familias de documentos sin nomenclatura previa |
| Ciberseguridad | Detección de comportamientos atípicos | Detección de anomalías | Alertas a calificar por un analista |
| Marketing | Reducción de un cuestionario a sus ejes principales | Reducción de dimensión | Factores sintéticos de actitud |
Observación profesional: el aprendizaje no supervisado interviene más a menudo en las fases previas de un proyecto supervisado, a título de exploración, que en producción autónoma. Una segmentación puede, por otra parte, convertirse en una variable explicativa de un modelo supervisado posterior.
Definición rigurosa
Marco de aprendizaje en el que un agente interactúa secuencialmente con un entorno. En cada paso de tiempo t, el agente observa un estado , elige una acción según una política π, recibe una recompensa escalar y observa un nuevo estado . El problema se formaliza la mayoría de las veces como un proceso de decisión de Markov (S, A, P, R, γ), con γ ∈ [0, 1[ el factor de descuento. El objetivo es determinar una política π que maximice la esperanza de la ganancia acumulada descontada:
J(\pi) = \mathbb{E}\left[ \sum_{t \ge 0} \gamma^{t} \, $$r_{t+1}$$ \right]Referencia de síntesis: Sutton y Barto, Reinforcement Learning: An Introduction (1998, segunda edición 2018).
Traducción al lenguaje corriente
El agente no aprende a partir de respuestas correctas proporcionadas de antemano sino por ensayos sucesivos: actúa, el entorno lo sanciona o lo recompensa, y ajusta su estrategia de modo que acumule la mayor recompensa posible.
Lo que distingue la recompensa de una etiqueta
La etiqueta indica la respuesta correcta, preexiste al entrenamiento y concierne a una observación aislada. La recompensa evalúa la respuesta producida, se genera durante la interacción, recae sobre una secuencia de acciones y depende de las acciones del propio modelo.
Punto de vigilancia
El carácter diferido de la recompensa genera el problema de asignación del mérito (credit assignment): cuando una recompensa sobreviene al término de centenares de acciones, determinar cuáles contribuyeron a ella constituye la dificultad central del paradigma.
El ciclo se repite hasta un estado terminal o indefinidamente. La particularidad estructural del paradigma aparece aquí: los datos de aprendizaje son producidos por el propio agente. Una política mediocre genera trayectorias mediocres, de las que el agente debe no obstante aprender. De ahí el arbitraje entre exploración y explotación: una política que nunca explota no acumula ninguna recompensa, una política que nunca explora se fija en un óptimo local. Este arbitraje no tiene equivalente en aprendizaje supervisado, donde el conjunto de datos es fijo.
| Término español | Término inglés | Notación | Definición | Ejemplo: robot de manipulación |
|---|---|---|---|---|
| Agente | Agent | — | Entidad que decide y actúa | El controlador del robot |
| Entorno | Environment | — | Sistema con el que el agente interactúa, produciendo transiciones y recompensas | El almacén, sus estanterías, sus obstáculos |
| Estado | State | Descripción de la situación en el instante t, suficiente para decidir | Posición, carga transportada, nivel de batería | |
| Acción | Action | Decisión tomada entre las disponibles | Avanzar, girar, agarrar, depositar | |
| Recompensa | Reward | Escalar emitido por el entorno que evalúa la transición | +10 paquete depositado, -1 por segundo, -100 colisión | |
| Política | Policy | π(a|s) | Regla que asocia a cada estado una acción o una distribución sobre las acciones | La estrategia de navegación aprendida |
| Dominio | Aplicación | Naturaleza de la recompensa | Madurez |
|---|---|---|---|
| Juegos | Go, ajedrez, videojuegos | Victoria, puntuación | Demostrada, referencias académicas mayores |
| Robótica | Locomoción, prensión, navegación | Progresión hacia el objetivo, penalización por colisión | Operativa en entorno controlado |
| Centros de datos | Regulación de la refrigeración | Ahorro de energía bajo restricción de temperatura | Despliegues industriales documentados |
| Finanzas | Ejecución de órdenes, asignación dinámica | Rendimiento ajustado al riesgo | Uso real, fuertemente regulado |
| Publicidad | Asignación de impresiones, bandits contextuales | Clic, conversión | Muy extendida en forma de bandits |
| Logística | Programación, gestión de inventario | Coste total, tasa de servicio | Emergente, generalmente en simulación |
Caso particular de los bandits multibrazo: forma simplificada de aprendizaje por refuerzo sin transición de estado, masivamente desplegada para la asignación de contenidos y las pruebas adaptativas, y principal exposición real de las organizaciones a este paradigma.
Aprender a montar en bicicleta no procede de un solucionario: nadie puede proporcionar, para cada milisegundo, el valor exacto del ángulo del manillar y de la inclinación del torso. La consigna «mantén el equilibrio» no es una etiqueta. La señal disponible es una consecuencia: el aprendiz se mantiene en pie, o se cae. El vínculo entre el gesto erróneo y su consecuencia está diferido unos segundos.
| Elemento de la situación | Correspondencia formal |
|---|---|
| El aprendiz ciclista | El agente |
| La bicicleta, la carretera, la gravedad | El entorno |
| Inclinación, velocidad, posición del manillar | El estado |
| Corregir la trayectoria, pedalear, frenar | La acción |
| Metros recorridos sin caída, caída | La recompensa |
| Los reflejos adquiridos | La política π |
| Probar una trayectoria inhabitual | La exploración |
| Reproducir lo que funcionó | La explotación |
Lo que la analogía pone de manifiesto
La competencia se adquiere por interacción y no por memorización de pares pregunta-respuesta: no puede transmitirse mediante una exposición, y su adquisición exige un gran número de ensayos, incluidos los infructuosos. Un niño se cae unas decenas de veces; un agente artificial requiere habitualmente millones de episodios. Cuando cada episodio tiene un coste material o humano, el entrenamiento en condiciones reales se vuelve impracticable —de ahí la exigencia de un simulador.
El aprendizaje por refuerzo ocupa un lugar considerable en la comunicación pública del dominio y un lugar marginal en las carteras de proyectos. Cuatro obstáculos explican esa brecha.
| Obstáculo | Enunciado | Consecuencia práctica | Situaciones en que el obstáculo se supera |
|---|---|---|---|
| 1. Entorno simulable requerido | El aprendizaje exige interacciones masivas, inaceptables sobre el sistema real | Hace falta un simulador fiel, cuya construcción es un proyecto por sí mismo | Juegos, sistemas físicos bien modelados, colas de espera, entornos digitales |
| 2. Coste computacional | El número de episodios supera en varios órdenes de magnitud el volumen de un entrenamiento supervisado | Presupuesto de cálculo elevado, plazos largos, iteraciones lentas | Problemas de baja dimensión, bandits, simulaciones poco costosas |
| 3. Especificación de la recompensa | Traducir un objetivo de negocio en un escalar es arriesgado: el agente optimiza exactamente lo que está escrito | Comportamientos degenerados que maximizan la medida sin servir a la intención | Objetivos con medida directa y no eludible |
| 4. Controlabilidad en producción | La política explora, evoluciona y toma decisiones secuenciales difíciles de auditar | Dificultad de homologación, de trazabilidad y de garantía de comportamiento | Dominios de baja criticidad, o dispositivos acotados por reglas de seguridad externas |
Desarrollo del obstáculo 3: los comportamientos degenerados
Una función de recompensa mal especificada lleva al agente a maximizar la medida en lugar del objetivo que representa. La literatura designa este fenómeno con el término reward hacking.
| Objetivo perseguido | Recompensa escrita | Comportamiento degenerado posible |
|---|---|---|
| Limpiar una habitación | Cantidad de polvo recogida | Esparcir el polvo para recogerlo de nuevo |
| Terminar una carrera | Puntos acumulados en el recorrido | Girar en bucle sobre una zona de puntos sin cruzar la línea |
| Maximizar el compromiso | Duración de la sesión | Favorecer los contenidos polarizantes en detrimento de la satisfacción |
| Reducir el plazo de tramitación | Expedientes cerrados por hora | Cerrar los expedientes difíciles sin resolverlos |
| Evitar las colisiones | Penalización en caso de contacto | Permanecer inmóvil |
El agente no optimiza la intención del diseñador, optimiza la función de recompensa; toda brecha entre ambas será explotada. Esta constatación coincide con la ley de Goodhart: cuando una medida se convierte en un objetivo, deja de ser una buena medida.
Punto de vigilancia sobre el obstáculo 4: un modelo supervisado produce una predicción puntual que un proceso de negocio puede filtrar antes de actuar; un agente de refuerzo produce una política de acción. El punto de control humano debe, por tanto, diseñarse explícitamente, en forma de restricciones de seguridad externas al aprendizaje.
La disponibilidad de la señal admite estados intermedios: etiquetas parciales, etiquetas fabricadas, etiquetas presentes pero muy raras. De ello se derivan tres configuraciones.
Definición rigurosa
Clase de problemas en los que la muestra reúne un subconjunto etiquetado = { (, ) } de tamaño l y un subconjunto no etiquetado = { } de tamaño u, con generalmente u >> l. Los métodos explotan la distribución marginal P(X) estimada sobre para restringir la estimación de P(Y | X) aprendida sobre , bajo hipótesis de regularidad: continuidad, agrupamiento, variedad.
Traducción al lenguaje corriente
Se dispone de muchas observaciones y de pocas respuestas conocidas; la masa no etiquetada sirve para aprovechar mejor el pequeño número de etiquetas disponibles.
Punto de vigilancia
Las hipótesis de regularidad no siempre se satisfacen. Cuando no lo hacen, la adición de datos no etiquetados puede degradar el rendimiento con respecto a un modelo entrenado solo con los datos etiquetados.
Caso de estudio: la imagen médica
Un centro hospitalario dispone de 200 000 placas archivadas, de las cuales solo 2 000 están anotadas: la anotación moviliza a un radiólogo varios minutos por placa, y la anotación íntegra representaría varios años-persona. El enfoque supervisado estricto descarta el 99 % de la información disponible; el enfoque semisupervisado aprende la estructura del espacio de las imágenes sobre las 198 000 placas brutas y ajusta la regla de decisión sobre las 2 000 placas anotadas.
Definición rigurosa
Clase de métodos en los que la variable objetivo se construye automáticamente a partir de la estructura interna de los datos, sin intervención de un anotador. Se define una tarea llamada pretexto de modo que su etiqueta sea deducible del dato bruto; el modelo se entrena en esa tarea mediante minimización de un riesgo empírico clásico, y luego la representación obtenida se reutiliza para la tarea objetivo.
Traducción al lenguaje corriente
El algoritmo fabrica por sí mismo sus ejercicios y sus soluciones a partir de los datos brutos, lo que elimina el coste de anotación.
Precisión determinante
La mecánica de aprendizaje sigue siendo estrictamente supervisada: existe un valor objetivo, una función de pérdida, una comparación entre predicción y objetivo. Solo cambia la procedencia de la etiqueta —extraída de los datos en lugar de ser proporcionada por un operador. El autosupervisado no es, por tanto, un cuarto paradigma, sino una modalidad de obtención de las etiquetas.
Punto de vigilancia
La calidad de la representación depende enteramente de la pertinencia de la tarea pretexto. Una tarea resoluble mediante un artefacto superficial produce una representación sin valor para la tarea objetivo.
Caso de estudio: el enmascaramiento de palabras
A partir de un corpus de texto bruto, no anotado, se construyen ejemplos de entrenamiento enmascarando palabras y pidiendo al modelo que las restituya.
| Etapa | Contenido |
|---|---|
| Dato bruto | «El tipo de interés de referencia fue elevado veinticinco puntos básicos.» |
| Ejemplo fabricado (entrada) | «El tipo de interés de referencia fue [MÁSCARA] veinticinco puntos básicos.» |
| Etiqueta fabricada (objetivo) | «elevado» |
| Coste de anotación | Nulo: la etiqueta es la palabra retirada |
Este mecanismo, popularizado por las arquitecturas de tipo BERT (Devlin et al., 2018) y luego generalizado por los modelos de lenguaje autorregresivos, permite explotar corpus de muy gran tamaño sin anotación humana. La representación obtenida se especializa después en una tarea supervisada que dispone de pocas etiquetas.
Definición rigurosa
Problema que consiste en identificar las observaciones cuya generación es improbable con respecto a la distribución de las observaciones llamadas normales. Según la disponibilidad de ejemplos de anomalías etiquetados, se formula como una clasificación supervisada fuertemente desequilibrada, como una estimación de densidad o de soporte no supervisada, o como una clasificación de una clase.
Traducción al lenguaje corriente
Detectar lo que se sale de lo ordinario, se disponga o no de ejemplos de casos anormales.
Posición taxonómica
La detección de anomalías se sitúa a caballo entre dos paradigmas. No constituye una familia adicional: designa una finalidad de negocio tratable en uno u otro paradigma según los datos disponibles.
| Configuración de los datos | Paradigma aplicable | Métodos habituales | Evaluación |
|---|---|---|---|
| Histórico de anomalías confirmadas y etiquetadas, en muy baja proporción | Supervisado, en régimen de fuerte desequilibrio | Gradient boosting, bosques aleatorios con remuestreo o ponderación | Recall, precisión, área bajo la curva precisión-recall |
| Ninguna anomalía etiquetada, o anomalías futuras distintas de las anomalías pasadas | No supervisado | Isolation Forest, estimación de densidad, SVM de una clase, autoencoder | Criterios internos, tasa de alerta, calificación por un experto |
| Algunas anomalías etiquetadas y una masa de observaciones no calificadas | Semisupervisado | Modelado de la normalidad, luego calibración del umbral sobre los casos etiquetados | Precisión sobre los casos confirmados, coste de los falsos positivos |
Criterio de elección práctico
Si las anomalías a detectar se parecen a las ya observadas y etiquetadas, el problema es supervisado. Si las anomalías a detectar son desconocidas por naturaleza, el problema es no supervisado.
En detección de fraude bancario, los esquemas conocidos se tratan en supervisado, con las técnicas de gestión del desequilibrio tratadas en el capítulo 050; los esquemas nuevos escapan por construcción a un modelo entrenado sobre el pasado y pertenecen a un enfoque no supervisado. Los dispositivos en producción combinan frecuentemente ambos.
Lectura de la rama «Encuadre a retomar»: la ausencia de etiquetas no descalifica el proyecto, desplaza su primera etapa. La pregunta se convierte en «cómo constituir un conjunto etiquetado» —anotación, recolección prospectiva, explotación de un registro del sistema— o «qué objetivo no supervisado asumir».
| Criterio | Supervisado | No supervisado | Refuerzo |
|---|---|---|---|
| Etiquetas | Requeridas para cada observación de entrenamiento | Ninguna | Ninguna; sustituidas por una señal de recompensa |
| Pregunta planteada | «¿Cuál es el valor de Y para esta observación?» | «¿Qué organización estructura estas observaciones?» | «¿Qué secuencia de acciones maximiza la ganancia acumulada?» |
| Analogía | El aprendizaje con solucionario | La clasificación de objetos sin nomenclatura previa | La adquisición de una competencia motriz |
| Medida de exactitud | Directa: comparación entre predicción y valor observado | Imposible en sentido estricto: ninguna verdad de referencia | Indirecta: recompensa acumulada sobre episodios |
| Subtipos | Clasificación, regresión | Clustering, reducción de dimensión, reglas de asociación | Métodos basados en el valor, en la política, bandits |
| Algoritmos típicos | Regresión lineal y logística, árboles, bosques aleatorios, gradient boosting, SVM, redes neuronales | k-means, clasificación jerárquica, DBSCAN, PCA, UMAP, autoencoders | Q-learning, SARSA, gradientes de política, actor-crítico |
| Frecuencia en la empresa | Preponderante: la gran mayoría de los modelos en producción | Significativa, principalmente en exploración y en preparación | Marginal fuera de I+D, con la notable excepción de los bandits |
| Ejemplo | Predecir la cancelación de un cliente a 90 días | Segmentar la base de clientes en grupos homogéneos | Optimizar una política de gestión de inventario en simulación |
| Cobertura por este curso | Objeto central, del capítulo 004 hasta el final | Posicionado aquí, no profundizado | Posicionado aquí, no profundizado |
Los dos procedimientos producen grupos; la semejanza termina ahí. La confusión entre ambos es una de las más frecuentes en entrevista.
| Punto de comparación | Clasificación | Clustering |
|---|---|---|
| Paradigma | Supervisado | No supervisado |
| ¿Los grupos existen antes del análisis? | Sí, forman parte de la especificación | No, resultan del cálculo |
| Número de grupos | Fijado por el problema de negocio | Elegido por el analista, a menudo por exploración |
| ¿Los grupos tienen nombre? | Sí, un sentido de negocio definido a priori | No, identificadores arbitrarios a interpretar |
| Datos requeridos | Observaciones etiquetadas | Solo observaciones |
| Pregunta planteada | «¿Esta observación pertenece a la clase A o B?» | «¿Qué grupos emergen de estas observaciones?» |
| Evaluación | Exactitud, recall, precisión, F1, AUC | Silueta, inercia, utilidad de negocio |
| Estabilidad del sentido | Estable: las clases no cambian | Inestable: otra inicialización u otro k modifica los grupos |
| Ejemplo | Asignar un correo a «spam» o «legítimo» | Descubrir cuatro perfiles en una base de clientes |
| Formulación de negocio desencadenante | «Sabemos lo que buscamos» | «Queremos saber qué hay» |
Test de discriminación en una pregunta: ¿la lista de los grupos figura en el pliego de condiciones? Si sí, se trata de clasificación; si no, de clustering.
Un departamento de marketing solicita un modelo que prediga «los clientes de alto potencial». Ninguna variable con ese nombre existe en el sistema de información: la intención de predecir no basta para crear un problema supervisado. Son posibles dos salidas, y solo una debe elegirse explícitamente: definir un objetivo medible y verificable en el histórico —por ejemplo «facturación de los 12 meses siguientes superior a 5 000 $»— o asumir un enfoque exploratorio no supervisado que produzca grupos a interpretar.
Formulación correcta: «Un problema supervisado requiere una variable objetivo definida, medible y presente en el histórico. Mientras no esté constituida, no hay problema supervisado.»
Ambos producen grupos, lo que basta para alimentar la confusión. El criterio discriminante no es la salida sino la entrada: ¿las clases preexisten en los datos de entrenamiento? Se observa regularmente una consecuencia: un clustering presentado como un modelo predictivo, acompañado de una supuesta medida de exactitud, la cual carece de objeto en ausencia de partición de referencia.
Formulación correcta: «La clasificación asigna una observación a clases definidas previamente y aprendidas sobre ejemplos etiquetados; el clustering constituye grupos a partir únicamente de las similitudes, sin clases preexistentes ni exactitud medible.»
La ausencia de etiquetas aligera la recolección y da la impresión de un problema menos exigente. Es lo contrario en el plano de la validación: sin verdad de referencia, el proyecto se ve privado de criterio objetivo de parada, y el número de grupos, la distancia y la normalización corresponden a elecciones que ninguna métrica resuelve. Un proyecto supervisado concluye con un rendimiento cuantificado sobre un conjunto de test; un proyecto no supervisado, con una decisión de aceptación de negocio.
Formulación correcta: «El aprendizaje no supervisado es menos exigente en datos etiquetados y más exigente en interpretación: su dificultad se desplaza de la recolección a la validación.»
La enumeración «supervisado, no supervisado, refuerzo, Deep Learning» mezcla dos planos de clasificación. Los tres primeros términos designan paradigmas, definidos por la naturaleza de la señal de aprendizaje; el cuarto designa una clase de modelos, definida por una arquitectura. Una red neuronal entrenada con imágenes etiquetadas pertenece al supervisado, un autoencoder al no supervisado, una red que optimiza una política mediante recompensa al refuerzo.
Formulación correcta: «El Deep Learning es una clase de modelos movilizable en los tres paradigmas; se sitúa en otro plano de clasificación.»
Para predecir el abandono a 90 días, un equipo retiene como variable explicativa el número de llamadas al servicio de cancelación. El rendimiento es excelente en validación y nulo en producción: en el momento en que la predicción debe producirse, esa llamada aún no ha tenido lugar. La variable no es predictiva, es constitutiva del evento a predecir. Esta forma de fuga de datos, tratada en el capítulo 028, no es detectable por las métricas: las mejora.
Regla de control: para cada variable explicativa, verificar que su valor estaría efectivamente disponible en el instante en que el modelo será consultado en producción.
Formulación correcta: «La etiqueta es posterior a las variables explicativas; toda información contemporánea o posterior a la realización del objetivo debe excluirse del conjunto de entrenamiento.»
«La salud es supervisado» o «el marketing es clustering» son enunciados sin fundamento. La salud da lugar a la predicción de un reingreso (supervisado), a la identificación de subgrupos de pacientes (no supervisado) y a la adaptación secuencial de un protocolo de dosificación (refuerzo). El marketing da lugar a la predicción de una cancelación, a una segmentación y a la asignación dinámica de ofertas mediante bandits.
Formulación correcta: «El paradigma se determina por la naturaleza de la señal de aprendizaje disponible, nunca por el sector de actividad.»
EL CRITERIO ÚNICO
« ¿Se dispone, para las observaciones pasadas,
del valor que se busca predecir? »
Sí ...................................... SUPERVISADO
No ...................................... NO SUPERVISADO
No, pero hay disponible una evaluación
diferida de las acciones ................ REFUERZO
SUBFAMILIAS
Supervisado : clasificación (objetivo categórico)
regresión (objetivo numérico)
No supervisado : clustering, reducción de dimensión,
reglas de asociación
Refuerzo : métodos basados en el valor o en la política
CONFIGURACIONES INTERMEDIAS
Semisupervisado : solo una fracción de las observaciones está etiquetada
Autosupervisado : etiquetas fabricadas a partir de los datos ;
la mecánica sigue siendo supervisada
Anomalías : supervisado si las anomalías pasadas están etiquetadas,
no supervisado si son desconocidas por naturaleza
LO QUE NO ES UN CRITERIO DE CLASIFICACIÓN
el dominio, el tipo de datos, el volumen,
la arquitectura del modelo, la finalidad declarada
DISTINCIÓN QUE NUNCA HAY QUE PERDER
Clasificación : los grupos existen antes del análisis
Clustering : los grupos resultan del análisis
LO QUE MIDE CADA PARADIGMA
Supervisado : una exactitud, por comparación con el valor observado
No supervisado : una cohesión interna y una utilidad de negocio
Refuerzo : una recompensa acumulada sobre episodios
POSICIÓN DEL DEEP LEARNING
Clase de modelos movilizable en los tres paradigmas.
No es un cuarto paradigma.Enunciado de síntesis
Los paradigmas de aprendizaje se distinguen por la naturaleza de la señal disponible y por nada más: un valor objetivo conocido observación por observación define el aprendizaje supervisado, la sola estructura interna de los datos define el aprendizaje no supervisado, una recompensa diferida emitida por un entorno define el aprendizaje por refuerzo; el dominio, el volumen y la arquitectura del modelo no tienen efecto sobre esta clasificación.
Quiz asociados:
003.1-quiz-critere-classement.md,
003.2-quiz-apprentissage-supervise.md,
003.3-quiz-apprentissage-non-supervise.md,
003.4-quiz-apprentissage-renforcement.md,
003.5-quiz-paradigmes-intermediaires.md,
003.6-quiz-qualification-probleme.md
Capítulo siguiente: 004-apprentissage-supervise.md