Aprendizaje supervisado: formalización y mecánica

47 min
Bloque 0 — Situar el aprendizaje supervisado
Objetivo
formalizar rigurosamente el problema supervisado, comprender la mecánica efectiva del ajuste de un modelo, y establecer que la generalización constituye su objetivo único.
Duración estimada
45 minutos
Requisitos previos
capítulos 001 a 003
Quiz asociados
004.1-quiz-formalisation.md a 004.7-quiz-generalisation.md

Los capítulos 001 a 003 situaron el aprendizaje supervisado en la taxonomía del dominio y distinguieron las tres familias de aprendizaje. Este capítulo pasa de la situación a la mecánica: lo que contiene un problema supervisado, lo que hace el algoritmo cuando ajusta un modelo, y lo que se mide cuando se evalúa.


1. Formalización del problema supervisado

La definición se da en cuatro niveles de precisión decreciente. Los cuatro enuncian lo mismo. El primero debe dominarse, los otros tres sirven para la transmisión.

1.1 Nivel 1 — Formulación matemática

Los espacios. Un espacio de entradas X (típicamente X ⊆ R^d, donde d es el número de variables explicativas) y un espacio de salidas Y. La naturaleza de Y determina el tipo de problema: Y ⊆ R para la regresión, Y = {c1, ..., cK} finito y no ordenado para la clasificación.

La distribución generadora. Los pares observación-etiqueta se suponen procedentes de una distribución conjunta P(X, Y), desconocida y supuestamente fija durante el período considerado. Sin esta hipótesis, nada de lo observado informa sobre lo que no lo es.

La hipótesis de dependencia. Se postula una relación entre X e Y, formalizada por una función desconocida f : X → Y, o en el caso general en que la relación es ruidosa, por la ley condicional P(Y | X). El modelo habitual se escribe y = f(x) + ε, donde ε es un término aleatorio de esperanza nula que representa lo que influye en y sin ser capturado por x.

La muestra. No se dispone ni de f, ni de P, sino de una muestra finita

D = {(x1, y1), (x2, y2), ..., (xn, yn)},   (xi, yi) ~ P(X, Y)

de n observaciones supuestamente independientes e idénticamente distribuidas.

El criterio. Una función de pérdida L : Y × Y → R+ cuantifica la desviación entre valor predicho y valor observado. El riesgo esperado de una hipótesis h es R(h) = E[L(y, h(x))], recayendo la esperanza sobre (x, y) ~ P(X, Y). El objetivo teórico es h* = argmin R(h) sobre el espacio de hipótesis H, conjunto de las funciones que la clase de modelos elegida puede representar.

El obstáculo y su rodeo. R(h) no es calculable, al ser P desconocida. Se sustituye por el riesgo empírico

R̂(h) = (1/n) · Σ L(yi, h(xi))     para i = 1..n

y se resuelve el problema accesible f̂ = argmin R̂(h) sobre H. Este principio es la minimización del riesgo empírico (Empirical Risk Minimization, ERM); constituye el fundamento formal del aprendizaje supervisado.

DEFINICIÓN — Riesgo esperado, riesgo empírico, minimización del riesgo empírico

Definición rigurosa

El riesgo esperado es la esperanza de la pérdida bajo la distribución generadora: R(h) = E[L(y, h(x))]. Cuantifica el rendimiento de h sobre el conjunto de las observaciones que la distribución puede producir, observadas o no.

El riesgo empírico es la media de la pérdida sobre la muestra disponible. Es un estimador sin sesgo de R(h) para una hipótesis fijada de antemano.

La minimización del riesgo empírico (Vapnik, 1995) consiste en retener la hipótesis que minimiza sobre H, en sustitución de la minimización inaccesible de R.

Punto de vigilancia central

La ausencia de sesgo vale para una hipótesis fijada antes de observar la muestra. Desde el momento en que se selecciona minimizando , la cantidad R̂(f̂) se convierte en un estimador optimistamente sesgado de R(f̂). Es la justificación formal de la separación de los datos (capítulo 026) y el origen mecánico del sobreajuste (capítulo 031).

Traducción al lenguaje corriente

Se querría el modelo que menos se equivoca en todos los casos posibles; solo se puede medir el error en los casos de que se dispone. Se elige, por tanto, el modelo que menos se equivoca en esos, sabiendo que esa puntuación es halagadora.

Término de errorOrigenPalanca de reducción
AproximaciónLa mejor función de H sigue alejada de fAmpliar H: modelo más expresivo, variables adicionales
Estimaciónn es finito, solo estima R imperfectamenteAumentar n, restringir H, regularizar
OptimizaciónEl algoritmo no alcanza exactamente el mínimo de Ajustar el procedimiento de optimización
IrreducibleEl ruido ε: y no está determinado por xNinguna. Acota el rendimiento alcanzable

Ampliar H reduce el error de aproximación y aumenta el error de estimación. Este arbitraje es el compromiso sesgo-varianza, tratado en el capítulo 031.

1.2 Nivel 2 — Formulación técnica accesible

El aprendizaje supervisado consiste en ajustar una función parametrizada sobre un conjunto de ejemplos cuyo valor a predecir es conocido, minimizando una medida de desviación entre valores predichos y valores observados, con el fin de aplicar después esa función a observaciones cuyo valor es desconocido.

Formulación destinada a un documento de diseño. Nombra los cuatro elementos obligatorios: ejemplos etiquetados, función parametrizada, medida de desviación, aplicación a lo desconocido.

1.3 Nivel 3 — Formulación corriente

Se proporciona a un algoritmo un gran número de casos pasados acompañados de su respuesta. El algoritmo busca la regla que mejor relaciona la información disponible con la respuesta. Esa regla se aplica después a casos nuevos, para los cuales la respuesta no es conocida.

Formulación destinada a un comité de dirección. No contiene ninguna aproximación falsa; omite el formalismo.

1.4 Nivel 4 — Representación gráfica

Lectura: la flecha Y → ALG solo existe en la fase de entrenamiento. Es ella, y solo ella, la que distingue el aprendizaje supervisado del no supervisado (capítulo 003).

NivelFormulaciónDestinatarioContexto de uso
1Matemática: f̂ = argmin R̂(h) sobre H, D ~ P(X,Y)Data scientist, examinadorEntrevista técnica, especificación
2Técnica: función parametrizada ajustada por minimización de una desviaciónIngeniero, arquitectoDocumento de diseño
3Corriente: casos pasados con respuesta, regla inducida, aplicación a lo nuevoDirección, negocioComité de dirección
4Gráfica: dos fases, una flecha discriminanteTodo públicoSoporte de presentación
SímboloDesignación
x, yVector de variables explicativas, etiqueta observada
n, dNúmero de observaciones, número de variables
P(X, Y)Distribución conjunta generadora, desconocida
DMuestra de aprendizaje, n pares
f, Relación verdadera desconocida, modelo ajustado retenido
ŷValor predicho, ŷ = f̂(x)
H, LEspacio de hipótesis, función de pérdida
R(h), R̂(h)Riesgo esperado (no calculable), riesgo empírico

1.5 Por qué el término «supervisado»

DEFINICIÓN — Supervisión (en el sentido del aprendizaje automático)

Definición rigurosa

La supervisión designa la disponibilidad, para cada observación de la muestra de aprendizaje, de una señal de referencia yi correspondiente al valor que el modelo debe aprender a producir. Esta señal desempeña el papel de un supervisor en el sentido de la teoría del control: proporciona, para cada ensayo, la información de desviación que permite la corrección.

Origen terminológico

La expresión supervised learning proviene de la literatura sobre redes neuronales de los años 1950-1960, que distinguía los procedimientos que disponían de un teacher signal de los que carecían de él. El supervisor es la señal, no una persona.

Punto de vigilancia

La supervisión es una propiedad de los datos de entrenamiento, no del régimen de funcionamiento del sistema. Un modelo supervisado desplegado puede funcionar sin ninguna intervención humana; a la inversa, un sistema no supervisado puede colocarse bajo control humano permanente.

Lo que «supervisado» designaLo que «supervisado» no designa
Una etiqueta de referencia para cada observación de entrenamientoLa presencia de un operador humano durante la ejecución
Una señal de error calculable en cada ensayoUn control de calidad de las predicciones en producción
Una propiedad de la fase de aprendizajeUna propiedad del sistema desplegado
ANALOGÍA — El estudiante y el solucionario

Un estudiante prepara un examen a partir de una colección de ejercicios cada uno de los cuales va acompañado de su solución. Para cada ejercicio, propone una respuesta, la compara con la solución, constata la desviación, ajusta su método.

Elemento de la analogíaElemento formal
El enunciado del ejercicioEl vector x
La solución del solucionarioLa etiqueta y
La respuesta propuestaLa predicción ŷ
La desviación constatadaLa pérdida L(y, ŷ)
El ajuste del métodoLa actualización de los parámetros
El examen final sobre enunciados inéditosLa evaluación sobre el conjunto de test

El solucionario no es un profesor que vigila al estudiante durante la prueba: es una información de referencia disponible durante la preparación e indisponible el día del examen. Ese es exactamente el estatus de la etiqueta. La analogía también refleja el fracaso característico: el estudiante que ha memorizado las soluciones sin adquirir el método obtiene una puntuación perfecta en la colección y fracasa en el examen. Ese caso es el sobreajuste.


2. Los datos etiquetados y la procedencia de las etiquetas

DEFINICIÓN — Dato etiquetado (labeled data)

Definición rigurosa

Un dato etiquetado es un par (x, y) que asocia un vector de variables explicativas x ∈ X al valor y ∈ Y de la variable objetivo para esa misma observación, habiendo sido ese valor observado, medido o atribuido por un procedimiento exterior al modelo.

Traducción al lenguaje corriente

Una fila de tabla en la que figura, además de la información descriptiva, la respuesta que se desea poder predecir.

Condición de existencia del aprendizaje supervisado

La ausencia de etiquetas excluye el supervisado, sin excepción. Las alternativas son entonces: constituir las etiquetas (anotación, instrumentación, espera de un histórico), reformular el problema en no supervisado (capítulo 003), o renunciar.

2.1 El test operativo

¿Existe, en los datos disponibles, una columna que contenga exactamente lo que se quiere predecir, informada para las observaciones pasadas?

RespuestaConsecuencia
Sí, informada y fiableEl problema es supervisado. El resto del curso se aplica
Sí, pero parcialmente informada o dudosaProblema supervisado con reservas. La calidad de las etiquetas se convierte en el primer frente de trabajo
NoEl problema no es supervisado en su estado actual. Hay que crear la etiqueta o cambiar de paradigma

Punto de vigilancia: «exactamente lo que se quiere predecir» es una exigencia estricta. Predecir la satisfacción del cliente a partir de una columna «reabrió un ticket» equivale a predecir la reapertura de tickets, no la satisfacción.

2.2 Tres ejemplos de tablas etiquetadas

Ejemplo A — Detección de correos no deseados

Remitente conocidoN.º de enlacesMayúsculas (%)AdjuntoNo deseado
14NoNo
No1462
02No
No948No

Las cuatro primeras columnas constituyen x; la columna en negrita es y, con valores en {Sí, No}: clasificación binaria. Etiqueta procedente de la acción del usuario, mediante reporte manual.

Ejemplo B — Mantenimiento predictivo en equipo instrumentado

Vibración (mm/s)Temperatura (°C)Horas desde revisiónCiclos/díaAvería en 7 días
2,164820142No
5,8812 340168
3,4711 510151No
6,2882 780174

y binaria: clasificación. La etiqueta se reconstruye a posteriori a partir del registro de intervenciones: para cada lectura, se verifica si un fallo sobrevino en los siete días siguientes. Esta reconstrucción es el punto técnico más delicado del caso, desarrollado en el apartado 7.

Ejemplo C — Estimación de precio inmobiliario

Superficie (m²)HabitacionesAño de construcciónDistancia al centro (km)Precio de venta ($)
75219946,2272 500
100320064,1370 000
125420113,4467 500
150520182,8560 000

y numérica continua: regresión. La etiqueta es un hecho registrado, el precio consignado en la escritura de venta.

2.3 La procedencia de las etiquetas

Los tres ejemplos llevan etiquetas de naturaleza radicalmente diferente: un reporte de usuario, una reconstrucción a partir de un registro, un importe contractual. Estas diferencias determinan la fiabilidad del modelo mucho más que la elección del algoritmo.

FuenteDescripciónCosteFiabilidadTrampa asociada
Histórico naturalEl evento se produjo y fue registrado: venta cerrada, contrato cancelado, siniestro declaradoNulo a bajoAltaLa definición del evento en el sistema puede diferir de la definición de negocio; fecha de registro y fecha de ocurrencia difieren
Acción del usuarioEl usuario produce la señal: clic, compra, reporte, valoraciónNuloMediaSesgo de selección masivo: solo una minoría actúa. La ausencia de señal no equivale a señal negativa
Anotación humanaOperadores etiquetan observaciones para el proyectoAltoVariableSubjetividad, fatiga, deriva de criterio. Exige una medida de acuerdo entre anotadores
Experto del dominioUn especialista califica cada caso según su juicio profesionalMuy altoAlta en los casos típicosBajo caudal, por tanto bajo volumen. Desacuerdo entre expertos en los casos límite, que son los casos de interés
Regla de negocio automáticaUna regla existente produjo la etiqueta: umbral, motor de reglas, sistema expertoNuloIlusoriaEl modelo aprende la regla, no el fenómeno. Su rendimiento tiene como techo el del sistema que produjo las etiquetas
Medida instrumentalUn sensor proporciona el valor: sonda, contador, analizadorMedioAltaDeriva de calibración, averías que producen valores por defecto, desincronización temporal

Pregunta a investigar al inicio de todo proyecto:

¿Cómo se produjo esta etiqueta, y esa producción es fiable?

Precede a la elección del algoritmo, a la de las variables y a toda consideración de arquitectura. Se investiga con las personas que explotan el sistema fuente, no con las que explotan la base de datos.

PUNTO DE VIGILANCIA — El techo impuesto por las etiquetas procedentes de un sistema de reglas

Situación

Una organización dispone desde hace años de un motor de reglas que clasifica automáticamente las solicitudes entrantes. El histórico contiene, por tanto, para cada solicitud, la clase atribuida por ese motor: una columna inmediatamente disponible, que parece constituir una etiqueta ideal.

Lo que ocurre

El modelo se entrena para reproducir las decisiones del motor. Lo consigue, a menudo por encima del 95 % de exactitud. Esa exactitud mide la fidelidad de la imitación, no la corrección de las decisiones. Todos los errores del motor se aprenden como verdades: constituyen, en los datos, la definición misma de la respuesta correcta.

Un modelo supervisado no puede ser mejor que el procedimiento que produjo sus etiquetas. Puede ser más rápido, más regular, menos costoso, y generalizar a casos no cubiertos por las reglas explícitas. No puede ser más acertado.

Consecuencia práctica

Un proyecto así sigue siendo legítimo cuando el objetivo es la reducción del coste de ejecución, la cobertura de casos no tratados, o la simplificación de un motor que se ha vuelto ingobernable. Es ilegítimo cuando el objetivo anunciado es la mejora de la calidad de las decisiones: se requiere entonces una fuente de etiquetas independiente del sistema a reemplazar, mediante auditoría de una muestra o mediante observación del resultado real de las decisiones.


3. La mecánica de ajuste

Un algoritmo de aprendizaje supervisado no procede a ningún análisis del dominio. Ejecuta un ciclo en tres tiempos, repetido hasta la satisfacción de un criterio de parada.

Las modalidades de la corrección varían: descenso de gradiente para los modelos paramétricos y las redes neuronales, partición recursiva por maximización de una ganancia de información para los árboles, resolución analítica cerrada para los mínimos cuadrados ordinarios. La estructura lógica del ciclo es idéntica.

DEFINICIÓN — Parámetro de un modelo

Definición rigurosa

Un parámetro es una magnitud interna al modelo cuyo valor es determinado por el algoritmo de aprendizaje a partir de los datos, mediante minimización del riesgo empírico. El conjunto de los valores de los parámetros constituye el estado del modelo y basta, junto con su estructura, para reproducir sus predicciones.

Clase de modelosParámetros
Regresión lineal o logísticaCoeficientes de las variables, ordenada en el origen
Árbol de decisiónVariables de corte, umbrales, valores de las hojas
Red neuronalPesos de las conexiones, sesgos de las neuronas

Traducción al lenguaje corriente

Los parámetros son lo que la máquina aprendió: el contenido del archivo guardado al final del entrenamiento.

DEFINICIÓN — Función de pérdida (loss function)

Definición rigurosa

Una función de pérdida L : Y × Y → R+ asocia a un par (valor observado, valor predicho) una medida escalar positiva de la desviación, nula si y solo si la predicción coincide con la observación, y creciente con la gravedad de la desviación. Debe ser calculable y, para los algoritmos basados en el gradiente, derivable con respecto a los parámetros.

Estatus

Constituye la definición operativa de «predecir bien». Es una elección de ingeniería, no un dato del problema: dos funciones de pérdida diferentes aplicadas a la misma muestra producen dos modelos diferentes.

Traducción al lenguaje corriente

La regla de calificación: lo que cuenta como un fallo, y cuánto cuesta ese fallo.

Punto de vigilancia

La pérdida utilizada para la optimización y la métrica utilizada para la evaluación de negocio son dos objetos distintos, que raramente coinciden (capítulos 029 y 052).

DEFINICIÓN — Riesgo empírico (empirical risk, training loss)

Definición rigurosa

Media aritmética de las pérdidas individuales sobre la muestra: R̂(h) = (1/n) · Σ L(yi, h(xi)). Es la cantidad efectivamente minimizada por el algoritmo de aprendizaje.

Distinción con el riesgo esperado

El riesgo empírico es una media sobre n observaciones disponibles, el riesgo esperado una esperanza sobre la distribución generadora. El primero es calculable y sirve de objetivo de optimización; el segundo es el objetivo real y nunca es directamente accesible.

Punto de vigilancia

Un riesgo empírico nulo no tiene ningún valor informativo: siempre es alcanzable por un modelo suficientemente expresivo, por simple memorización de la muestra.

Función de pérdidaTipo de problemaExpresiónPropiedad
Error cuadráticoRegresión(y − ŷ)²Penaliza fuertemente las grandes desviaciones; sensible a los valores atípicos
Error absolutoRegresiónvalor absoluto de y − ŷPenalización proporcional; robusto a los valores atípicos
Entropía cruzada binariaClasificación binaria−[y·log(p) + (1−y)·log(1−p)]Opera sobre la probabilidad predicha p, no sobre la clase
Pérdida de bisagra (hinge)Clasificación con margenmax(0, 1 − y·score)Penaliza también los puntos correctos demasiado cercanos a la frontera

El error cuadrático ajusta la media condicional, el error absoluto la mediana condicional. La elección depende de la pregunta de negocio: ¿el coste de un error importante es proporcional a su tamaño, o más que proporcional?

3.1 Parámetro e hiperparámetro

CriterioParámetroHiperparámetro
Quién fija el valorEl algoritmo de aprendizajeEl ingeniero, o un procedimiento de búsqueda
CuándoDurante el entrenamientoAntes del entrenamiento
Fuente del valorLos datos de entrenamientoUna elección metodológica validada
EjemplosCoeficientes, umbrales de un árbol, pesos de una redProfundidad máxima, tasa de aprendizaje, coeficiente de regularización, número de árboles
Efecto de una modificaciónCambia las predicciones del modelo ajustadoCambia el modelo que será ajustado

Los hiperparámetros definen H y el procedimiento de optimización; los parámetros designan el punto retenido en H. Su ajuste se trata en el capítulo 009.

3.2 Lo que la mecánica no es

El ciclo no comprende ninguna etapa de comprensión, de interpretación o de razonamiento causal. Comprende una forma funcional elegida por el ingeniero, una medida de desviación elegida por el ingeniero, y un procedimiento numérico que reduce esa medida.

No hay comprensión. Hay una minimización iterativa de una cantidad escalar.

No es una precaución retórica: un modelo explotará toda regularidad estadística presente en los datos, incluidas las que no tienen ningún sentido de negocio, las que resultan de artefactos de recolección, y las que no subsistirán en producción.

ANALOGÍA — El ajuste de un instrumento por un afinador sordo

Un operador dispone de un instrumento con dos ruedas y de un cuadrante graduado que muestra una desviación. No percibe el sonido. Gira la primera rueda, lee el cuadrante, constata que la desviación ha disminuido, continúa en el mismo sentido. Cuando la desviación deja de disminuir, pasa a la segunda rueda. Tras unas decenas de ajustes, el cuadrante muestra una desviación mínima.

El operador no ha oído nada, no tiene ninguna noción de música y no podría explicar qué es una quinta justa. Ha minimizado el valor de un cuadrante.

Dos consecuencias se transponen exactamente: si el cuadrante está mal calibrado, el instrumento estará desafinado con una desviación mostrada nula —papel crítico de la función de pérdida y de las etiquetas—; si el cuadrante solo mide una cuerda de seis, las otras cinco seguirán desafinadas —papel crítico de la elección de la métrica.


4. Ilustración con cifras en regresión

Tarea: estimar el precio de venta de una vivienda a partir de su superficie. X = superficie en m², Y = precio en dólares, n = 4.

CasaSuperficie (m²)Precio observado ($)
A75272 500
B100370 000
C125467 500
D150560 000

El ingeniero postula una relación afín precio = a × superficie + b. Esta elección define H: el conjunto de las rectas del plano. Los parámetros a determinar son a (precio por metro cuadrado) y b (término constante). La función de pérdida elegida es el error absoluto, escogida por la legibilidad de los cálculos; el riesgo empírico es, por tanto, el error absoluto medio sobre las cuatro casas.

4.1 Iteración 1 — Inicialización: a = 1 000, b = 0

CasaSuperficiePrecio observadoPrecio predichoError absoluto
A75272 50075 000197 500
B100370 000100 000270 000
C125467 500125 000342 500
D150560 000150 000410 000
Error medio305 000

Todas las predicciones son inferiores a los precios observados y la desviación crece con la superficie: el coeficiente a es demasiado bajo. Dirección de corrección: aumentar a.

4.2 Iteración 2 — a = 2 000, b = 0

CasaSuperficiePrecio observadoPrecio predichoError absoluto
A75272 500150 000122 500
B100370 000200 000170 000
C125467 500250 000217 500
D150560 000300 000260 000
Error medio192 500

El error medio cae de 305 000 a 192 500: la corrección iba en la buena dirección. El diagnóstico no cambia, se continúa con un paso más grande.

4.3 Iteración 3 — a = 3 500, b = 0

CasaSuperficiePrecio observadoPrecio predichoError absoluto
A75272 500262 50010 000
B100370 000350 00020 000
C125467 500437 50030 000
D150560 000525 00035 000
Error medio23 750

El diagnóstico cambia de naturaleza: los errores son ahora del mismo orden de magnitud y todos del mismo signo, quedando las predicciones por debajo de los precios observados en unos 25 000 $. Este desfase constante no es corregible mediante a —hacerlo crecer degradaría las grandes superficies. Corresponde al término constante b.

4.4 Iteración 4 — a = 3 500, b = 25 000

CasaSuperficiePrecio observadoPrecio predichoError con signoError absoluto
A75272 500287 500−15 00015 000
B100370 000375 000−5 0005 000
C125467 500462 500+5 0005 000
D150560 000550 000+10 00010 000
Error medio8 750

Los errores son ahora de signos opuestos: dos predicciones demasiado altas, dos demasiado bajas. Ninguna corrección global de a o de b puede ya reducir el conjunto simultáneamente. El proceso ha alcanzado un régimen de compromiso, lo que constituye el criterio de parada.

4.5 El modelo final y su aplicación

precio estimado = 3 500 × superficie + 25 000

Estos dos números constituyen la totalidad de lo que se ha aprendido. Aplicado a un caso nuevo, una vivienda de 110 m² ausente de la muestra:

precio estimado = 3 500 × 110 + 25 000 = 410 000 $

El modelo produce un valor para una observación nunca encontrada. Este paso de lo conocido a lo desconocido es la generalización, tratada en el apartado 7.

Lo que este ejemplo establece

Primera enseñanza — No se moviliza ninguna comprensión del dominio

El procedimiento no movilizó ningún conocimiento del mercado inmobiliario. No consultó ningún baremo, no conoce ni la noción de barrio, ni la de estado del inmueble, ni la de tipo de interés. Produjo dos números que minimizan una media de desviaciones. El hecho de que a = 3 500 se interprete como un precio por metro cuadrado es una lectura efectuada por el analista a posteriori, no un conocimiento que posea el modelo.

Segunda enseñanza — El mecanismo es ensayo, medida, ajuste

Se han presentado cuatro iteraciones; un algoritmo real efectúa miles, con ajustes de pequeña amplitud guiados por el gradiente en lugar de por la inspección de los signos de error. La estructura lógica es la del apartado 3, sin añadidos: proponer, medir la desviación, corregir en el sentido que reduce la desviación.

Tercera enseñanza — La forma de la regla la elige el ingeniero

La máquina no decidió que el precio sería una función afín de la superficie. Esta hipótesis se planteó antes de todo cálculo y restringe definitivamente el resultado: si la relación real es en escalera, se estabiliza más allá de cierta superficie, o depende de una interacción con el barrio, este modelo nunca podrá representarla, sea cual sea el volumen de datos proporcionado. La elección de la clase de modelos es un acto de ingeniería anterior y superior al ajuste: es el error de aproximación definido en el apartado 1.


5. Ilustración en clasificación y frontera de decisión

Tarea: predecir si un prospecto efectuará una compra a partir de su edad y de su salario anual. X = (edad, salario), Y = {Compra, Sin compra}, n = 6.

ProspectoEdadSalario anual ($)Compra
P12228 000No
P22532 000No
P33141 000No
P43858 000
P54572 000
P65285 000

La diferencia formal con el apartado 4 reside en la naturaleza de Y: un conjunto finito no ordenado reemplaza un intervalo de reales. Esta única diferencia cambia la función de pérdida, las métricas de evaluación y la interpretación geométrica del modelo.

DEFINICIÓN — Frontera de decisión (decision boundary)

Definición rigurosa

Para un clasificador f̂ : X → Y, la frontera de decisión es el subconjunto de X constituido por los puntos en los que la regla de decisión cambia de clase atribuida. En el caso binario basado en una puntuación continua s(x) y un umbral t, es el conjunto de nivel { x ∈ X | s(x) = t }. Particiona X en regiones de decisión, cada una asociada a una clase.

Propiedad geométrica

En un espacio de d variables, la frontera es una hipersuperficie de dimensión d − 1: un punto sobre una recta, una curva en el plano, una superficie en dimensión tres.

Clase de modelosForma de la frontera
Regresión logísticaHiperplano: recta en el plano
Árbol de decisiónSegmentos paralelos a los ejes, en escalera
Máquina de vectores de soporte con kernelCurva regular, forma dependiente del kernel
Red neuronalHipersuperficie arbitrariamente compleja

Punto de vigilancia

La frontera es desplazable sin reentrenamiento: modificar el umbral t la desplaza a lo largo de las líneas de nivel de la puntuación. Esta propiedad se explota en el capítulo 062.

Sobre las seis observaciones, una regla afín separa perfectamente los dos grupos: puntuación bruta = salario + 1 000 × edad, frontera en 90 000.

ProspectoPuntuación brutaPosiciónClase predichaClase observada
P150 000Bajo la fronteraNoNo
P257 000Bajo la fronteraNoNo
P372 000Bajo la fronteraNoNo
P496 000Por encima
P5117 000Por encima
P6137 000Por encima

Punto de vigilancia: una separación perfecta sobre seis observaciones no es un rendimiento. Cuando el número de observaciones es bajo frente al número de variables, la separabilidad perfecta es frecuente e incluso constituye una señal de alerta en cuanto al sobreajuste (capítulo 031).

5.1 La salida probabilística y el umbral

Un clasificador no produce directamente una clase. Produce primero una puntuación continua, generalmente transformada en estimación de probabilidad condicional, y luego aplica un umbral para decidir.

DEFINICIÓN — Puntuación, probabilidad predicha y umbral de decisión

Definición rigurosa

Un clasificador probabilístico estima la ley condicional P(Y | X = x). Para un problema binario con Y = {0, 1}, produce p̂(x) ∈ [0, 1] que estima P(Y = 1 | X = x). La regla de decisión asociada a un umbral t es: ŷ = 1 si p̂(x) ≥ t, ŷ = 0 en caso contrario.

ActoNaturalezaQuién lo determinaModificable después del entrenamiento
Estimación de p̂(x)EstadísticaEl modelo, por ajuste sobre DNo, sin reentrenamiento
Elección del umbral tDecisionalLa organización, según el coste de los erroresSí, inmediatamente

Punto de vigilancia sobre la calibración

Una puntuación alta no equivale a probabilidad fiable. Un modelo está calibrado cuando, entre las observaciones a las que atribuye una puntuación de 0,80, aproximadamente el 80 % pertenecen efectivamente a la clase positiva. Las puntuaciones brutas de numerosos algoritmos no poseen esta propiedad y necesitan una recalibración (capítulo 029).

Traducción al lenguaje corriente

El modelo produce un grado de confianza. La transformación de ese grado en decisión es una elección de gestión, no una elección técnica. El valor 0,50 es un valor por defecto de implementación, nunca una justificación.

Para el caso nuevo «35 años, 60 000 $», la puntuación bruta vale 95 000, es decir, 5 000 por encima de la frontera; transformada en probabilidad, da P(y = Compra | x) = 0,81, y el umbral por defecto de 0,50 lleva a predecir «Compra». Con un umbral elevado a 0,85, la misma observación, el mismo modelo y la misma puntuación llevarían a predecir «Sin compra». El modelo no ha cambiado; la decisión ha cambiado. La elección del umbral depende del coste respectivo de los dos tipos de errores, tratado en los capítulos 052 y 062.

CriterioRegresión (apartado 4)Clasificación (apartado 5)
Naturaleza de YIntervalo de realesConjunto finito no ordenado
Salida bruta del modeloUn valor numéricoUna puntuación o una probabilidad por clase
Etapa de decisión adicionalNingunaAplicación de un umbral
Función de pérdida habitualError cuadrático, error absolutoEntropía cruzada
Interpretación geométricaCurva de ajusteFrontera de decisión
Métricas de evaluaciónError medio, coeficiente de determinaciónExactitud, precisión, recall, área bajo la curva

6. Los tres regímenes: entrenamiento, evaluación, producción

EntrenamientoEvaluaciónProducción
Naturaleza de los datosConjunto de entrenamiento, históricoConjunto de test, histórico apartadoFlujo real, observaciones nuevas
Etiqueta disponibleSí, utilizada para el ajusteSí, solo para la comparaciónNo, en el momento de la predicción
Acción del sistemaAjustar los parámetrosPredecir y medir la desviaciónPredecir
Llamada de códigomodel.fit(X_train, y_train)model.predict(X_test) luego comparación con y_testmodel.predict(x_nouveau)
¿El modelo se modifica?NoNo
AnalogíaLa preparación con las solucionesEl simulacro de examen con temas inéditosEl ejercicio profesional real
Lo que se obtieneUn modelo ajustadoUna estimación del riesgo esperadoUna decisión operativa
python
# Régimen 1 — entrenamiento: el modelo ve x e y
model.fit(X_train, y_train)

# Régimen 2 — evaluación: el modelo ve x, y sirve únicamente para la comparación
y_pred = model.predict(X_test)
score = metrique(y_test, y_pred)

# Régimen 3 — producción: y aún no existe
y_estime = model.predict(x_nouvelle_observation)

La dificultad profesional no reside en la escritura de estas tres líneas, sino en la constitución correcta de X_train, X_test y de sus etiquetas.

Punto de vigilancia mayor

Evaluar un modelo sobre los datos que sirvieron para su entrenamiento produce una estimación optimista, carente de valor informativo.

La justificación formal se dio en el apartado 1: fue seleccionada precisamente para minimizar sobre esas observaciones, de modo que R̂(f̂) es un estimador sesgado de R(f̂). Las modalidades de partición y la validación cruzada se tratan en el capítulo 026.

DEFINICIÓN — Conjunto de entrenamiento, conjunto de validación, conjunto de test

Definición rigurosa

  • El conjunto de entrenamiento es el subconjunto de D utilizado para el ajuste de los parámetros.
  • El conjunto de validación es el subconjunto utilizado para las elecciones efectuadas por el ingeniero: hiperparámetros, clase de modelos, variables retenidas.
  • El conjunto de test es el subconjunto reservado a la estimación final del riesgo esperado, utilizado una sola vez, después de que todas las elecciones se hayan cerrado.

Justificación de la distinción validación / test

Toda elección efectuada a la vista de una puntuación sobre un conjunto de datos optimiza implícitamente sobre ese conjunto. Un conjunto de validación consultado varias decenas de veces deja de ser neutro: el proceso de selección ha introducido en él un sesgo optimista, de naturaleza idéntica al del conjunto de entrenamiento aunque de menor amplitud.

Regla operativa

El conjunto de test solo se abre una vez, y el resultado obtenido es el que se reporta. Si se consulta y luego se sigue de una modificación del modelo, ha cambiado de naturaleza y se ha convertido en un conjunto de validación.

ANALOGÍA — El simulacro de examen

Una escuela desea estimar los resultados de sus estudiantes en el examen final.

Protocolo defectuoso: el simulacro retoma los ejercicios de la colección de entrenamiento. Los resultados son excelentes y no predicen nada; miden la memorización de la colección.

Protocolo válido: el simulacro trata sobre temas inéditos, de la misma naturaleza y la misma dificultad que los del examen final. Los resultados son más bajos y constituyen una estimación utilizable.

La diferencia entre los dos protocolos no es la dificultad de los temas, sino el hecho de que estos hayan sido, o no, utilizados durante la preparación. Es la única pregunta que gobierna la validez de una evaluación.


7. La generalización como objetivo único

DEFINICIÓN — Generalización

Definición rigurosa

La generalización designa la capacidad de un modelo ajustado para mantener un nivel de rendimiento dado sobre observaciones procedentes de la misma distribución P(X, Y) que las de la muestra de aprendizaje, pero no observadas durante el ajuste. Se cuantifica mediante la brecha de generalización R(f̂) − R̂(f̂): una brecha pequeña indica que el rendimiento medido sobre la muestra es representativo del rendimiento esperado.

Condición de validez

La definición contiene una condición explícita: «procedentes de la misma distribución». Cuando la distribución de los datos de producción difiere de la de los datos de aprendizaje, la garantía ya no se aplica. Este fenómeno es la deriva, tratada en el capítulo 082; la generalización no protege contra ella.

Traducción al lenguaje corriente

Generalizar es funcionar sobre casos nunca encontrados, y no solo sobre los que sirvieron para el aprendizaje.

Error de entrenamientoError de generalización
DefiniciónRiesgo empírico sobre el conjunto de entrenamientoRiesgo esperado sobre la distribución generadora
NotaciónR̂(f̂) sobre D_trainR(f̂)
CalculableSí, directamenteNo, solo estimable
Estimador prácticoError medido sobre el conjunto de test
Lo que mideLa calidad del ajuste a los datos vistosLa calidad esperada en producción
¿Puede ser nulo?Sí, mediante un modelo suficientemente expresivoNo, el error irreducible lo acota
Valor decisionalNulo tomado aisladamenteÚnico valor decisional del proyecto

La brecha entre ambos constituye el diagnóstico principal del practicante.

Error de entrenamientoError de testDiagnósticoTratamiento
AltoAltoSubajuste (underfitting): modelo demasiado restringidoEnriquecer las variables, aumentar la expresividad
BajoAltoSobreajuste (overfitting): el modelo ha memorizadoRegularizar, simplificar, aumentar el volumen
BajoBajoRégimen satisfactorioVerificar la ausencia de fuga (capítulo 028)
AltoBajoSituación anormalVerificar el protocolo de partición

7.1 El ejemplo canónico

Un modelo de previsión de la demanda se entrena con los datos de enero a junio. Alcanza un error medio del 3,1 % sobre ese período. Esta cifra no presenta ningún interés decisional: describe la capacidad del modelo para reajustar un período cuyos valores ya conoce.

La única pregunta que importa es: ¿cuál es el error en julio?

Julio no fue observado durante el ajuste. El rendimiento en julio es la única información que informa sobre lo que el modelo producirá en agosto y en todo período venidero. Lo que vale para una separación temporal vale para una separación aleatoria, por sitio, por cliente o por región. La pregunta es invariante: ¿cuál es el rendimiento sobre lo que no sirvió para el ajuste?

Ninguna de estas técnicas tiene finalidad propia. La separación de los datos no existe para respetar una convención; la regularización no existe para producir modelos más elegantes. Cada una existe para hacer estimable el error de generalización, o para reducirlo.

Un practicante que no relaciona el conjunto de sus elecciones metodológicas con la brecha de generalización aplica recetas.

ANALOGÍA — El actor que memorizó su texto

Un actor conoce íntegramente el texto de su obra. Lo restituye sin fallo, con las entonaciones ajustadas en los ensayos: sobre ese repertorio, su rendimiento es perfecto.

La noche de la representación, un compañero se salta una réplica. El actor que memorizó se interrumpe: la secuencia aprendida ya no corresponde a la situación. El actor que comprendió la situación dramática improvisa una réplica coherente y continúa. Ambos eran indistinguibles en los ensayos: obtenían la misma puntuación sobre el conjunto de entrenamiento.

ActorSobre el texto conocidoSobre la situación imprevistaModelo correspondiente
El que memorizóPerfectoDeficienteSobreajuste
El que comprendióBuenoBuenoGeneralización

Punto de transposición: la única manera de distinguir a los dos actores es colocarlos ante una situación no ensayada. Esa es exactamente la función del conjunto de test. Sin esa puesta a prueba, los dos perfiles son indistinguibles —y el perfil deficiente obtiene incluso las mejores puntuaciones aparentes.

7.2 Estudio de caso — Mantenimiento predictivo en un parque de 300 máquinas

Contexto. Un industrial explota 300 máquinas instrumentadas repartidas en cuatro sitios, que transmiten en continuo lecturas de vibración, de temperatura, de consumo eléctrico y de contadores de uso. El servicio de mantenimiento dispone de un registro de intervenciones que cubre treinta meses. Una inmovilización no planificada cuesta alrededor de 18 000 $ en producción perdida; una intervención preventiva planificada, alrededor de 1 200 $.

Etapa 1 — Verificación de la viabilidad del supervisado

CondiciónVerificación efectuadaEstado
Existe un objetivo observable en el históricoEl registro permite fechar cada falloSatisfecha
El histórico es suficiente en volumen y en eventos30 meses, 300 máquinas, 412 fallos no planificadosSatisfecha
Las variables están disponibles en el momento de la predicciónLecturas con marca de tiempo, accesibles en tiempo realSatisfecha
La predicción abre a una decisión accionablePuede planificarse una intervención preventivaSatisfecha
El coste del error es aceptableFalso positivo 1 200 $, falso negativo 18 000 $Satisfecha, con fuerte asimetría

Etapa 2 — Formulación operativa del objetivo

La formulación de negocio inicial —«anticipar las averías»— no es explotable tal cual. Se investigaron cuatro formulaciones candidatas.

Formulación candidataTipo de problemaDefecto descalificador
«¿La máquina está actualmente averiada?»Clasificación sobre estado instantáneoLa variable es directamente observable y la avería ya ocurrió. Ninguna anticipación, por tanto ninguna decisión posible
«¿Cuál es la vida útil residual?»RegresiónExige la fecha exacta del fallo futuro para cada observación. Las máquinas en servicio no tienen fecha de fin: la muestra está censurada, lo que invalida una regresión ingenua
«¿La máquina se averiará algún día?»Clasificación sin horizonteObjetivo degenerado: la respuesta es positiva para todas las máquinas. Prevalencia del 100 %, ninguna información que aprender
«¿La máquina se averiará en los próximos 7 días?»Clasificación binaria con horizonte fijadoRetenida. Defectos residuales conocidos y gestionables: fuerte desequilibrio de clases, sensibilidad a la elección del horizonte

Objetivo retenido: panne_7j = 1 si un fallo no planificado sobreviene en la máquina en los 7 días siguientes a la fecha de la lectura, 0 en caso contrario.

Etapa 3 — Justificación del horizonte por el plazo de intervención

Horizonte consideradoConsecuencia
2 díasPredicciones más exactas pero inexplotables: la pieza no se entrega a tiempo. Ningún valor de negocio
7 díasCompatible con la cadena logística de intervención. Horizonte retenido
30 díasSeñal precursora demasiado débil a ese plazo: la prevalencia aumenta pero la separabilidad cae. Alertas demasiado numerosas y demasiado precoces

Principio: el horizonte de un objetivo predictivo se deduce del plazo de accionabilidad de la decisión, nunca de la comodidad estadística.

Etapa 4 — Variables candidatas

VariableDescripciónJustificación de negocio
vib_rms_24hVibración eficaz media en 24 horasIndicador directo del desgaste de los rodamientos y del desequilibrio
vib_delta_7jDesviación respecto a la media de los 7 días anterioresLa degradación se manifiesta por una evolución, no por un nivel absoluto propio de cada máquina
temp_max_24hTemperatura máxima del cárter en 24 horasUn calentamiento anormal señala una fricción o un defecto de lubricación
temp_ecart_consigneDesviación respecto a la temperatura nominal del modeloNormaliza la temperatura entre máquinas de generaciones diferentes
heures_depuis_maintenanceHoras de funcionamiento desde la última intervenciónEl desgaste es función del tiempo de servicio, no del tiempo calendario
cycles_jour_moyen_7jNúmero medio de ciclos diarios en 7 díasMide la intensidad de solicitación
conso_elec_ecartDesviación de consumo respecto a la línea de base de la máquinaUn sobreconsumo a carga constante indica una resistencia mecánica aumentada
nb_arrets_courts_30jNúmero de microparadas en 30 díasLas microparadas preceden frecuentemente a los fallos mayores
age_machine_moisAntigüedad de la máquinaLa tasa de fallo depende de la posición en el ciclo de vida
siteSitio de explotaciónCaptura las diferencias de entorno: temperatura ambiente, calidad del aire, prácticas locales de mantenimiento

Punto de vigilancia: vib_delta_7j, temp_ecart_consigne y conso_elec_ecart son variables construidas, no lecturas brutas. Su construcción debe ser reproducible de forma idéntica en producción (capítulo 040).

Etapa 5 — Estructura del conjunto de datos

Una observación es un par (máquina, fecha), es decir, unas 270 000 filas. Tasa de eventos positivos: alrededor del 1,1 %.

machine_iddatevib_rms_24hvib_delta_7jtemp_max_24hheures_depuis_maint.nb_arrets_courts_30jsitepanne_7j
M-0142024-03-112,1+0,1648200Nord0
M-0142024-03-122,2+0,2658280Nord0
M-0872024-05-025,8+2,4812 3404Sud1
M-0872024-05-036,1+2,7842 3485Sud1
M-2012024-07-193,4+0,3711 5101Est0
M-2332024-09-086,2+3,1882 7807Nord1

Etapa 6 — Estructura del modelo aprendido

Un árbol de decisión de poca profundidad ajustado sobre estos datos produce la estructura siguiente; las probabilidades son las de la clase positiva en cada hoja.

Lectura: la variable más discriminante no es el nivel de vibración sino su variación reciente, resultado coherente con la experiencia de negocio —cada máquina posee su propia firma vibratoria, y es la desviación respecto a esa firma la que porta la información. Esta coherencia no constituye una validación, pero su ausencia habría constituido una señal de alerta sobre la construcción de los datos.

Etapa 7 — Las cinco trampas esperadas

TrampaManifestación en este casoConsecuencia si no se trataCapítulo
Desequilibrio de clases1,1 % de observaciones positivasUn modelo que predice siempre «sin avería» alcanza el 98,9 % de exactitud y no detecta nada. La exactitud es inutilizable como métrica050
Coste asimétrico de los erroresFalso negativo 18 000 $, falso positivo 1 200 $, relación de 15 a 1Un umbral en 0,50 minimiza el número de errores, no su coste. El umbral debe bajarse hasta el punto de equilibrio económico052 y 075
Fuga de datosLas columnas date_intervention, code_panne y duree_arret solo se informan después del falloRendimiento casi perfecto en validación, colapso en producción. Modo de fallo más frecuente en este tipo de proyecto028
Sobreajuste270 000 filas pero 412 eventos reales, y fuertes correlaciones entre lecturas sucesivas de una misma máquinaEl modelo memoriza las firmas de las máquinas que han tenido una avería en lugar de aprender el mecanismo de degradación031
DerivaRenovación del parque, cambio de proveedor de piezas, modificación de las cadenciasEl rendimiento se degrada progresivamente sin alerta, mientras los sensores siguen emitiendo valores plausibles082
PUNTO DE VIGILANCIA — La partición aleatoria por fila sobre datos temporales

Lo que ocurre

Extraer aleatoriamente el 20 % de las 270 000 filas para constituir el conjunto de test coloca las lecturas de la máquina M-087 del 2 de mayo en entrenamiento y las del 3 de mayo en test, cuando son casi idénticas. El modelo se evalúa sobre observaciones de las que ha visto casi réplicas durante el ajuste: el error de test se convierte en un estimador optimista del error de generalización, al no estar satisfecha en la práctica la condición «no observadas», aunque lo esté formalmente a nivel de fila.

Protocolo correcto

La partición debe reproducir la situación de producción: el modelo se aplicará a fechas posteriores a las de su entrenamiento, y a veces a máquinas recién instaladas.

ParticiónPregunta a la que responde
Temporal: entrenamiento sobre 24 meses, test sobre los 6 últimos¿El modelo funciona sobre el período venidero?
Por máquina: entrenamiento sobre 240 máquinas, test sobre 60 reservadas¿El modelo funciona sobre una máquina nunca observada?

Las dos estimaciones son útiles y responden a preguntas distintas (capítulo 026).


8. Errores de razonamiento frecuentes

ERROR — Atribuir al modelo una comprensión del dominio

El ejemplo del apartado 4 produjo a = 3 500. Es tentador concluir que el modelo «sabe» que el metro cuadrado vale 3 500 $. El modelo no posee ninguna noción de metro cuadrado, de precio ni de vivienda: posee dos números que minimizan una media de desviaciones sobre cuatro observaciones.

Consecuencia operativa: una superficie de 900 m² producirá una estimación de 3 175 000 $ sin que ningún mecanismo alerte sobre lo absurdo de la extrapolación.

Formulación correcta: «El modelo ajustó dos parámetros que minimizan la desviación media respecto a los precios observados sobre la muestra proporcionada.»

ERROR — Interpretar «supervisado» como una supervisión humana en producción

La supervisión califica la disponibilidad de etiquetas de referencia durante el entrenamiento. No describe el régimen de funcionamiento del sistema desplegado, que puede ser enteramente automático. Esta confusión lleva a suponer un control humano que no existe, y a no prever las salvaguardas necesarias.

Formulación correcta: «El aprendizaje se llama supervisado porque cada observación de entrenamiento iba acompañada del valor objetivo a reproducir. La presencia de un operador en producción es una decisión distinta.»

ERROR — Tratar la etiqueta como un dato neutro

La etiqueta se presenta como la verdad de referencia. En realidad es el producto de un procedimiento —registro, declaración, juicio, regla— que posee sus sesgos, sus ángulos muertos y su propia tasa de error.

Caso característico: entrenar un modelo con los fraudes detectados equivale a aprender a detectar lo que el dispositivo actual ya detecta; los fraudes que se le escapan están etiquetados «no fraudulentos» en los datos.

Formulación correcta: «El rendimiento del modelo está acotado por la calidad del procedimiento que produjo las etiquetas. La primera etapa del proyecto es la investigación de ese procedimiento.»

ERROR — Formular el objetivo sin definición operativa ni horizonte

«Predecir las averías», «predecir el abandono», «predecir el fraude» no son objetivos sino intenciones. Un objetivo explotable comprende tres elementos: un evento definido sin ambigüedad, un horizonte temporal, y una fecha de observación a partir de la cual corre ese horizonte. Sin ellos, la columna objetivo no puede construirse, y dos personas que trabajen en el mismo proyecto construirán dos versiones diferentes.

Formulación correcta: «panne_7j vale 1 cuando un fallo no planificado sobreviene en los 7 días siguientes a la fecha de la lectura, 0 en caso contrario.»

ERROR — Evaluar el modelo sobre los datos de entrenamiento

La puntuación obtenida sobre los datos que sirvieron para el ajuste es un estimador optimistamente sesgado del riesgo esperado: el modelo fue seleccionado para minimizar precisamente esa cantidad. Un árbol de decisión sin restricciones alcanza el 100 % de exactitud sobre sus datos de entrenamiento, sean cuales sean los datos; esa cifra solo mide su capacidad de memorización.

Formulación correcta: «El error reportado es el medido sobre un conjunto de test constituido por observaciones que no participaron ni en el ajuste de los parámetros ni en la selección de los hiperparámetros.»

ERROR — Confundir parámetro e hiperparámetro

Los parámetros los determina el algoritmo a partir de los datos; los hiperparámetros se fijan antes del entrenamiento y definen el espacio de hipótesis así como el procedimiento de optimización.

Consecuencia operativa: los hiperparámetros no pueden ajustarse sobre el conjunto de entrenamiento, puesto que gobiernan la capacidad del modelo para ajustarse a él; tal ajuste conduce sistemáticamente al modelo más expresivo posible, por tanto al sobreajuste (capítulo 009).

Formulación correcta: «Los hiperparámetros se seleccionan por validación sobre datos distintos de los que sirven para el ajuste de los parámetros.»

ERROR — Utilizar una variable no disponible en el instante de la predicción

Una variable presente en el histórico no está necesariamente disponible en el momento en que la predicción deberá producirse: el registro de mantenimiento contiene la duración de la parada, conocida solo después de la avería.

Test a aplicar sistemáticamente: para cada variable candidata, preguntarse si su valor será conocido en el instante exacto en que el modelo deberá predecir en producción. Toda respuesta negativa descalifica la variable. El síntoma es un rendimiento anormalmente alto en validación seguido de un colapso en producción: es la fuga de datos, tratada en el capítulo 028.

Formulación correcta: «El conjunto de las variables retenidas está disponible en el instante de la predicción, lo que se verificó variable por variable con los operadores del sistema fuente.»

ERROR — Considerar el rendimiento medido como adquirido en el tiempo

La definición de la generalización contiene la condición «procedentes de la misma distribución». Esta condición es verificable en el momento de la evaluación; no está garantizada después. Un modelo validado al 92 % de exactitud puede funcionar al 71 % dieciocho meses más tarde sin que se haya producido ningún error técnico y sin que se dispare ninguna alerta.

Formulación correcta: «El rendimiento medido vale para la distribución observada durante el período de evaluación. Se prevé un dispositivo de supervisión de la deriva y un procedimiento de reentrenamiento (capítulo 082).»


9. Síntesis

FORMALIZACIÓN
    Datos     : D = {(xi, yi)}, i = 1..n, extraídos de P(X, Y) desconocida y fija
    Hipótesis : existe f : X → Y, eventualmente ruidosa
    Objetivo  : minimizar el riesgo esperado      R(h)  = E[L(y, h(x))]
    Realidad  : se minimiza el riesgo empírico    R^(h) = (1/n) Σ L(yi, h(xi))
    Principio : minimización del riesgo empírico (ERM)

EL TÉRMINO « SUPERVISADO »
    Designa la disponibilidad de una etiqueta de referencia en el entrenamiento.
    No designa ninguna vigilancia humana en ejecución.

LAS ETIQUETAS
    Seis fuentes : histórico natural, acción del usuario, anotación humana,
    experto del dominio, regla de negocio automática, medida instrumental.
    Pregunta obligatoria : ¿cómo se produjo la etiqueta?
    Etiquetas procedentes de un sistema de reglas : el rendimiento tiene ahí su techo.

LA MECÁNICA
    Ensayo  ->  Medida del error  ->  Corrección  ->  Ensayo ...
    Parámetro      : ajustado por el algoritmo, a partir de los datos
    Hiperparámetro : fijado por el ingeniero, antes del entrenamiento
    No hay comprensión. Hay una minimización iterativa.

LOS DOS TIPOS DE PROBLEMAS
    Regresión      : Y continuo  ->  un valor
    Clasificación  : Y finito    ->  una puntuación, luego un umbral, luego una clase
    La frontera de decisión se desplaza cambiando el umbral,
    sin reentrenar el modelo.

LOS TRES REGÍMENES
    Entrenamiento : y conocido y utilizado   model.fit(X_train, y_train)
    Evaluación    : y conocido, oculto       model.predict(X_test) luego comparación
    Producción    : y desconocido            model.predict(x_nouveau)

EL OBJETIVO ÚNICO
    Brecha de generalización = riesgo esperado − riesgo empírico
    Error de entrenamiento : sin valor decisional
    Error de test          : única estimación utilizable
    Separación de los datos, validación cruzada, regularización, detección
    del sobreajuste : ninguna tiene finalidad propia.
    Todas sirven a la generalización.

Enunciado de síntesis

El aprendizaje supervisado consiste en ajustar una función parametrizada sobre una muestra de observaciones etiquetadas, minimizando un riesgo empírico que no es más que un sustituto calculable del riesgo realmente perseguido; el valor del modelo nunca se mide sobre las observaciones que sirvieron para ajustarlo, sino sobre las que no ha visto.


Quiz asociados: 004.1-quiz-formalisation.md, 004.2-quiz-donnees-etiquetees.md, 004.3-quiz-mecanique-ajustement.md, 004.4-quiz-regression-chiffree.md, 004.5-quiz-classification-frontiere.md, 004.6-quiz-trois-regimes.md, 004.7-quiz-generalisation.md

Capítulo siguiente: 005-dataset-observation.md