Los capítulos 001 a 003 situaron el aprendizaje supervisado en la taxonomía del dominio y distinguieron las tres familias de aprendizaje. Este capítulo pasa de la situación a la mecánica: lo que contiene un problema supervisado, lo que hace el algoritmo cuando ajusta un modelo, y lo que se mide cuando se evalúa.
La definición se da en cuatro niveles de precisión decreciente. Los cuatro enuncian lo mismo. El primero debe dominarse, los otros tres sirven para la transmisión.
Los espacios. Un espacio de entradas X (típicamente X ⊆ R^d, donde d es el
número de variables explicativas) y un espacio de salidas Y. La naturaleza de Y
determina el tipo de problema: Y ⊆ R para la regresión,
Y = {c1, ..., cK} finito y no ordenado para la clasificación.
La distribución generadora. Los pares observación-etiqueta se suponen
procedentes de una distribución conjunta P(X, Y), desconocida y supuestamente fija durante
el período considerado. Sin esta hipótesis, nada de lo observado
informa sobre lo que no lo es.
La hipótesis de dependencia. Se postula una relación entre X e Y,
formalizada por una función desconocida f : X → Y, o en el caso general en que la
relación es ruidosa, por la ley condicional P(Y | X). El modelo habitual
se escribe y = f(x) + ε, donde ε es un término aleatorio de esperanza nula
que representa lo que influye en y sin ser capturado por x.
La muestra. No se dispone ni de f, ni de P, sino de una muestra finita
D = {(x1, y1), (x2, y2), ..., (xn, yn)}, (xi, yi) ~ P(X, Y)de n observaciones supuestamente independientes e idénticamente distribuidas.
El criterio. Una función de pérdida L : Y × Y → R+ cuantifica la desviación entre
valor predicho y valor observado. El riesgo esperado de una hipótesis h es
R(h) = E[L(y, h(x))], recayendo la esperanza sobre (x, y) ~ P(X, Y). El objetivo
teórico es h* = argmin R(h) sobre el espacio de hipótesis H, conjunto de las
funciones que la clase de modelos elegida puede representar.
El obstáculo y su rodeo. R(h) no es calculable, al ser P
desconocida. Se sustituye por el riesgo empírico
R̂(h) = (1/n) · Σ L(yi, h(xi)) para i = 1..ny se resuelve el problema accesible f̂ = argmin R̂(h) sobre H. Este principio es
la minimización del riesgo empírico (Empirical Risk Minimization, ERM);
constituye el fundamento formal del aprendizaje supervisado.
Definición rigurosa
El riesgo esperado es la esperanza de la pérdida bajo la distribución
generadora: R(h) = E[L(y, h(x))]. Cuantifica el rendimiento de h sobre
el conjunto de las observaciones que la distribución puede producir, observadas o no.
El riesgo empírico es la media de la pérdida sobre la muestra disponible.
Es un estimador sin sesgo de R(h) para una hipótesis fijada de antemano.
La minimización del riesgo empírico (Vapnik, 1995) consiste en retener
la hipótesis que minimiza R̂ sobre H, en sustitución de la minimización
inaccesible de R.
Punto de vigilancia central
La ausencia de sesgo vale para una hipótesis fijada antes de observar
la muestra. Desde el momento en que f̂ se selecciona minimizando R̂, la
cantidad R̂(f̂) se convierte en un estimador optimistamente sesgado de R(f̂). Es
la justificación formal de la separación de los datos (capítulo 026) y
el origen mecánico del sobreajuste (capítulo 031).
Traducción al lenguaje corriente
Se querría el modelo que menos se equivoca en todos los casos posibles; solo se puede medir el error en los casos de que se dispone. Se elige, por tanto, el modelo que menos se equivoca en esos, sabiendo que esa puntuación es halagadora.
| Término de error | Origen | Palanca de reducción |
|---|---|---|
| Aproximación | La mejor función de H sigue alejada de f | Ampliar H: modelo más expresivo, variables adicionales |
| Estimación | n es finito, R̂ solo estima R imperfectamente | Aumentar n, restringir H, regularizar |
| Optimización | El algoritmo no alcanza exactamente el mínimo de R̂ | Ajustar el procedimiento de optimización |
| Irreducible | El ruido ε: y no está determinado por x | Ninguna. Acota el rendimiento alcanzable |
Ampliar H reduce el error de aproximación y aumenta el error de estimación.
Este arbitraje es el compromiso sesgo-varianza, tratado en el capítulo 031.
El aprendizaje supervisado consiste en ajustar una función parametrizada sobre un conjunto de ejemplos cuyo valor a predecir es conocido, minimizando una medida de desviación entre valores predichos y valores observados, con el fin de aplicar después esa función a observaciones cuyo valor es desconocido.
Formulación destinada a un documento de diseño. Nombra los cuatro elementos obligatorios: ejemplos etiquetados, función parametrizada, medida de desviación, aplicación a lo desconocido.
Se proporciona a un algoritmo un gran número de casos pasados acompañados de su respuesta. El algoritmo busca la regla que mejor relaciona la información disponible con la respuesta. Esa regla se aplica después a casos nuevos, para los cuales la respuesta no es conocida.
Formulación destinada a un comité de dirección. No contiene ninguna aproximación falsa; omite el formalismo.
Lectura: la flecha Y → ALG solo existe en la fase de entrenamiento. Es ella,
y solo ella, la que distingue el aprendizaje supervisado del no supervisado
(capítulo 003).
| Nivel | Formulación | Destinatario | Contexto de uso |
|---|---|---|---|
| 1 | Matemática: f̂ = argmin R̂(h) sobre H, D ~ P(X,Y) | Data scientist, examinador | Entrevista técnica, especificación |
| 2 | Técnica: función parametrizada ajustada por minimización de una desviación | Ingeniero, arquitecto | Documento de diseño |
| 3 | Corriente: casos pasados con respuesta, regla inducida, aplicación a lo nuevo | Dirección, negocio | Comité de dirección |
| 4 | Gráfica: dos fases, una flecha discriminante | Todo público | Soporte de presentación |
| Símbolo | Designación |
|---|---|
x, y | Vector de variables explicativas, etiqueta observada |
n, d | Número de observaciones, número de variables |
P(X, Y) | Distribución conjunta generadora, desconocida |
D | Muestra de aprendizaje, n pares |
f, f̂ | Relación verdadera desconocida, modelo ajustado retenido |
ŷ | Valor predicho, ŷ = f̂(x) |
H, L | Espacio de hipótesis, función de pérdida |
R(h), R̂(h) | Riesgo esperado (no calculable), riesgo empírico |
Definición rigurosa
La supervisión designa la disponibilidad, para cada observación de la muestra
de aprendizaje, de una señal de referencia yi correspondiente al valor que
el modelo debe aprender a producir. Esta señal desempeña el papel de un supervisor en el
sentido de la teoría del control: proporciona, para cada ensayo, la información
de desviación que permite la corrección.
Origen terminológico
La expresión supervised learning proviene de la literatura sobre redes neuronales de los años 1950-1960, que distinguía los procedimientos que disponían de un teacher signal de los que carecían de él. El supervisor es la señal, no una persona.
Punto de vigilancia
La supervisión es una propiedad de los datos de entrenamiento, no del régimen de funcionamiento del sistema. Un modelo supervisado desplegado puede funcionar sin ninguna intervención humana; a la inversa, un sistema no supervisado puede colocarse bajo control humano permanente.
| Lo que «supervisado» designa | Lo que «supervisado» no designa |
|---|---|
| Una etiqueta de referencia para cada observación de entrenamiento | La presencia de un operador humano durante la ejecución |
| Una señal de error calculable en cada ensayo | Un control de calidad de las predicciones en producción |
| Una propiedad de la fase de aprendizaje | Una propiedad del sistema desplegado |
Un estudiante prepara un examen a partir de una colección de ejercicios cada uno de los cuales va acompañado de su solución. Para cada ejercicio, propone una respuesta, la compara con la solución, constata la desviación, ajusta su método.
| Elemento de la analogía | Elemento formal |
|---|---|
| El enunciado del ejercicio | El vector x |
| La solución del solucionario | La etiqueta y |
| La respuesta propuesta | La predicción ŷ |
| La desviación constatada | La pérdida L(y, ŷ) |
| El ajuste del método | La actualización de los parámetros |
| El examen final sobre enunciados inéditos | La evaluación sobre el conjunto de test |
El solucionario no es un profesor que vigila al estudiante durante la prueba: es una información de referencia disponible durante la preparación e indisponible el día del examen. Ese es exactamente el estatus de la etiqueta. La analogía también refleja el fracaso característico: el estudiante que ha memorizado las soluciones sin adquirir el método obtiene una puntuación perfecta en la colección y fracasa en el examen. Ese caso es el sobreajuste.
Definición rigurosa
Un dato etiquetado es un par (x, y) que asocia un vector de variables
explicativas x ∈ X al valor y ∈ Y de la variable objetivo para esa misma
observación, habiendo sido ese valor observado, medido o atribuido por un
procedimiento exterior al modelo.
Traducción al lenguaje corriente
Una fila de tabla en la que figura, además de la información descriptiva, la respuesta que se desea poder predecir.
Condición de existencia del aprendizaje supervisado
La ausencia de etiquetas excluye el supervisado, sin excepción. Las alternativas son entonces: constituir las etiquetas (anotación, instrumentación, espera de un histórico), reformular el problema en no supervisado (capítulo 003), o renunciar.
¿Existe, en los datos disponibles, una columna que contenga exactamente lo que se quiere predecir, informada para las observaciones pasadas?
| Respuesta | Consecuencia |
|---|---|
| Sí, informada y fiable | El problema es supervisado. El resto del curso se aplica |
| Sí, pero parcialmente informada o dudosa | Problema supervisado con reservas. La calidad de las etiquetas se convierte en el primer frente de trabajo |
| No | El problema no es supervisado en su estado actual. Hay que crear la etiqueta o cambiar de paradigma |
Punto de vigilancia: «exactamente lo que se quiere predecir» es una exigencia estricta. Predecir la satisfacción del cliente a partir de una columna «reabrió un ticket» equivale a predecir la reapertura de tickets, no la satisfacción.
Ejemplo A — Detección de correos no deseados
| Remitente conocido | N.º de enlaces | Mayúsculas (%) | Adjunto | No deseado |
|---|---|---|---|---|
| Sí | 1 | 4 | No | No |
| No | 14 | 62 | Sí | Sí |
| Sí | 0 | 2 | Sí | No |
| No | 9 | 48 | No | Sí |
Las cuatro primeras columnas constituyen x; la columna en negrita es y, con
valores en {Sí, No}: clasificación binaria. Etiqueta procedente de
la acción del usuario, mediante reporte manual.
Ejemplo B — Mantenimiento predictivo en equipo instrumentado
| Vibración (mm/s) | Temperatura (°C) | Horas desde revisión | Ciclos/día | Avería en 7 días |
|---|---|---|---|---|
| 2,1 | 64 | 820 | 142 | No |
| 5,8 | 81 | 2 340 | 168 | Sí |
| 3,4 | 71 | 1 510 | 151 | No |
| 6,2 | 88 | 2 780 | 174 | Sí |
y binaria: clasificación. La etiqueta se reconstruye a posteriori a
partir del registro de intervenciones: para cada lectura, se verifica si un
fallo sobrevino en los siete días siguientes. Esta reconstrucción es
el punto técnico más delicado del caso, desarrollado en el apartado 7.
Ejemplo C — Estimación de precio inmobiliario
| Superficie (m²) | Habitaciones | Año de construcción | Distancia al centro (km) | Precio de venta ($) |
|---|---|---|---|---|
| 75 | 2 | 1994 | 6,2 | 272 500 |
| 100 | 3 | 2006 | 4,1 | 370 000 |
| 125 | 4 | 2011 | 3,4 | 467 500 |
| 150 | 5 | 2018 | 2,8 | 560 000 |
y numérica continua: regresión. La etiqueta es un hecho registrado, el
precio consignado en la escritura de venta.
Los tres ejemplos llevan etiquetas de naturaleza radicalmente diferente: un reporte de usuario, una reconstrucción a partir de un registro, un importe contractual. Estas diferencias determinan la fiabilidad del modelo mucho más que la elección del algoritmo.
| Fuente | Descripción | Coste | Fiabilidad | Trampa asociada |
|---|---|---|---|---|
| Histórico natural | El evento se produjo y fue registrado: venta cerrada, contrato cancelado, siniestro declarado | Nulo a bajo | Alta | La definición del evento en el sistema puede diferir de la definición de negocio; fecha de registro y fecha de ocurrencia difieren |
| Acción del usuario | El usuario produce la señal: clic, compra, reporte, valoración | Nulo | Media | Sesgo de selección masivo: solo una minoría actúa. La ausencia de señal no equivale a señal negativa |
| Anotación humana | Operadores etiquetan observaciones para el proyecto | Alto | Variable | Subjetividad, fatiga, deriva de criterio. Exige una medida de acuerdo entre anotadores |
| Experto del dominio | Un especialista califica cada caso según su juicio profesional | Muy alto | Alta en los casos típicos | Bajo caudal, por tanto bajo volumen. Desacuerdo entre expertos en los casos límite, que son los casos de interés |
| Regla de negocio automática | Una regla existente produjo la etiqueta: umbral, motor de reglas, sistema experto | Nulo | Ilusoria | El modelo aprende la regla, no el fenómeno. Su rendimiento tiene como techo el del sistema que produjo las etiquetas |
| Medida instrumental | Un sensor proporciona el valor: sonda, contador, analizador | Medio | Alta | Deriva de calibración, averías que producen valores por defecto, desincronización temporal |
Pregunta a investigar al inicio de todo proyecto:
¿Cómo se produjo esta etiqueta, y esa producción es fiable?
Precede a la elección del algoritmo, a la de las variables y a toda consideración de arquitectura. Se investiga con las personas que explotan el sistema fuente, no con las que explotan la base de datos.
Situación
Una organización dispone desde hace años de un motor de reglas que clasifica automáticamente las solicitudes entrantes. El histórico contiene, por tanto, para cada solicitud, la clase atribuida por ese motor: una columna inmediatamente disponible, que parece constituir una etiqueta ideal.
Lo que ocurre
El modelo se entrena para reproducir las decisiones del motor. Lo consigue, a menudo por encima del 95 % de exactitud. Esa exactitud mide la fidelidad de la imitación, no la corrección de las decisiones. Todos los errores del motor se aprenden como verdades: constituyen, en los datos, la definición misma de la respuesta correcta.
Un modelo supervisado no puede ser mejor que el procedimiento que produjo sus etiquetas. Puede ser más rápido, más regular, menos costoso, y generalizar a casos no cubiertos por las reglas explícitas. No puede ser más acertado.
Consecuencia práctica
Un proyecto así sigue siendo legítimo cuando el objetivo es la reducción del coste de ejecución, la cobertura de casos no tratados, o la simplificación de un motor que se ha vuelto ingobernable. Es ilegítimo cuando el objetivo anunciado es la mejora de la calidad de las decisiones: se requiere entonces una fuente de etiquetas independiente del sistema a reemplazar, mediante auditoría de una muestra o mediante observación del resultado real de las decisiones.
Un algoritmo de aprendizaje supervisado no procede a ningún análisis del dominio. Ejecuta un ciclo en tres tiempos, repetido hasta la satisfacción de un criterio de parada.
Las modalidades de la corrección varían: descenso de gradiente para los modelos paramétricos y las redes neuronales, partición recursiva por maximización de una ganancia de información para los árboles, resolución analítica cerrada para los mínimos cuadrados ordinarios. La estructura lógica del ciclo es idéntica.
Definición rigurosa
Un parámetro es una magnitud interna al modelo cuyo valor es determinado por el algoritmo de aprendizaje a partir de los datos, mediante minimización del riesgo empírico. El conjunto de los valores de los parámetros constituye el estado del modelo y basta, junto con su estructura, para reproducir sus predicciones.
| Clase de modelos | Parámetros |
|---|---|
| Regresión lineal o logística | Coeficientes de las variables, ordenada en el origen |
| Árbol de decisión | Variables de corte, umbrales, valores de las hojas |
| Red neuronal | Pesos de las conexiones, sesgos de las neuronas |
Traducción al lenguaje corriente
Los parámetros son lo que la máquina aprendió: el contenido del archivo guardado al final del entrenamiento.
Definición rigurosa
Una función de pérdida L : Y × Y → R+ asocia a un par (valor observado,
valor predicho) una medida escalar positiva de la desviación, nula si y solo si
la predicción coincide con la observación, y creciente con la gravedad de
la desviación. Debe ser calculable y, para los algoritmos basados en el
gradiente, derivable con respecto a los parámetros.
Estatus
Constituye la definición operativa de «predecir bien». Es una elección de ingeniería, no un dato del problema: dos funciones de pérdida diferentes aplicadas a la misma muestra producen dos modelos diferentes.
Traducción al lenguaje corriente
La regla de calificación: lo que cuenta como un fallo, y cuánto cuesta ese fallo.
Punto de vigilancia
La pérdida utilizada para la optimización y la métrica utilizada para la evaluación de negocio son dos objetos distintos, que raramente coinciden (capítulos 029 y 052).
Definición rigurosa
Media aritmética de las pérdidas individuales sobre la muestra:
R̂(h) = (1/n) · Σ L(yi, h(xi)). Es la cantidad efectivamente minimizada por
el algoritmo de aprendizaje.
Distinción con el riesgo esperado
El riesgo empírico es una media sobre n observaciones disponibles, el riesgo
esperado una esperanza sobre la distribución generadora. El primero es calculable
y sirve de objetivo de optimización; el segundo es el objetivo real y nunca es
directamente accesible.
Punto de vigilancia
Un riesgo empírico nulo no tiene ningún valor informativo: siempre es alcanzable por un modelo suficientemente expresivo, por simple memorización de la muestra.
| Función de pérdida | Tipo de problema | Expresión | Propiedad |
|---|---|---|---|
| Error cuadrático | Regresión | (y − ŷ)² | Penaliza fuertemente las grandes desviaciones; sensible a los valores atípicos |
| Error absoluto | Regresión | valor absoluto de y − ŷ | Penalización proporcional; robusto a los valores atípicos |
| Entropía cruzada binaria | Clasificación binaria | −[y·log(p) + (1−y)·log(1−p)] | Opera sobre la probabilidad predicha p, no sobre la clase |
| Pérdida de bisagra (hinge) | Clasificación con margen | max(0, 1 − y·score) | Penaliza también los puntos correctos demasiado cercanos a la frontera |
El error cuadrático ajusta la media condicional, el error absoluto la mediana condicional. La elección depende de la pregunta de negocio: ¿el coste de un error importante es proporcional a su tamaño, o más que proporcional?
| Criterio | Parámetro | Hiperparámetro |
|---|---|---|
| Quién fija el valor | El algoritmo de aprendizaje | El ingeniero, o un procedimiento de búsqueda |
| Cuándo | Durante el entrenamiento | Antes del entrenamiento |
| Fuente del valor | Los datos de entrenamiento | Una elección metodológica validada |
| Ejemplos | Coeficientes, umbrales de un árbol, pesos de una red | Profundidad máxima, tasa de aprendizaje, coeficiente de regularización, número de árboles |
| Efecto de una modificación | Cambia las predicciones del modelo ajustado | Cambia el modelo que será ajustado |
Los hiperparámetros definen H y el procedimiento de optimización; los
parámetros designan el punto retenido en H. Su ajuste se trata en el
capítulo 009.
El ciclo no comprende ninguna etapa de comprensión, de interpretación o de razonamiento causal. Comprende una forma funcional elegida por el ingeniero, una medida de desviación elegida por el ingeniero, y un procedimiento numérico que reduce esa medida.
No hay comprensión. Hay una minimización iterativa de una cantidad escalar.
No es una precaución retórica: un modelo explotará toda regularidad estadística presente en los datos, incluidas las que no tienen ningún sentido de negocio, las que resultan de artefactos de recolección, y las que no subsistirán en producción.
Un operador dispone de un instrumento con dos ruedas y de un cuadrante graduado que muestra una desviación. No percibe el sonido. Gira la primera rueda, lee el cuadrante, constata que la desviación ha disminuido, continúa en el mismo sentido. Cuando la desviación deja de disminuir, pasa a la segunda rueda. Tras unas decenas de ajustes, el cuadrante muestra una desviación mínima.
El operador no ha oído nada, no tiene ninguna noción de música y no podría explicar qué es una quinta justa. Ha minimizado el valor de un cuadrante.
Dos consecuencias se transponen exactamente: si el cuadrante está mal calibrado, el instrumento estará desafinado con una desviación mostrada nula —papel crítico de la función de pérdida y de las etiquetas—; si el cuadrante solo mide una cuerda de seis, las otras cinco seguirán desafinadas —papel crítico de la elección de la métrica.
Tarea: estimar el precio de venta de una vivienda a partir de su superficie.
X = superficie en m², Y = precio en dólares, n = 4.
| Casa | Superficie (m²) | Precio observado ($) |
|---|---|---|
| A | 75 | 272 500 |
| B | 100 | 370 000 |
| C | 125 | 467 500 |
| D | 150 | 560 000 |
El ingeniero postula una relación afín precio = a × superficie + b. Esta elección
define H: el conjunto de las rectas del plano. Los parámetros a determinar son
a (precio por metro cuadrado) y b (término constante). La función de pérdida elegida
es el error absoluto, escogida por la legibilidad de los cálculos; el riesgo
empírico es, por tanto, el error absoluto medio sobre las cuatro casas.
| Casa | Superficie | Precio observado | Precio predicho | Error absoluto |
|---|---|---|---|---|
| A | 75 | 272 500 | 75 000 | 197 500 |
| B | 100 | 370 000 | 100 000 | 270 000 |
| C | 125 | 467 500 | 125 000 | 342 500 |
| D | 150 | 560 000 | 150 000 | 410 000 |
| Error medio | 305 000 |
Todas las predicciones son inferiores a los precios observados y la desviación crece con
la superficie: el coeficiente a es demasiado bajo. Dirección de corrección:
aumentar a.
| Casa | Superficie | Precio observado | Precio predicho | Error absoluto |
|---|---|---|---|---|
| A | 75 | 272 500 | 150 000 | 122 500 |
| B | 100 | 370 000 | 200 000 | 170 000 |
| C | 125 | 467 500 | 250 000 | 217 500 |
| D | 150 | 560 000 | 300 000 | 260 000 |
| Error medio | 192 500 |
El error medio cae de 305 000 a 192 500: la corrección iba en la buena dirección. El diagnóstico no cambia, se continúa con un paso más grande.
| Casa | Superficie | Precio observado | Precio predicho | Error absoluto |
|---|---|---|---|---|
| A | 75 | 272 500 | 262 500 | 10 000 |
| B | 100 | 370 000 | 350 000 | 20 000 |
| C | 125 | 467 500 | 437 500 | 30 000 |
| D | 150 | 560 000 | 525 000 | 35 000 |
| Error medio | 23 750 |
El diagnóstico cambia de naturaleza: los errores son ahora del mismo orden de
magnitud y todos del mismo signo, quedando las predicciones por debajo de los
precios observados en unos 25 000 $. Este desfase constante no es corregible mediante
a —hacerlo crecer degradaría las grandes superficies. Corresponde al término
constante b.
| Casa | Superficie | Precio observado | Precio predicho | Error con signo | Error absoluto |
|---|---|---|---|---|---|
| A | 75 | 272 500 | 287 500 | −15 000 | 15 000 |
| B | 100 | 370 000 | 375 000 | −5 000 | 5 000 |
| C | 125 | 467 500 | 462 500 | +5 000 | 5 000 |
| D | 150 | 560 000 | 550 000 | +10 000 | 10 000 |
| Error medio | 8 750 |
Los errores son ahora de signos opuestos: dos predicciones demasiado altas,
dos demasiado bajas. Ninguna corrección global de a o de b puede ya reducir
el conjunto simultáneamente. El proceso ha alcanzado un régimen de compromiso, lo que
constituye el criterio de parada.
precio estimado = 3 500 × superficie + 25 000Estos dos números constituyen la totalidad de lo que se ha aprendido. Aplicado a un caso nuevo, una vivienda de 110 m² ausente de la muestra:
precio estimado = 3 500 × 110 + 25 000 = 410 000 $El modelo produce un valor para una observación nunca encontrada. Este paso de lo conocido a lo desconocido es la generalización, tratada en el apartado 7.
Primera enseñanza — No se moviliza ninguna comprensión del dominio
El procedimiento no movilizó ningún conocimiento del mercado inmobiliario. No consultó
ningún baremo, no conoce ni la noción de barrio, ni la de estado del inmueble, ni
la de tipo de interés. Produjo dos números que minimizan una media
de desviaciones. El hecho de que a = 3 500 se interprete como un precio por metro cuadrado es
una lectura efectuada por el analista a posteriori, no un conocimiento
que posea el modelo.
Segunda enseñanza — El mecanismo es ensayo, medida, ajuste
Se han presentado cuatro iteraciones; un algoritmo real efectúa miles, con ajustes de pequeña amplitud guiados por el gradiente en lugar de por la inspección de los signos de error. La estructura lógica es la del apartado 3, sin añadidos: proponer, medir la desviación, corregir en el sentido que reduce la desviación.
Tercera enseñanza — La forma de la regla la elige el ingeniero
La máquina no decidió que el precio sería una función afín de la superficie. Esta hipótesis se planteó antes de todo cálculo y restringe definitivamente el resultado: si la relación real es en escalera, se estabiliza más allá de cierta superficie, o depende de una interacción con el barrio, este modelo nunca podrá representarla, sea cual sea el volumen de datos proporcionado. La elección de la clase de modelos es un acto de ingeniería anterior y superior al ajuste: es el error de aproximación definido en el apartado 1.
Tarea: predecir si un prospecto efectuará una compra a partir de su edad y de
su salario anual. X = (edad, salario), Y = {Compra, Sin compra}, n = 6.
| Prospecto | Edad | Salario anual ($) | Compra |
|---|---|---|---|
| P1 | 22 | 28 000 | No |
| P2 | 25 | 32 000 | No |
| P3 | 31 | 41 000 | No |
| P4 | 38 | 58 000 | Sí |
| P5 | 45 | 72 000 | Sí |
| P6 | 52 | 85 000 | Sí |
La diferencia formal con el apartado 4 reside en la naturaleza de Y: un conjunto
finito no ordenado reemplaza un intervalo de reales. Esta única diferencia cambia
la función de pérdida, las métricas de evaluación y la interpretación geométrica
del modelo.
Definición rigurosa
Para un clasificador f̂ : X → Y, la frontera de decisión es el subconjunto de
X constituido por los puntos en los que la regla de decisión cambia de clase
atribuida. En el caso binario basado en una puntuación continua s(x) y un umbral t,
es el conjunto de nivel { x ∈ X | s(x) = t }. Particiona X en
regiones de decisión, cada una asociada a una clase.
Propiedad geométrica
En un espacio de d variables, la frontera es una hipersuperficie de dimensión
d − 1: un punto sobre una recta, una curva en el plano, una superficie en
dimensión tres.
| Clase de modelos | Forma de la frontera |
|---|---|
| Regresión logística | Hiperplano: recta en el plano |
| Árbol de decisión | Segmentos paralelos a los ejes, en escalera |
| Máquina de vectores de soporte con kernel | Curva regular, forma dependiente del kernel |
| Red neuronal | Hipersuperficie arbitrariamente compleja |
Punto de vigilancia
La frontera es desplazable sin reentrenamiento: modificar el umbral t la
desplaza a lo largo de las líneas de nivel de la puntuación. Esta propiedad se explota en el
capítulo 062.
Sobre las seis observaciones, una regla afín separa perfectamente los dos grupos:
puntuación bruta = salario + 1 000 × edad, frontera en 90 000.
| Prospecto | Puntuación bruta | Posición | Clase predicha | Clase observada |
|---|---|---|---|---|
| P1 | 50 000 | Bajo la frontera | No | No |
| P2 | 57 000 | Bajo la frontera | No | No |
| P3 | 72 000 | Bajo la frontera | No | No |
| P4 | 96 000 | Por encima | Sí | Sí |
| P5 | 117 000 | Por encima | Sí | Sí |
| P6 | 137 000 | Por encima | Sí | Sí |
Punto de vigilancia: una separación perfecta sobre seis observaciones no es un rendimiento. Cuando el número de observaciones es bajo frente al número de variables, la separabilidad perfecta es frecuente e incluso constituye una señal de alerta en cuanto al sobreajuste (capítulo 031).
Un clasificador no produce directamente una clase. Produce primero una puntuación continua, generalmente transformada en estimación de probabilidad condicional, y luego aplica un umbral para decidir.
Definición rigurosa
Un clasificador probabilístico estima la ley condicional P(Y | X = x). Para un
problema binario con Y = {0, 1}, produce p̂(x) ∈ [0, 1] que estima
P(Y = 1 | X = x). La regla de decisión asociada a un umbral t es: ŷ = 1 si
p̂(x) ≥ t, ŷ = 0 en caso contrario.
| Acto | Naturaleza | Quién lo determina | Modificable después del entrenamiento |
|---|---|---|---|
Estimación de p̂(x) | Estadística | El modelo, por ajuste sobre D | No, sin reentrenamiento |
Elección del umbral t | Decisional | La organización, según el coste de los errores | Sí, inmediatamente |
Punto de vigilancia sobre la calibración
Una puntuación alta no equivale a probabilidad fiable. Un modelo está calibrado cuando, entre las observaciones a las que atribuye una puntuación de 0,80, aproximadamente el 80 % pertenecen efectivamente a la clase positiva. Las puntuaciones brutas de numerosos algoritmos no poseen esta propiedad y necesitan una recalibración (capítulo 029).
Traducción al lenguaje corriente
El modelo produce un grado de confianza. La transformación de ese grado en decisión es una elección de gestión, no una elección técnica. El valor 0,50 es un valor por defecto de implementación, nunca una justificación.
Para el caso nuevo «35 años, 60 000 $», la puntuación bruta vale 95 000, es decir, 5 000
por encima de la frontera; transformada en probabilidad, da
P(y = Compra | x) = 0,81, y el umbral por defecto de 0,50 lleva a predecir
«Compra». Con un umbral elevado a 0,85, la misma observación, el mismo modelo y la
misma puntuación llevarían a predecir «Sin compra». El modelo no ha cambiado;
la decisión ha cambiado. La elección del umbral depende del coste respectivo de los dos tipos
de errores, tratado en los capítulos 052 y 062.
| Criterio | Regresión (apartado 4) | Clasificación (apartado 5) |
|---|---|---|
Naturaleza de Y | Intervalo de reales | Conjunto finito no ordenado |
| Salida bruta del modelo | Un valor numérico | Una puntuación o una probabilidad por clase |
| Etapa de decisión adicional | Ninguna | Aplicación de un umbral |
| Función de pérdida habitual | Error cuadrático, error absoluto | Entropía cruzada |
| Interpretación geométrica | Curva de ajuste | Frontera de decisión |
| Métricas de evaluación | Error medio, coeficiente de determinación | Exactitud, precisión, recall, área bajo la curva |
| Entrenamiento | Evaluación | Producción | |
|---|---|---|---|
| Naturaleza de los datos | Conjunto de entrenamiento, histórico | Conjunto de test, histórico apartado | Flujo real, observaciones nuevas |
| Etiqueta disponible | Sí, utilizada para el ajuste | Sí, solo para la comparación | No, en el momento de la predicción |
| Acción del sistema | Ajustar los parámetros | Predecir y medir la desviación | Predecir |
| Llamada de código | model.fit(X_train, y_train) | model.predict(X_test) luego comparación con y_test | model.predict(x_nouveau) |
| ¿El modelo se modifica? | Sí | No | No |
| Analogía | La preparación con las soluciones | El simulacro de examen con temas inéditos | El ejercicio profesional real |
| Lo que se obtiene | Un modelo ajustado | Una estimación del riesgo esperado | Una decisión operativa |
# Régimen 1 — entrenamiento: el modelo ve x e y
model.fit(X_train, y_train)
# Régimen 2 — evaluación: el modelo ve x, y sirve únicamente para la comparación
y_pred = model.predict(X_test)
score = metrique(y_test, y_pred)
# Régimen 3 — producción: y aún no existe
y_estime = model.predict(x_nouvelle_observation)La dificultad profesional no reside en la escritura de estas tres líneas,
sino en la constitución correcta de X_train, X_test y de sus etiquetas.
Punto de vigilancia mayor
Evaluar un modelo sobre los datos que sirvieron para su entrenamiento produce una estimación optimista, carente de valor informativo.
La justificación formal se dio en el apartado 1: f̂ fue seleccionada
precisamente para minimizar R̂ sobre esas observaciones, de modo que R̂(f̂) es un
estimador sesgado de R(f̂). Las modalidades de partición y la validación cruzada
se tratan en el capítulo 026.
Definición rigurosa
D utilizado para el ajuste
de los parámetros.Justificación de la distinción validación / test
Toda elección efectuada a la vista de una puntuación sobre un conjunto de datos optimiza implícitamente sobre ese conjunto. Un conjunto de validación consultado varias decenas de veces deja de ser neutro: el proceso de selección ha introducido en él un sesgo optimista, de naturaleza idéntica al del conjunto de entrenamiento aunque de menor amplitud.
Regla operativa
El conjunto de test solo se abre una vez, y el resultado obtenido es el que se reporta. Si se consulta y luego se sigue de una modificación del modelo, ha cambiado de naturaleza y se ha convertido en un conjunto de validación.
Una escuela desea estimar los resultados de sus estudiantes en el examen final.
Protocolo defectuoso: el simulacro retoma los ejercicios de la colección de entrenamiento. Los resultados son excelentes y no predicen nada; miden la memorización de la colección.
Protocolo válido: el simulacro trata sobre temas inéditos, de la misma naturaleza y la misma dificultad que los del examen final. Los resultados son más bajos y constituyen una estimación utilizable.
La diferencia entre los dos protocolos no es la dificultad de los temas, sino el hecho de que estos hayan sido, o no, utilizados durante la preparación. Es la única pregunta que gobierna la validez de una evaluación.
Definición rigurosa
La generalización designa la capacidad de un modelo ajustado para mantener un nivel de
rendimiento dado sobre observaciones procedentes de la misma distribución P(X, Y)
que las de la muestra de aprendizaje, pero no observadas durante
el ajuste. Se cuantifica mediante la brecha de generalización
R(f̂) − R̂(f̂): una brecha pequeña indica que el rendimiento medido sobre
la muestra es representativo del rendimiento esperado.
Condición de validez
La definición contiene una condición explícita: «procedentes de la misma distribución». Cuando la distribución de los datos de producción difiere de la de los datos de aprendizaje, la garantía ya no se aplica. Este fenómeno es la deriva, tratada en el capítulo 082; la generalización no protege contra ella.
Traducción al lenguaje corriente
Generalizar es funcionar sobre casos nunca encontrados, y no solo sobre los que sirvieron para el aprendizaje.
| Error de entrenamiento | Error de generalización | |
|---|---|---|
| Definición | Riesgo empírico sobre el conjunto de entrenamiento | Riesgo esperado sobre la distribución generadora |
| Notación | R̂(f̂) sobre D_train | R(f̂) |
| Calculable | Sí, directamente | No, solo estimable |
| Estimador práctico | — | Error medido sobre el conjunto de test |
| Lo que mide | La calidad del ajuste a los datos vistos | La calidad esperada en producción |
| ¿Puede ser nulo? | Sí, mediante un modelo suficientemente expresivo | No, el error irreducible lo acota |
| Valor decisional | Nulo tomado aisladamente | Único valor decisional del proyecto |
La brecha entre ambos constituye el diagnóstico principal del practicante.
| Error de entrenamiento | Error de test | Diagnóstico | Tratamiento |
|---|---|---|---|
| Alto | Alto | Subajuste (underfitting): modelo demasiado restringido | Enriquecer las variables, aumentar la expresividad |
| Bajo | Alto | Sobreajuste (overfitting): el modelo ha memorizado | Regularizar, simplificar, aumentar el volumen |
| Bajo | Bajo | Régimen satisfactorio | Verificar la ausencia de fuga (capítulo 028) |
| Alto | Bajo | Situación anormal | Verificar el protocolo de partición |
Un modelo de previsión de la demanda se entrena con los datos de enero a junio. Alcanza un error medio del 3,1 % sobre ese período. Esta cifra no presenta ningún interés decisional: describe la capacidad del modelo para reajustar un período cuyos valores ya conoce.
La única pregunta que importa es: ¿cuál es el error en julio?
Julio no fue observado durante el ajuste. El rendimiento en julio es la única información que informa sobre lo que el modelo producirá en agosto y en todo período venidero. Lo que vale para una separación temporal vale para una separación aleatoria, por sitio, por cliente o por región. La pregunta es invariante: ¿cuál es el rendimiento sobre lo que no sirvió para el ajuste?
Ninguna de estas técnicas tiene finalidad propia. La separación de los datos no existe para respetar una convención; la regularización no existe para producir modelos más elegantes. Cada una existe para hacer estimable el error de generalización, o para reducirlo.
Un practicante que no relaciona el conjunto de sus elecciones metodológicas con la brecha de generalización aplica recetas.
Un actor conoce íntegramente el texto de su obra. Lo restituye sin fallo, con las entonaciones ajustadas en los ensayos: sobre ese repertorio, su rendimiento es perfecto.
La noche de la representación, un compañero se salta una réplica. El actor que memorizó se interrumpe: la secuencia aprendida ya no corresponde a la situación. El actor que comprendió la situación dramática improvisa una réplica coherente y continúa. Ambos eran indistinguibles en los ensayos: obtenían la misma puntuación sobre el conjunto de entrenamiento.
| Actor | Sobre el texto conocido | Sobre la situación imprevista | Modelo correspondiente |
|---|---|---|---|
| El que memorizó | Perfecto | Deficiente | Sobreajuste |
| El que comprendió | Bueno | Bueno | Generalización |
Punto de transposición: la única manera de distinguir a los dos actores es colocarlos ante una situación no ensayada. Esa es exactamente la función del conjunto de test. Sin esa puesta a prueba, los dos perfiles son indistinguibles —y el perfil deficiente obtiene incluso las mejores puntuaciones aparentes.
Contexto. Un industrial explota 300 máquinas instrumentadas repartidas en cuatro sitios, que transmiten en continuo lecturas de vibración, de temperatura, de consumo eléctrico y de contadores de uso. El servicio de mantenimiento dispone de un registro de intervenciones que cubre treinta meses. Una inmovilización no planificada cuesta alrededor de 18 000 $ en producción perdida; una intervención preventiva planificada, alrededor de 1 200 $.
| Condición | Verificación efectuada | Estado |
|---|---|---|
| Existe un objetivo observable en el histórico | El registro permite fechar cada fallo | Satisfecha |
| El histórico es suficiente en volumen y en eventos | 30 meses, 300 máquinas, 412 fallos no planificados | Satisfecha |
| Las variables están disponibles en el momento de la predicción | Lecturas con marca de tiempo, accesibles en tiempo real | Satisfecha |
| La predicción abre a una decisión accionable | Puede planificarse una intervención preventiva | Satisfecha |
| El coste del error es aceptable | Falso positivo 1 200 $, falso negativo 18 000 $ | Satisfecha, con fuerte asimetría |
La formulación de negocio inicial —«anticipar las averías»— no es explotable tal cual. Se investigaron cuatro formulaciones candidatas.
| Formulación candidata | Tipo de problema | Defecto descalificador |
|---|---|---|
| «¿La máquina está actualmente averiada?» | Clasificación sobre estado instantáneo | La variable es directamente observable y la avería ya ocurrió. Ninguna anticipación, por tanto ninguna decisión posible |
| «¿Cuál es la vida útil residual?» | Regresión | Exige la fecha exacta del fallo futuro para cada observación. Las máquinas en servicio no tienen fecha de fin: la muestra está censurada, lo que invalida una regresión ingenua |
| «¿La máquina se averiará algún día?» | Clasificación sin horizonte | Objetivo degenerado: la respuesta es positiva para todas las máquinas. Prevalencia del 100 %, ninguna información que aprender |
| «¿La máquina se averiará en los próximos 7 días?» | Clasificación binaria con horizonte fijado | Retenida. Defectos residuales conocidos y gestionables: fuerte desequilibrio de clases, sensibilidad a la elección del horizonte |
Objetivo retenido: panne_7j = 1 si un fallo no planificado sobreviene en
la máquina en los 7 días siguientes a la fecha de la lectura, 0 en caso contrario.
| Horizonte considerado | Consecuencia |
|---|---|
| 2 días | Predicciones más exactas pero inexplotables: la pieza no se entrega a tiempo. Ningún valor de negocio |
| 7 días | Compatible con la cadena logística de intervención. Horizonte retenido |
| 30 días | Señal precursora demasiado débil a ese plazo: la prevalencia aumenta pero la separabilidad cae. Alertas demasiado numerosas y demasiado precoces |
Principio: el horizonte de un objetivo predictivo se deduce del plazo de accionabilidad de la decisión, nunca de la comodidad estadística.
| Variable | Descripción | Justificación de negocio |
|---|---|---|
vib_rms_24h | Vibración eficaz media en 24 horas | Indicador directo del desgaste de los rodamientos y del desequilibrio |
vib_delta_7j | Desviación respecto a la media de los 7 días anteriores | La degradación se manifiesta por una evolución, no por un nivel absoluto propio de cada máquina |
temp_max_24h | Temperatura máxima del cárter en 24 horas | Un calentamiento anormal señala una fricción o un defecto de lubricación |
temp_ecart_consigne | Desviación respecto a la temperatura nominal del modelo | Normaliza la temperatura entre máquinas de generaciones diferentes |
heures_depuis_maintenance | Horas de funcionamiento desde la última intervención | El desgaste es función del tiempo de servicio, no del tiempo calendario |
cycles_jour_moyen_7j | Número medio de ciclos diarios en 7 días | Mide la intensidad de solicitación |
conso_elec_ecart | Desviación de consumo respecto a la línea de base de la máquina | Un sobreconsumo a carga constante indica una resistencia mecánica aumentada |
nb_arrets_courts_30j | Número de microparadas en 30 días | Las microparadas preceden frecuentemente a los fallos mayores |
age_machine_mois | Antigüedad de la máquina | La tasa de fallo depende de la posición en el ciclo de vida |
site | Sitio de explotación | Captura las diferencias de entorno: temperatura ambiente, calidad del aire, prácticas locales de mantenimiento |
Punto de vigilancia: vib_delta_7j, temp_ecart_consigne y
conso_elec_ecart son variables construidas, no lecturas brutas. Su
construcción debe ser reproducible de forma idéntica en producción (capítulo 040).
Una observación es un par (máquina, fecha), es decir, unas 270 000 filas. Tasa de eventos positivos: alrededor del 1,1 %.
| machine_id | date | vib_rms_24h | vib_delta_7j | temp_max_24h | heures_depuis_maint. | nb_arrets_courts_30j | site | panne_7j |
|---|---|---|---|---|---|---|---|---|
| M-014 | 2024-03-11 | 2,1 | +0,1 | 64 | 820 | 0 | Nord | 0 |
| M-014 | 2024-03-12 | 2,2 | +0,2 | 65 | 828 | 0 | Nord | 0 |
| M-087 | 2024-05-02 | 5,8 | +2,4 | 81 | 2 340 | 4 | Sud | 1 |
| M-087 | 2024-05-03 | 6,1 | +2,7 | 84 | 2 348 | 5 | Sud | 1 |
| M-201 | 2024-07-19 | 3,4 | +0,3 | 71 | 1 510 | 1 | Est | 0 |
| M-233 | 2024-09-08 | 6,2 | +3,1 | 88 | 2 780 | 7 | Nord | 1 |
Un árbol de decisión de poca profundidad ajustado sobre estos datos produce la estructura siguiente; las probabilidades son las de la clase positiva en cada hoja.
Lectura: la variable más discriminante no es el nivel de vibración sino su variación reciente, resultado coherente con la experiencia de negocio —cada máquina posee su propia firma vibratoria, y es la desviación respecto a esa firma la que porta la información. Esta coherencia no constituye una validación, pero su ausencia habría constituido una señal de alerta sobre la construcción de los datos.
| Trampa | Manifestación en este caso | Consecuencia si no se trata | Capítulo |
|---|---|---|---|
| Desequilibrio de clases | 1,1 % de observaciones positivas | Un modelo que predice siempre «sin avería» alcanza el 98,9 % de exactitud y no detecta nada. La exactitud es inutilizable como métrica | 050 |
| Coste asimétrico de los errores | Falso negativo 18 000 $, falso positivo 1 200 $, relación de 15 a 1 | Un umbral en 0,50 minimiza el número de errores, no su coste. El umbral debe bajarse hasta el punto de equilibrio económico | 052 y 075 |
| Fuga de datos | Las columnas date_intervention, code_panne y duree_arret solo se informan después del fallo | Rendimiento casi perfecto en validación, colapso en producción. Modo de fallo más frecuente en este tipo de proyecto | 028 |
| Sobreajuste | 270 000 filas pero 412 eventos reales, y fuertes correlaciones entre lecturas sucesivas de una misma máquina | El modelo memoriza las firmas de las máquinas que han tenido una avería en lugar de aprender el mecanismo de degradación | 031 |
| Deriva | Renovación del parque, cambio de proveedor de piezas, modificación de las cadencias | El rendimiento se degrada progresivamente sin alerta, mientras los sensores siguen emitiendo valores plausibles | 082 |
Lo que ocurre
Extraer aleatoriamente el 20 % de las 270 000 filas para constituir el conjunto de test coloca las lecturas de la máquina M-087 del 2 de mayo en entrenamiento y las del 3 de mayo en test, cuando son casi idénticas. El modelo se evalúa sobre observaciones de las que ha visto casi réplicas durante el ajuste: el error de test se convierte en un estimador optimista del error de generalización, al no estar satisfecha en la práctica la condición «no observadas», aunque lo esté formalmente a nivel de fila.
Protocolo correcto
La partición debe reproducir la situación de producción: el modelo se aplicará a fechas posteriores a las de su entrenamiento, y a veces a máquinas recién instaladas.
| Partición | Pregunta a la que responde |
|---|---|
| Temporal: entrenamiento sobre 24 meses, test sobre los 6 últimos | ¿El modelo funciona sobre el período venidero? |
| Por máquina: entrenamiento sobre 240 máquinas, test sobre 60 reservadas | ¿El modelo funciona sobre una máquina nunca observada? |
Las dos estimaciones son útiles y responden a preguntas distintas (capítulo 026).
El ejemplo del apartado 4 produjo a = 3 500. Es tentador concluir que el
modelo «sabe» que el metro cuadrado vale 3 500 $. El modelo no posee ninguna
noción de metro cuadrado, de precio ni de vivienda: posee dos números que
minimizan una media de desviaciones sobre cuatro observaciones.
Consecuencia operativa: una superficie de 900 m² producirá una estimación de 3 175 000 $ sin que ningún mecanismo alerte sobre lo absurdo de la extrapolación.
Formulación correcta: «El modelo ajustó dos parámetros que minimizan la desviación media respecto a los precios observados sobre la muestra proporcionada.»
La supervisión califica la disponibilidad de etiquetas de referencia durante el entrenamiento. No describe el régimen de funcionamiento del sistema desplegado, que puede ser enteramente automático. Esta confusión lleva a suponer un control humano que no existe, y a no prever las salvaguardas necesarias.
Formulación correcta: «El aprendizaje se llama supervisado porque cada observación de entrenamiento iba acompañada del valor objetivo a reproducir. La presencia de un operador en producción es una decisión distinta.»
La etiqueta se presenta como la verdad de referencia. En realidad es el producto de un procedimiento —registro, declaración, juicio, regla— que posee sus sesgos, sus ángulos muertos y su propia tasa de error.
Caso característico: entrenar un modelo con los fraudes detectados equivale a aprender a detectar lo que el dispositivo actual ya detecta; los fraudes que se le escapan están etiquetados «no fraudulentos» en los datos.
Formulación correcta: «El rendimiento del modelo está acotado por la calidad del procedimiento que produjo las etiquetas. La primera etapa del proyecto es la investigación de ese procedimiento.»
«Predecir las averías», «predecir el abandono», «predecir el fraude» no son objetivos sino intenciones. Un objetivo explotable comprende tres elementos: un evento definido sin ambigüedad, un horizonte temporal, y una fecha de observación a partir de la cual corre ese horizonte. Sin ellos, la columna objetivo no puede construirse, y dos personas que trabajen en el mismo proyecto construirán dos versiones diferentes.
Formulación correcta: «panne_7j vale 1 cuando un fallo no
planificado sobreviene en los 7 días siguientes a la fecha de la lectura, 0 en caso contrario.»
La puntuación obtenida sobre los datos que sirvieron para el ajuste es un estimador optimistamente sesgado del riesgo esperado: el modelo fue seleccionado para minimizar precisamente esa cantidad. Un árbol de decisión sin restricciones alcanza el 100 % de exactitud sobre sus datos de entrenamiento, sean cuales sean los datos; esa cifra solo mide su capacidad de memorización.
Formulación correcta: «El error reportado es el medido sobre un conjunto de test constituido por observaciones que no participaron ni en el ajuste de los parámetros ni en la selección de los hiperparámetros.»
Los parámetros los determina el algoritmo a partir de los datos; los hiperparámetros se fijan antes del entrenamiento y definen el espacio de hipótesis así como el procedimiento de optimización.
Consecuencia operativa: los hiperparámetros no pueden ajustarse sobre el conjunto de entrenamiento, puesto que gobiernan la capacidad del modelo para ajustarse a él; tal ajuste conduce sistemáticamente al modelo más expresivo posible, por tanto al sobreajuste (capítulo 009).
Formulación correcta: «Los hiperparámetros se seleccionan por validación sobre datos distintos de los que sirven para el ajuste de los parámetros.»
Una variable presente en el histórico no está necesariamente disponible en el momento en que la predicción deberá producirse: el registro de mantenimiento contiene la duración de la parada, conocida solo después de la avería.
Test a aplicar sistemáticamente: para cada variable candidata, preguntarse si su valor será conocido en el instante exacto en que el modelo deberá predecir en producción. Toda respuesta negativa descalifica la variable. El síntoma es un rendimiento anormalmente alto en validación seguido de un colapso en producción: es la fuga de datos, tratada en el capítulo 028.
Formulación correcta: «El conjunto de las variables retenidas está disponible en el instante de la predicción, lo que se verificó variable por variable con los operadores del sistema fuente.»
La definición de la generalización contiene la condición «procedentes de la misma distribución». Esta condición es verificable en el momento de la evaluación; no está garantizada después. Un modelo validado al 92 % de exactitud puede funcionar al 71 % dieciocho meses más tarde sin que se haya producido ningún error técnico y sin que se dispare ninguna alerta.
Formulación correcta: «El rendimiento medido vale para la distribución observada durante el período de evaluación. Se prevé un dispositivo de supervisión de la deriva y un procedimiento de reentrenamiento (capítulo 082).»
FORMALIZACIÓN
Datos : D = {(xi, yi)}, i = 1..n, extraídos de P(X, Y) desconocida y fija
Hipótesis : existe f : X → Y, eventualmente ruidosa
Objetivo : minimizar el riesgo esperado R(h) = E[L(y, h(x))]
Realidad : se minimiza el riesgo empírico R^(h) = (1/n) Σ L(yi, h(xi))
Principio : minimización del riesgo empírico (ERM)
EL TÉRMINO « SUPERVISADO »
Designa la disponibilidad de una etiqueta de referencia en el entrenamiento.
No designa ninguna vigilancia humana en ejecución.
LAS ETIQUETAS
Seis fuentes : histórico natural, acción del usuario, anotación humana,
experto del dominio, regla de negocio automática, medida instrumental.
Pregunta obligatoria : ¿cómo se produjo la etiqueta?
Etiquetas procedentes de un sistema de reglas : el rendimiento tiene ahí su techo.
LA MECÁNICA
Ensayo -> Medida del error -> Corrección -> Ensayo ...
Parámetro : ajustado por el algoritmo, a partir de los datos
Hiperparámetro : fijado por el ingeniero, antes del entrenamiento
No hay comprensión. Hay una minimización iterativa.
LOS DOS TIPOS DE PROBLEMAS
Regresión : Y continuo -> un valor
Clasificación : Y finito -> una puntuación, luego un umbral, luego una clase
La frontera de decisión se desplaza cambiando el umbral,
sin reentrenar el modelo.
LOS TRES REGÍMENES
Entrenamiento : y conocido y utilizado model.fit(X_train, y_train)
Evaluación : y conocido, oculto model.predict(X_test) luego comparación
Producción : y desconocido model.predict(x_nouveau)
EL OBJETIVO ÚNICO
Brecha de generalización = riesgo esperado − riesgo empírico
Error de entrenamiento : sin valor decisional
Error de test : única estimación utilizable
Separación de los datos, validación cruzada, regularización, detección
del sobreajuste : ninguna tiene finalidad propia.
Todas sirven a la generalización.Enunciado de síntesis
El aprendizaje supervisado consiste en ajustar una función parametrizada sobre una muestra de observaciones etiquetadas, minimizando un riesgo empírico que no es más que un sustituto calculable del riesgo realmente perseguido; el valor del modelo nunca se mide sobre las observaciones que sirvieron para ajustarlo, sino sobre las que no ha visto.
Quiz asociados:
004.1-quiz-formalisation.md,
004.2-quiz-donnees-etiquetees.md,
004.3-quiz-mecanique-ajustement.md,
004.4-quiz-regression-chiffree.md,
004.5-quiz-classification-frontiere.md,
004.6-quiz-trois-regimes.md,
004.7-quiz-generalisation.md
Capítulo siguiente: 005-dataset-observation.md