Clasificación o regresión: calificar el problema

31 min
Bloque 2 — Identificar el problema
Objetivo
saber calificar todo problema de aprendizaje supervisado como clasificación o regresión a partir de la sola estructura de la variable objetivo, tratar las cinco configuraciones ambiguas que resisten a esta calificación, enunciar las consecuencias de la elección sobre el conjunto de la cadena de modelado, y arbitrar entre dos formulaciones concurrentes de una misma necesidad de negocio.
Duración estimada
40 minutos
Requisitos previos
capítulos 001 a 009, en particular 004 (aprendizaje supervisado), 006 (features y target) y 007 (X, y, label, clase)
Quiz asociados
010.1-quiz-critere-de-qualification.md a 010.7-quiz-reformulation.md

1. El criterio de calificación: la estructura del conjunto de llegada

1.1 Posición del problema

Las formulaciones siguientes se emplean corrientemente para justificar la elección entre clasificación y regresión. Ninguna es válida.

Formulación escuchadaEstatusContraejemplo inmediato
«Es un problema médico, por tanto clasificación»FalsoPredecir la glucemia a 3 meses es una regresión en contexto médico
«Utilizo un Random Forest, por tanto clasificación»FalsoRandomForestRegressor existe y trata objetivos reales
«Mis variables de entrada son categóricas, por tanto clasificación»FalsoEl tipo de las entradas es independiente del tipo del objetivo
«El objetivo está almacenado como entero, por tanto clasificación»FalsoUn número de visitas mensuales es un entero y pertenece a la regresión
«Solo hay dos valores posibles en salida, por tanto regresión binaria»FalsoDos modalidades no ordenadas definen una clasificación binaria

El criterio único es la estructura matemática del conjunto en el que la variable objetivo toma sus valores. Ni el dominio de aplicación, ni el algoritmo contemplado, ni el tipo de las variables explicativas, ni el formato de almacenamiento intervienen en esta calificación.

1.2 El marco formal común

El aprendizaje supervisado, definido en el capítulo 004, consiste en inducir a partir de una muestra etiquetada una función

f : X → Y

donde X designa el espacio de las variables explicativas e Y el conjunto de llegada, es decir, el conjunto de los valores que la variable objetivo puede tomar.

Clasificación y regresión comparten íntegramente este marco. Comparten igualmente la muestra de aprendizaje, la noción de generalización, la separación entrenamiento/test (capítulo 026) y el riesgo de sobreajuste (capítulo 031). Se distinguen en un solo punto: la estructura de Y.

DEFINICIÓN — Conjunto de llegada (espacio de salida, output space)

Definición rigurosa

Conjunto Y en el que la función objetivo toma sus valores, considerado no como un simple conjunto de símbolos sino como una estructura algebraica: nos interesan las relaciones y operaciones que están definidas en él — igualdad, orden total, distancia, adición, esperanza.

Traducción al lenguaje corriente

El conjunto de todas las respuestas posibles, y lo que uno tiene derecho a hacer con esas respuestas: ¿se puede solamente decir que son idénticas o diferentes, se pueden ordenar, se puede medir la diferencia entre dos de ellas?

Punto de vigilancia

La estructura de Y nunca es visible en el archivo de datos. Una columna que contiene los valores 1, 2, 3 puede representar tres especies vegetales (estructura nominal) o tres pasos por taller (estructura numérica). Solo el conocimiento del dominio decide. La calificación es un acto de análisis, no una inspección de tipo informático.

1.3 La bifurcación fundamental

Enunciado director del capítulo

El tipo de problema está determinado por la naturaleza de la variable objetivo. No está determinado ni por el dominio de negocio, ni por el algoritmo contemplado, ni por el tipo de las variables explicativas.


2. La clasificación

DEFINICIÓN — Clasificación (clasificación supervisada)

Definición rigurosa

Tarea de aprendizaje supervisado consistente en inducir, a partir de una muestra de observaciones etiquetadas, una función f : X → Y donde el conjunto de llegada Y = {c₁, c₂, …, cKc_K} es finito y no dotado de una relación de orden intrínseca. Los elementos de Y se llaman clases, categorías o modalidades. K designa el número de clases; K = 2 define la clasificación binaria, K > 2 la clasificación multiclase (capítulo 011).

Estructura del conjunto de llegada

La única relación definida sobre Y es la igualdad. Dos clases son idénticas o distintas; ninguna es «superior», y ninguna distancia está definida entre ellas. La proposición «la clase perro está más cerca de la clase gato que de la clase caballo» no tiene ningún estatus matemático en el marco estándar.

Traducción al lenguaje corriente

Colocar cada caso en uno de los casilleros de un conjunto fijado de antemano, sin que esos casilleros estén clasificados del más pequeño al más grande.

Punto de vigilancia

El conjunto de las clases se determina antes del aprendizaje y forma parte de la especificación del problema. Un modelo de clasificación nunca puede predecir una clase ausente de la muestra de entrenamiento. La aparición de una modalidad nueva en producción constituye una ruptura de especificación, no un error de predicción.

2.1 Operaciones lícitas e ilícitas sobre el objetivo

Operación sobre dos valores objetivoClasificaciónJustificación
Comprobar la igualdad y₁ = y₂LícitaLa igualdad es la relación fundadora de Y
Ordenar y₁ < y₂IlícitaNingún orden intrínseco sobre un conjunto nominal
Calcular la diferencia y₁ − y₂IlícitaLa sustracción no está definida
Calcular una media de los valores objetivoIlícitaLa esperanza de una variable nominal no tiene sentido
Contar las ocurrencias de una claseLícitaProporciona la distribución de las clases (capítulo 050)

Consecuencia directa: el error de un modelo de clasificación no se mide por una diferencia sino por un conteo de desacuerdos, formalizado por la matriz de confusión (capítulo 052). No existe error «pequeño» o «grande» sobre una predicción única: es correcta o incorrecta.

2.2 Forma de la salida

Un clasificador produce en realidad dos salidas distintas, cuya confusión es una fuente de error frecuente.

SalidaNaturalezaMétodo scikit-learnConjunto de llegada
Puntuación o probabilidad por claseVector de K reales que suman 1predict_proba()[0, 1]^K
Clase predichaUna modalidadpredict(){c₁, …, cKc_K}

El paso de la primera a la segunda se efectúa mediante la aplicación de una regla de decisión, la mayoría de las veces un umbral en binario (capítulo 062) o el argumento del máximo en multiclase. La producción de una puntuación real intermedia no transforma el problema en regresión: el conjunto de llegada del problema sigue siendo el conjunto finito de las clases, siendo la puntuación solo un intermediario de cálculo.

DEFINICIÓN — Frontera de decisión (decision boundary)

Definición rigurosa

Subconjunto del espacio de las variables explicativas X que separa las regiones asociadas a clases predichas diferentes. Formalmente, para un clasificador binario basado en una función de puntuación s(x) y un umbral t, la frontera es el conjunto {x ∈ X : s(x) = t}.

Traducción al lenguaje corriente

La línea, la superficie o el límite más allá del cual el modelo cambia de opinión sobre la categoría a atribuir.

Punto de vigilancia

El objeto geométrico aprendido en clasificación es una partición del espacio de entrada. En regresión, el objeto aprendido es una superficie de respuesta definida sobre todo el espacio de entrada. Esta diferencia de naturaleza explica que ciertos algoritmos se transponen mal de un marco al otro.

ANALOGÍA — El centro de clasificación postal

Un centro de clasificación dispone de un número fijo de casilleros, uno por región de destino. Cada paquete debe colocarse en exactamente un casillero. El clasificador no puede inventar un casillero, ni colocar un paquete «entre» dos casilleros.

Equivocarse de casillero es un error, sin grado: un paquete destinado a Lyon colocado en el casillero Marsella y un paquete destinado a Lyon colocado en el casillero Lille son dos errores equivalentes desde el punto de vista de la clasificación, aunque las consecuencias operativas difieran.

La vacilación del clasificador — «este paquete es probablemente para Lyon, quizá para Grenoble» — corresponde a la puntuación de probabilidad. La decisión final de depositarlo en un casillero corresponde a la clase predicha.

2.3 Ejemplos representativos

DominioPregunta de negocioConjunto de llegadaK
Pago¿Esta transacción es fraudulenta?{fraude, normal}2
Mensajería¿Este correo es no deseado?{spam, legítimo}2
Salud¿Este paciente presenta la patología?{enfermo, sano}2
Telecomunicaciones¿Este cliente va a cancelar?{cancelación, permanencia}2
Botánica¿De qué especie se trata?{setosa, versicolor, virginica}3
Industria¿Qué tipo de defecto afecta a esta pieza?{rayadura, fisura, porosidad, ninguno}4

3. La regresión

DEFINICIÓN — Regresión (regresión supervisada)

Definición rigurosa

Tarea de aprendizaje supervisado consistente en inducir, a partir de una muestra de observaciones etiquetadas, una función f : X → Y donde el conjunto de llegada Y es un subconjunto de ℝ — la mayoría de las veces ℝ entero, ℝ⁺, o un intervalo acotado. El conjunto de llegada está por tanto dotado de un orden total y de una distancia, lo que confiere sentido a la cantidad y − ŷ, llamada residuo (capítulo 066).

Formulación estadística

La regresión estima una característica de la distribución condicional de Y dado X. La regresión por mínimos cuadrados estima la esperanza condicional E[Y | X = x]; la regresión cuantílica estima un cuantil condicional; la regresión sobre el valor absoluto estima la mediana condicional.

Traducción al lenguaje corriente

Estimar una cantidad, es decir, producir un número situado sobre una escala graduada, sobre la cual es posible decir en cuánto uno se ha equivocado.

Punto de etimología

El término proviene de Francis Galton (1886), que observa la «regresión hacia la mediocridad» — hoy regresión hacia la media — en la transmisión de la estatura entre generaciones. La palabra designa hoy, por extensión, toda estimación de un objetivo numérico. No expresa ninguna noción de retroceso.

3.1 Operaciones lícitas y significado del error

Operación sobre dos valores objetivoRegresiónConsecuencia práctica
Comprobar la igualdad y₁ = y₂Lícita pero sin interésLa probabilidad de igualdad exacta es nula sobre una variable continua
Ordenar y₁ < y₂LícitaPermite las métricas basadas en los rangos
Calcular la diferencia y₁ − y₂LícitaFundamenta la noción de residuo
Calcular una mediaLícitaFundamenta la baseline «predecir la media»
Elevar la diferencia al cuadradoLícitaFundamenta MSE y RMSE (capítulos 068 y 069)

Consecuencia directa: en regresión, el error es graduado. Predecir 248 000 € para un inmueble vendido a 250 000 € es un resultado de calidad; predecir 90 000 € para el mismo inmueble es un fallo. La distinción entre estas dos situaciones es imposible de formular en el marco de la clasificación, donde las dos predicciones serían igualmente «falsas».

3.2 Forma de la salida

SalidaNaturalezaUso
Predicción puntualUn real ŷSalida estándar de predict()
Intervalo de predicciónUn par [y^inf\hat{y}_{\mathrm{inf}}, y^sup\hat{y}_{\mathrm{sup}}]Comunicación de la incertidumbre
Cuantiles condicionalesVarios realesDecisión asimétrica, gestión de stock

Un regresor no dispone de ningún equivalente de predict_proba(): no existe «probabilidad de cada valor posible» cuando el conjunto de llegada es continuo. Esta asimetría se desarrolla en el capítulo 029.

ANALOGÍA — El casillero y la regla graduada

Un farmacéutico ordena cajas en cajones etiquetados: antibióticos, analgésicos, antihistamínicos. Una caja está en el cajón correcto o en el incorrecto. No existe el «cajón casi correcto». Es una clasificación.

El mismo farmacéutico pesa una preparación magistral y apunta a 250 mg. Obtiene 248 mg: la diferencia es de 2 mg, cuantificable, y aceptable respecto a la tolerancia farmacéutica. Obtiene 90 mg: la diferencia es de 160 mg, y la preparación es inutilizable. Es una regresión.

El cajón no admite grado. La balanza sí lo admite. Toda la diferencia entre los dos marcos reside en esta propiedad de la escala de salida.

3.3 Ejemplos representativos y ejemplos cruzados

La tabla siguiente sitúa lado a lado, para un mismo dominio de negocio, un objetivo perteneciente a la clasificación y un objetivo perteneciente a la regresión. Establece que el dominio no determina nada.

DominioObjetivo categórico → clasificaciónObjetivo numérico → regresión
Inmobiliario¿El inmueble se venderá en menos de 90 días?Precio de venta en euros
Salud¿El paciente es diabético?Tasa de HbA1c en porcentaje
Energía¿Se superará el pico de consumo?Consumo en kWh del día
Meteorología¿Lloverá mañana?Temperatura máxima en °C
Pago¿La transacción es fraudulenta?Importe de la pérdida en caso de fraude
Recursos humanos¿El candidato aceptará la oferta?Salario de aceptación en euros
Industria¿La pieza es conforme?Cota medida en milímetros
Marketing¿El cliente va a suscribirse?Cifra de negocio a 12 meses

Lectura de la tabla: cada fila describe un único dominio, a menudo un único conjunto de datos, con las mismas variables explicativas. Solo la columna seleccionada como objetivo cambia, y con ella el tipo de problema.


4. La pregunta de calificación y su árbol de decisión

4.1 La pregunta a plantear

¿Qué se busca exactamente producir, y de qué naturaleza es el valor producido: una categoría tomada de una lista fijada, o un número situado sobre una escala?

Su forma abreviada, utilizable en reunión de encuadre:

Forma de la pregunta de negocioTipo de problema
«¿Qué categoría?», «¿Cuál?», «¿Es que…?», «¿Sí o no?»Clasificación
«¿Cuánto?», «¿Qué cantidad?», «¿Qué importe?», «¿Qué duración?»Regresión

Punto de vigilancia: la pregunta debe referirse al valor producido por el modelo, no a la decisión tomada después por la organización. Un modelo que estima un importe de pérdida (regresión) puede alimentar una decisión binaria de aceptación o de rechazo. La decisión posterior no modifica la naturaleza de la salida del modelo.

4.2 El test de las tres operaciones

Cuando la pregunta de negocio sigue siendo ambigua, el test siguiente decide mecánicamente. Se aplica a los valores observados del objetivo.

Operación probadaInterpretación si el resultado tiene un sentido de negocio
1. ¿y₁ = y₂?Siempre verdadero: condición mínima, no discrimina
2. ¿y₁ < y₂?Existe un orden: el objetivo es al menos ordinal
3. ¿y₁ − y₂ interpretable como una diferencia?Existe una métrica: el objetivo es numérico

Regla de lectura

  • Solo la operación 1 tiene sentido: clasificación (objetivo nominal).
  • Las operaciones 1 y 2 tienen sentido, la 3 no: caso ordinal, tratado en 5.1.
  • Las tres operaciones tienen sentido: regresión.

Ejemplo de aplicación al código postal: dos códigos postales pueden compararse por igualdad; el orden 69001 < 75015 no expresa nada de negocio; la diferencia 75015 − 69001 = 6014 no es una distancia. El código postal es una variable nominal a pesar de su almacenamiento numérico.

4.3 El árbol de decisión completo

4.4 Variable discreta y variable continua

DEFINICIÓN — Variable discreta y variable continua

Definición rigurosa

Una variable aleatoria se dice discreta cuando el conjunto de sus valores posibles es finito o infinito numerable. Se dice continua cuando ese conjunto es un intervalo no degenerado de ℝ y su función de distribución es continua, siendo entonces nula la probabilidad de un valor puntual.

Traducción al lenguaje corriente

Discreto: los valores se cuentan uno por uno, y entre dos valores vecinos no hay nada. Continuo: entre dos valores, por muy próximos que sean, hay una infinidad de otros.

Punto de vigilancia — la confusión central

Discreto no es sinónimo de categórico. Un número de visitas mensuales es discreto (0, 1, 2, …) y sin embargo perfectamente numérico: el orden y la diferencia tienen sentido ahí. La dicotomía útil para calificar un problema de aprendizaje no es discreto/continuo sino nominal/numérico.

Punto de vigilancia — la medida física

Toda medida registrada es discreta por construcción, debido a la resolución finita del instrumento y a la representación en coma flotante. Una temperatura medida a la décima de grado toma un número finito de valores. Se trata como continua, porque su estructura subyacente es un intervalo de ℝ.

ObjetivoDiscreto o continuoNominal o numéricoTipo de problema
Especie de irisDiscretoNominalClasificación
Estatus de transacciónDiscretoNominalClasificación
Código postalDiscretoNominalClasificación
Número de visitas mensualesDiscretoNuméricoRegresión
Número de siniestros declaradosDiscretoNuméricoRegresión
Temperatura máximaContinuoNuméricoRegresión
Precio de ventaContinuoNuméricoRegresión

4.5 Verificación instrumentada de la naturaleza del objetivo

Scikit-learn expone una función de inspección del tipo de objetivo. Constituye un control útil, a condición de conocer sus límites.

python
import numpy as np
from sklearn.utils.multiclass import type_of_target

cibles = {
    "statut_transaction    ": np.array(["normal", "fraude", "normal", "fraude"]),
    "espece_iris           ": np.array(["setosa", "versicolor", "virginica", "setosa"]),
    "temperature_celsius   ": np.array([18.4, 21.0, 19.7, 23.2]),
    "prix_vente_eur        ": np.array([245000.0, 312500.0, 189900.0, 405000.0]),
    "nb_visites_mensuelles ": np.array([0, 3, 1, 12]),
    "note_satisfaction_1_5 ": np.array([1, 3, 2, 5]),
}

for nom, y in cibles.items():
    print(f"{nom} dtype={str(y.dtype):8s} -> type_of_target = {type_of_target(y)}")

Salida

statut_transaction     dtype=<U6      -> type_of_target = binary
espece_iris            dtype=<U10     -> type_of_target = multiclass
temperature_celsius    dtype=float64  -> type_of_target = continuous
prix_vente_eur         dtype=float64  -> type_of_target = multiclass
nb_visites_mensuelles  dtype=int64    -> type_of_target = multiclass
note_satisfaction_1_5  dtype=int64    -> type_of_target = multiclass

Interpretación

Las tres primeras líneas son conformes al análisis de negocio. Las tres siguientes no lo son:

  • prix_vente_eur es un objetivo de regresión, calificado multiclass porque los cuatro valores, aunque de tipo flotante, son enteros y poco numerosos;
  • nb_visites_mensuelles es un objetivo de regresión en el sentido del test de las tres operaciones, calificado multiclass porque es entero;
  • note_satisfaction_1_5 es un objetivo ordinal, que la función no distingue de un objetivo nominal.

Conclusión operativa: type_of_target aplica una heurística sintáctica basada en el tipo de almacenamiento y el número de valores distintos. Detecta incoherencias de formato; no califica un problema. La calificación sigue siendo un acto de análisis basado en el conocimiento del dominio.


5. Los cinco casos ambiguos y su tratamiento

Cinco configuraciones resisten a la calificación directa. Cada una exige una decisión documentada, no una elección por defecto.

5.1 Objetivo ordinal

Naturaleza: conjunto finito, dotado de un orden significativo para el negocio, sin distancia interpretable entre modalidades consecutivas. Ejemplos: nivel de riesgo {bajo, medio, alto}, nota de satisfacción de 1 a 5, estadio tumoral I a IV, calificación financiera de AAA a D.

El dilema: tratar el objetivo en clasificación multiclase equivale a destruir la información de orden — confundir «alto» con «bajo» y con «medio» cuenta como el mismo error. Tratarlo en regresión equivale a postular una equidistancia entre modalidades, hipótesis generalmente falsa: la diferencia de gravedad entre los estadios I y II no iguala la de entre III y IV.

Elección retenida: clasificación, como calificación del problema, permaneciendo finito el conjunto de llegada. Se recomiendan dos ajustes:

AjustePuesta en prácticaJustificación
Métrica sensible al ordenKappa ponderado cuadráticamente, MAE sobre los rangosPenaliza más los errores alejados en el orden
Modelo ordinal dedicadoModelo de odds proporcionales (McCullagh, 1980), descomposición en K−1 clasificadores binarios acumuladosExplota el orden sin postular la equidistancia

Recurso a la regresión: aceptable cuando el número de modalidades es elevado (a partir de una decena) y la equidistancia es defendible, siendo entonces la predicción real redondeada. Esta elección debe justificarse explícitamente. La clasificación ordinal se detalla en el capítulo 011.

5.2 Objetivo de conteo

Naturaleza: conjunto de los enteros naturales, infinito numerable, ordenado, dotado de una distancia interpretable. Ejemplos: número de siniestros anuales, número de visitas, número de defectos por lote.

Elección retenida: regresión. Las tres operaciones del test tienen sentido; el conjunto de llegada no es finito. El hecho de que los valores sean enteros no constituye un criterio de clasificación.

Punto de atenciónTratamiento recomendado
Soporte positivo y asimetría fuertePérdida de devianza de Poisson o binomial negativa en lugar de MSE
Sobredispersión (varianza superior a la media)Modelo binomial negativo
Exceso de cerosModelo con inflación de ceros, o descomposición en un clasificador «cero o no» seguido de un regresor sobre los no ceros
Predicción real no enteraRedondeo en posprocesamiento, nunca en la función de pérdida

Error frecuente: tratar un conteo acotado en la práctica (0, 1, 2, 3 siniestros) como una clasificación de cuatro clases. Esta formulación prohíbe al modelo predecir 4, destruye el orden y hace ininterpretable el residuo.

5.3 Duración con censura

Naturaleza: duración hasta la ocurrencia de un evento, observada de forma incompleta para una parte de los sujetos — el contrato sigue activo, el paciente sigue vivo, la máquina aún no se ha averiado al final del periodo de observación.

DEFINICIÓN — Censura a la derecha (right censoring)

Definición rigurosa

Situación en la que la duración de interés T de un sujeto no se observa directamente, estando disponible únicamente el dato del par (min(T, C), 1{T ≤ C}), donde C designa la duración de seguimiento. La información disponible es entonces «T es superior a C» y no el valor de T.

Traducción al lenguaje corriente

Se sabe que el evento aún no había ocurrido cuando se dejó de observar, sin saber cuándo ocurrirá.

Consecuencia metodológica

Descartar las observaciones censuradas sesga la estimación hacia las duraciones cortas, porque los sujetos de larga duración de vida son precisamente los que están censurados. Reemplazar la duración censurada por la duración de seguimiento sesga igualmente la estimación, hacia abajo. El marco apropiado es el análisis de supervivencia: estimador de Kaplan-Meier (1958), modelo de riesgos proporcionales de Cox (1972), bosques de supervivencia.

Punto de vigilancia

La censura no es un dato faltante en el sentido del capítulo 018. Una duración censurada porta una información parcial explotable, no una ausencia de información.

Elección retenida: ni clasificación ni regresión en sentido estricto cuando la censura es sustancial. La tabla siguiente fija la conducta a seguir.

SituaciónFormulación retenidaJustificación
Histórico completo, todos los eventos observadosRegresión sobre la duraciónNinguna censura, marco estándar aplicable
Censura presente, estimación de la duración requeridaAnálisis de supervivenciaÚnico marco que explota correctamente las observaciones censuradas
Censura presente, decisión a horizonte fijo HClasificación binaria «evento antes de H»Válida a condición de retener solo los sujetos cuyo seguimiento alcanza H
Censura importante y seguimiento heterogéneoAnálisis de supervivencia obligatorioLa restricción del campo destruiría una parte mayor de la muestra

5.4 Probabilidad como objetivo

Naturaleza: el valor a producir es un número del intervalo [0, 1]. La calificación depende enteramente de lo que se observa en la muestra de entrenamiento, no de lo que se pide en salida.

Lo que se observa para cada filaTipo de problemaModelado
Un desenlace binario, 0 o 1Clasificación binariaClasificador probabilístico, salida predict_proba, pérdida log loss (capítulo 061), calibración verificada
Una proporción medida, por ejemplo una tasa de conversión por tiendaRegresión sobre [0, 1]Regresión beta, o regresión sobre la transformación logit, o pérdida adaptada al soporte acotado

Punto central: pedir una probabilidad en salida no convierte un problema en una regresión. Un modelo de detección de fraude que devuelve p = 0,83 sigue siendo un modelo de clasificación: el objetivo observado en el entrenamiento vale 0 o 1. La salida continua es una estimación de P(Y = 1 | X = x), no un objetivo numérico aprendido como tal.

Punto de vigilancia: una puntuación de probabilidad producida por un clasificador no está necesariamente calibrada. Una puntuación de 0,83 no significa que el 83 % de los casos que reciben esa puntuación sean positivos, salvo verificación explícita (capítulo 061).

5.5 Objetivo numérico discretizado voluntariamente

Naturaleza: el objetivo disponible es numérico — un importe, una edad, una tasa — y la organización pide una salida en clases definidas por umbrales: «cliente de bajo, medio o alto potencial», «riesgo aceptable o inaceptable».

Elección retenida: regresión sobre el objetivo numérico, luego aplicación del umbral a la predicción. La discretización previa del objetivo destruye información y degrada la potencia estadística; esta práctica está documentada en la literatura metodológica bajo el término de dicotomización abusiva (Royston, Altman y Sauerbrei, 2006).

CriterioDiscretizar el objetivo antes del aprendizajeRegresar y luego aplicar umbral
Información conservadaPérdida de la variación intraclaseIntegridad conservada
Efecto de umbralDos valores separados por 1 € se convierten en dos clases diferentesNinguno: tratamiento continuo
Cambio de umbral de negocioReetiquetado y reentrenamiento completosModificación de una constante, sin reentrenamiento
Umbrales múltiples simultáneosUn modelo por particiónUn modelo único
Legibilidad para el negocioInmediataRequiere una capa de restitución

Excepción admitida: cuando el objetivo numérico subyacente no es observable y solo la clase está registrada en el sistema fuente — un tramo de ingresos declarativo, un nivel de riesgo atribuido por un experto. El dato disponible es entonces nativamente categórico y el problema es una clasificación, sin reformulación posible.

5.6 Tabla recapitulativa de los casos ambiguos

CasoEstructura del objetivoElección retenidaMotivo determinante
OrdinalFinito, ordenado, no métricoClasificación, con métrica y modelo sensibles al ordenEl conjunto de llegada sigue siendo finito
ConteoEnteros, infinito, métricoRegresión, pérdida de PoissonLas tres operaciones tienen sentido
Duración censuradaℝ⁺ parcialmente observadoAnálisis de supervivencia, o clasificación a horizonte fijoLa censura invalida la regresión ingenua
Probabilidad[0, 1]Clasificación si la etiqueta observada es binaria, regresión si se mide una proporciónLa calificación depende del objetivo observado
Numérico discretizadoℝ recodificado en clasesRegresión y luego umbral, salvo objetivo nativamente categóricoLa discretización destruye información

6. Consecuencias de la elección sobre el conjunto de la cadena

La calificación interviene en la etapa 3 del ciclo de vida (capítulo 012). Todas las etapas ulteriores dependen de ella.

6.1 Tabla comparativa completa

DimensiónClasificaciónRegresión
Conjunto de llegada{c₁, …, cKc_K}, finito, no ordenadoSubconjunto de ℝ, ordenado y métrico
Objeto aprendidoPartición del espacio de entrada, frontera de decisiónSuperficie de respuesta definida sobre todo el espacio de entrada
Cantidad estimadaP(Y = c dado X = x), probabilidad condicional de cada claseE[Y dado X = x], esperanza condicional, o un cuantil condicional
Salida bruta del modeloVector de K puntuacionesUn real
Salida entregadaUna clase, tras aplicación de un umbral o de un argmaxEl valor, eventualmente encuadrado por un intervalo
Noción de errorDesacuerdo binario, contadoResiduo con signo, graduado
Funciones de pérdida usualesEntropía cruzada, log loss, hinge, focal loss; criterios de división Gini y entropíaMSE, MAE, Huber, pinball cuantílica, devianza de Poisson, RMSLE
Métricas de evaluaciónAccuracy, precisión, recall, especificidad, F1, F-beta, balanced accuracy, log loss, ROC-AUC, PR-AUCMAE, MSE, RMSE, R², R² ajustado, MAPE, sMAPE, MedAE, RMSLE
Algoritmos representativosRegresión logística, árbol, bosque aleatorio, boosting, SVC, k-NN, Naive Bayes, MLPRegresión lineal, Ridge, Lasso, ElasticNet, árbol, bosque aleatorio, boosting, SVR, k-NN, MLP
Sufijo scikit-learn…Classifier…Regressor
Baseline de referenciaPredecir sistemáticamente la clase mayoritariaPredecir sistemáticamente la media o la mediana
Partición de los datosEstratificación sobre el objetivo recomendada (capítulo 027)Partición aleatoria, estratificación por tramos si el objetivo es muy asimétrico
Patología de distribuciónDesequilibrio de clases (capítulos 050 y 051)Asimetría, valores extremos, heterocedasticidad
Ajuste posentrenamientoUmbral de decisión (capítulo 062)Ningún equivalente directo; recalibración eventual de la escala
Diagnóstico de errorMatriz de confusión, análisis FP/FNGráfico de residuos, residuos contra valores predichos
Naturaleza del arbitraje de negocioQué error cuesta más caro, falso positivo o falso negativoQué error cuesta más caro, sobreestimación o subestimación
Supervisión en producciónDeriva de la distribución de las clases predichasDeriva de la distribución y de la media de las predicciones

6.2 Dos puntos estructurantes

La función de pérdida no es la métrica. La pérdida se optimiza durante el entrenamiento y debe ser derivable para los algoritmos de gradiente; la métrica evalúa el modelo y responde a una pregunta de negocio. Un clasificador optimiza la log loss y se juzga por el recall; un regresor optimiza el MSE y se juzga por el MAE. Esta distinción se desarrolla en el capítulo 030.

El umbral de decisión solo existe en clasificación binaria. Constituye una palanca posentrenamiento potente: con el modelo sin cambios, hacer variar el umbral desplaza el equilibrio entre falsos positivos y falsos negativos. La regresión no ofrece ninguna palanca equivalente sobre el modelo mismo; el umbral eventualmente aplicado a su salida pertenece a la regla de decisión posterior, no al modelo.


7. La reformulación: una necesidad de negocio, dos marcos posibles

7.1 El principio

Una necesidad de negocio no es un problema de aprendizaje. Se convierte en un problema de aprendizaje en el momento en que se elige una variable objetivo. Cuando varios objetivos están disponibles para responder a la misma necesidad, varias formulaciones coexisten, eventualmente en marcos diferentes.

El caso de referencia: el mantenimiento predictivo. Un operador supervisa un parque de bombas industriales instrumentadas. La necesidad es única: intervenir antes del fallo sin multiplicar las inmovilizaciones inútiles. Dos objetivos son construibles a partir del mismo histórico y de los mismos sensores.

DEFINICIÓN — Vida útil residual (Remaining Useful Life, RUL)

Definición rigurosa

Duración que separa el instante de observación del instante de fallo de un equipo, condicionalmente a su estado constatado y a su histórico de explotación. Constituye el objetivo de referencia de los enfoques pronósticos en mantenimiento condicional.

Traducción en lenguaje corriente

El número de días que le quedan a la máquina antes de la avería, estimado a partir de su estado actual.

Punto de vigilancia

El etiquetado de una vida útil residual exige ciclos de vida completos: el valor solo se conoce para los equipos que han llegado efectivamente hasta el fallo. Los equipos aún en servicio al término del período de observación están censurados en el sentido de la sección 5.3. Un conjunto de datos de mantenimiento comporta casi sistemáticamente censura, lo que constituye el primer obstáculo práctico a la formulación en regresión.

7.2 Cifra comparada de las dos formulaciones

El protocolo siguiente construye un conjunto de datos de degradación, deriva los dos objetivos de las mismas variables explicativas, entrena los dos modelos, y ajusta para cada uno su propio umbral de decisión sobre una partición de validación, a la luz de una función de coste explícita: 800 € para una intervención preventiva, 12 000 € para un fallo sufrido.

python
import numpy as np
from sklearn.ensemble import RandomForestClassifier, RandomForestRegressor
from sklearn.model_selection import train_test_split
from sklearn.metrics import precision_score, recall_score, mean_absolute_error

rng = np.random.default_rng(42)
n = 6000

# Parque de bombas industriales : las MISMAS variables explicativas
heures    = rng.uniform(0, 20000, n)                            # horas acumuladas
vibration = 1.2 + 0.00018 * heures + rng.normal(0, 0.35, n)     # mm/s RMS
temp      = 55 + 0.0011 * heures + rng.normal(0, 3.0, n)        # °C en el cojinete
delta_p   = 2.6 - 0.00007 * heures + rng.normal(0, 0.20, n)     # bar
nb_maint  = rng.poisson(0.5 + heures / 9000)                    # intervenciones pasadas

usure = 0.55 * vibration + 0.035 * temp - 0.9 * delta_p + 0.00004 * heures
rul = 300 * np.exp(-0.5 * usure) * np.exp(rng.normal(0, 0.22, n))   # dias restantes

X = np.column_stack([heures, vibration, temp, delta_p, nb_maint])
y_reg = rul                        # objetivo continuo -> REGRESION
y_clf = (rul <= 30).astype(int)    # objetivo binario  -> CLASIFICACION

Xtr, Xte, yr_tr, yr_te, yc_tr, yc_te = train_test_split(
    X, y_reg, y_clf, test_size=0.3, random_state=0, stratify=y_clf)
Xtr, Xva, yr_tr, yr_va, yc_tr, yc_va = train_test_split(
    Xtr, yr_tr, yc_tr, test_size=0.25, random_state=0, stratify=yc_tr)

C_PREV, C_PANNE = 800, 12000       # euros : intervencion preventiva / fallo sufrido

def cout(y_vrai, pred):
    return int(pred.sum()) * C_PREV + int(((y_vrai == 1) & (pred == 0)).sum()) * C_PANNE

clf = RandomForestClassifier(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yc_tr)
reg = RandomForestRegressor(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yr_tr)

p_va, p_te = clf.predict_proba(Xva)[:, 1], clf.predict_proba(Xte)[:, 1]
r_va, r_te = reg.predict(Xva), reg.predict(Xte)

# Cada formulacion recibe su umbral de decision, ajustado sobre el coste, en validacion
seuil_a = min(np.arange(0.02, 0.61, 0.01), key=lambda s: cout(yc_va, (p_va >= s).astype(int)))
seuil_b = min(np.arange(10, 121, 1),       key=lambda t: cout(yc_va, (r_va <= t).astype(int)))

print(f"Umbrales ajustados sobre la validacion : A p >= {seuil_a:.2f}   B RUL_pred <= {seuil_b} dias")
print(f"MAE de B sobre la vida util residual : {mean_absolute_error(yr_te, r_te):.1f} dias")
print(f"Coste de referencia, ninguna alerta : {int(yc_te.sum()) * C_PANNE} EUR\n")

for nom, pred in [("A - clasificacion binaria      ", (p_te >= seuil_a).astype(int)),
                  ("B - regresion sobre la vida util", (r_te <= seuil_b).astype(int))]:
    print(f"{nom} precision={precision_score(yc_te, pred, zero_division=0):.3f}  "
          f"recall={recall_score(yc_te, pred):.3f}  alertas={int(pred.sum()):3d}  "
          f"omitidas={int(((yc_te == 1) & (pred == 0)).sum()):2d}  coste={cout(yc_te, pred):6d} EUR")

print("\nB - horizonte de intervencion modificado sin reentrenamiento :")
for h in (60, 90):
    cible_h, pred_h = (yr_te <= h).astype(int), (r_te <= h).astype(int)
    print(f"   horizonte {h:2d} d : precision={precision_score(cible_h, pred_h):.3f}  "
          f"recall={recall_score(cible_h, pred_h):.3f}  alertas={int(pred_h.sum()):3d}")

Salida

Umbrales ajustados sobre la validacion : A p >= 0.05   B RUL_pred <= 40 dias
MAE de B sobre la vida util residual : 18.5 dias
Coste de referencia, ninguna alerta : 2076000 EUR

A - clasificacion binaria       precision=0.431  recall=0.954  alertas=383  omitidas= 8  coste=402400 EUR
B - regresion sobre la vida util precision=0.486  recall=0.913  alertas=325  omitidas=15  coste=440000 EUR

B - horizonte de intervencion modificado sin reentrenamiento :
   horizonte 60 d : precision=0.900  recall=0.888  alertas=668
   horizonte 90 d : precision=0.932  recall=0.927  alertas=979

Interpretación

ObservaciónLectura
Las dos formulaciones reducen el coste de 2 076 000 € a unos 0,4 M€La necesidad es tratable en ambos marcos; la calificación no se juega en la viabilidad
A obtiene 402 400 € frente a 440 000 € para B en el horizonte de 30 díasLa clasificación optimiza directamente la separación en el horizonte considerado; la regresión optimiza el error en toda la escala de las duraciones, incluso allí donde ninguna decisión se juega
B muestra una precisión ligeramente superior y 58 alertas menos, por 7 fallos omitidos de másLas dos formulaciones no ocupan el mismo punto del compromiso precisión-recall; la comparación solo tiene sentido a función de coste fijada
El umbral óptimo de B es 40 días, no 30La salida de un regresor no se utiliza con el umbral de negocio bruto: está regresada hacia la media y debe reajustarse empíricamente
B trata los horizontes 60 y 90 días con el mismo modelo entrenadoCambiar de horizonte en la formulación A impone un reetiquetado y un reentrenamiento completos
El MAE de B es de 18,5 díasUn error medio de 18,5 días hace inexplotable la formulación B para un horizonte de 7 o 14 días, información que la sola métrica de clasificación no revela

7.3 Criterios de arbitraje entre las dos formulaciones

CriterioOrienta hacia la clasificaciónOrienta hacia la regresión
Horizonte de decisiónÚnico, fijo, estable en el tiempoMúltiple, variable, o negociado caso por caso
Disponibilidad de las etiquetasSolo se registra la ocurrencia del eventoLos ciclos de vida completos están documentados
Censura en el históricoImportante: la clasificación a horizonte fijo es más robustaDébil o tratable por análisis de supervivencia
Volumen de eventosBajo: concentrar la capacidad del modelo sobre la fronteraElevado: la riqueza del objetivo continuo es explotable
Naturaleza de la decisión aguas abajoBinaria, inmediata, sin priorizaciónOrdenación, planificación, asignación de recursos
Necesidad de jerarquizar los casosSatisfecha por la puntuación de probabilidadSatisfecha por el valor predicho, directamente interpretable
Comunicación al negocio«83 % de riesgo en menos de 30 días»«unos 45 días restantes»
Sensibilidad al cambio de políticaBaja: todo cambio de umbral impone un reentrenamientoAlta: un cambio de horizonte es una constante a modificar
Control del compromiso de erroresDirecto, por el umbral de decisiónIndirecto, por el umbral aplicado a la salida

Regla de conducta: cuando las dos formulaciones son realizables, construirlas ambas, evaluarlas sobre la misma función de coste de negocio y sobre el mismo conjunto de test, y luego decidir sobre ese resultado. La comparación de métricas heterogéneas — un MAE frente a un F1 — no constituye un arbitraje.

ANALOGÍA — El semáforo y la cuenta atrás

Un cruce puede señalizarse de dos maneras. El semáforo tricolor proporciona una categoría: rojo, naranja, verde. La cuenta atrás muestra un número de segundos restantes.

El semáforo basta para decidir si hay que detenerse: la decisión es binaria y su horizonte es inmediato. La cuenta atrás permite además anticipar, modular la velocidad y coordinar varios vehículos; exige en cambio una información más rica y más difícil de producir.

La elección entre los dos dispositivos no depende del cruce, sino de lo que se quiere poder decidir y de la precisión realmente alcanzable.


8. Errores de razonamiento frecuentes

ERROR — Calificar el problema por el dominio de negocio

Los enunciados «lo médico es clasificación» o «las finanzas son regresión» no tienen ningún fundamento. Un mismo servicio hospitalario produce problemas de clasificación (diagnóstico) y de regresión (duración de la estancia, posología, tasa biológica).

Formulación correcta: «El tipo de problema lo determina la estructura del conjunto de valores que puede tomar la variable objetivo, independientemente del dominio de aplicación.»

ERROR — Calificar el problema por el algoritmo previsto

Las familias algorítmicas mayores — árboles, bosques, boosting, k-NN, SVM, redes de neuronas — existen en las dos variantes. La elección del algoritmo interviene después de la calificación y no puede, por tanto, determinarla.

Formulación correcta: «El objetivo califica el problema; el problema restringe el conjunto de algoritmos admisibles; el algoritmo se elige en ese conjunto.»

ERROR — Confundir regresión logística y regresión

La regresión logística es un modelo de clasificación. El término «regresión» designa en ella la regresión lineal operada sobre el logit de la probabilidad, no la naturaleza del objetivo, que es categórico. El capítulo 036 detalla este punto.

Formulación correcta: «La regresión logística modela linealmente el logaritmo de las cuotas de un objetivo binario; pertenece a la clasificación.»

ERROR — Deducir el tipo de problema del tipo de almacenamiento del objetivo

Un código postal, un identificador de gama de producto o un código de departamento se almacenan como enteros sin constituir cantidades. Recíprocamente, un número de siniestros almacenado como entero constituye una cantidad. La inspección del dtype no sustituye el análisis semántico.

Formulación correcta: «El tipo informático de la columna es una propiedad del formato de almacenamiento; la estructura del conjunto de llegada es una propiedad del dominio.»

ERROR — Tratar un problema de regresión como una clasificación por comodidad

Trocear un objetivo numérico en tramos antes del aprendizaje reduce la potencia estadística, introduce efectos de umbral arbitrarios y hace el modelo inutilizable en cuanto los umbrales de negocio evolucionan. La legibilidad para los equipos de negocio se obtiene discretizando la predicción, no el objetivo.

Formulación correcta: «El modelo se aprende sobre el objetivo numérico; la puesta en clases se aplica a la salida, en la capa de restitución.»

ERROR — Concluir que un modelo que produce probabilidades hace regresión

Un clasificador binario produce una puntuación continua en [0, 1]. Esta salida continua es una estimación de la probabilidad condicional de pertenencia a la clase positiva. El conjunto de llegada del problema permanece finito.

Formulación correcta: «La calificación recae sobre el objetivo observado en el entrenamiento, no sobre la forma de la salida intermedia del modelo.»

ERROR — Aplicar una regresión a una duración sin tratar la censura

Restringir la muestra a los equipos que efectivamente se averiaron, o reemplazar las duraciones censuradas por la duración de seguimiento, sesga sistemáticamente la estimación hacia duraciones demasiado cortas.

Formulación correcta: «En presencia de censura a la derecha, el marco apropiado es el análisis de supervivencia; la clasificación a horizonte fijo constituye una alternativa válida si el seguimiento de cada sujeto cubre el horizonte retenido.»

ERROR — Comparar dos formulaciones concurrentes sobre métricas heterogéneas

Un MAE de 18,5 días y un F1 de 0,60 no son comparables. El arbitraje entre una formulación en clasificación y una formulación en regresión exige reducirlas ambas a una decisión y evaluarlas sobre la misma función de coste, sobre el mismo conjunto de test.

Formulación correcta: «Dos formulaciones de una misma necesidad se comparan sobre la decisión que producen y sobre su coste, nunca sobre sus métricas nativas respectivas.»


9. Síntesis

CRITERIO ÚNICO DE CALIFICACIÓN
    La estructura del conjunto de llegada de la variable objetivo.
    Ni el dominio, ni el algoritmo, ni el tipo de las variables de entrada,
    ni el formato de almacenamiento.

CLASIFICACIÓN
    f : X -> {c1, ..., cK}, conjunto FINITO y NO ORDENADO.
    Solo la igualdad está definida. El error se cuenta.

REGRESIÓN
    f : X -> intervalo de R, conjunto ORDENADO y MÉTRICO.
    El desvío y - y_pred tiene sentido. El error se mide.

EL TEST DE LAS TRES OPERACIONES
    Igualdad sola            -> clasificación
    Igualdad + orden         -> caso ordinal, tratado en clasificación
    Igualdad + orden + desvío -> regresión

LOS CINCO CASOS AMBIGUOS
    Ordinal              -> clasificación, métrica sensible al orden
    Recuento             -> regresión, pérdida de Poisson
    Duración censurada   -> análisis de supervivencia, o clasificación a horizonte fijo
    Probabilidad         -> según la etiqueta OBSERVADA: binaria o proporción
    Numérico troceado    -> regresión, luego umbral aplicado a la predicción

LO QUE LA ELECCIÓN DETERMINA A CONTINUACIÓN
    Algoritmos admisibles, función de pérdida, métricas de evaluación,
    forma de la salida, baseline, estratificación, diagnóstico de error,
    palanca de ajuste posentrenamiento, indicadores de vigilancia.

REFORMULACIÓN
    Una necesidad de negocio puede formularse en los dos marcos.
    Las dos formulaciones se comparan sobre la MISMA función de coste
    y el MISMO conjunto de test, nunca sobre sus métricas nativas.

Enunciado de síntesis

Un problema de aprendizaje supervisado es una clasificación cuando su objetivo toma sus valores en un conjunto finito no ordenado, y una regresión cuando su objetivo toma sus valores en una escala numérica donde el desvío entre dos valores es interpretable; esta calificación depende exclusivamente de la naturaleza de la variable objetivo retenida, y determina a continuación la integridad de la cadena de modelado, desde los algoritmos admisibles hasta los indicadores de vigilancia en producción.


Cuestionarios asociados

  • 010.1-quiz-critere-de-qualification.md
  • 010.2-quiz-classification.md
  • 010.3-quiz-regression.md
  • 010.4-quiz-arbre-de-decision.md
  • 010.5-quiz-cas-ambigus.md
  • 010.6-quiz-consequences-du-choix.md
  • 010.7-quiz-reformulation.md

Capítulo siguiente: 011-types-de-classification.md