Las formulaciones siguientes se emplean corrientemente para justificar la elección entre clasificación y regresión. Ninguna es válida.
| Formulación escuchada | Estatus | Contraejemplo inmediato |
|---|---|---|
| «Es un problema médico, por tanto clasificación» | Falso | Predecir la glucemia a 3 meses es una regresión en contexto médico |
| «Utilizo un Random Forest, por tanto clasificación» | Falso | RandomForestRegressor existe y trata objetivos reales |
| «Mis variables de entrada son categóricas, por tanto clasificación» | Falso | El tipo de las entradas es independiente del tipo del objetivo |
| «El objetivo está almacenado como entero, por tanto clasificación» | Falso | Un número de visitas mensuales es un entero y pertenece a la regresión |
| «Solo hay dos valores posibles en salida, por tanto regresión binaria» | Falso | Dos modalidades no ordenadas definen una clasificación binaria |
El criterio único es la estructura matemática del conjunto en el que la variable objetivo toma sus valores. Ni el dominio de aplicación, ni el algoritmo contemplado, ni el tipo de las variables explicativas, ni el formato de almacenamiento intervienen en esta calificación.
El aprendizaje supervisado, definido en el capítulo 004, consiste en inducir a partir de una muestra etiquetada una función
f : X → Y
donde X designa el espacio de las variables explicativas e Y el conjunto de llegada, es decir, el conjunto de los valores que la variable objetivo puede tomar.
Clasificación y regresión comparten íntegramente este marco. Comparten igualmente la muestra de aprendizaje, la noción de generalización, la separación entrenamiento/test (capítulo 026) y el riesgo de sobreajuste (capítulo 031). Se distinguen en un solo punto: la estructura de Y.
Definición rigurosa
Conjunto Y en el que la función objetivo toma sus valores, considerado no como un simple conjunto de símbolos sino como una estructura algebraica: nos interesan las relaciones y operaciones que están definidas en él — igualdad, orden total, distancia, adición, esperanza.
Traducción al lenguaje corriente
El conjunto de todas las respuestas posibles, y lo que uno tiene derecho a hacer con esas respuestas: ¿se puede solamente decir que son idénticas o diferentes, se pueden ordenar, se puede medir la diferencia entre dos de ellas?
Punto de vigilancia
La estructura de Y nunca es visible en el archivo de datos. Una columna que contiene los valores 1, 2, 3 puede representar tres especies vegetales (estructura nominal) o tres pasos por taller (estructura numérica). Solo el conocimiento del dominio decide. La calificación es un acto de análisis, no una inspección de tipo informático.
Enunciado director del capítulo
El tipo de problema está determinado por la naturaleza de la variable objetivo. No está determinado ni por el dominio de negocio, ni por el algoritmo contemplado, ni por el tipo de las variables explicativas.
Definición rigurosa
Tarea de aprendizaje supervisado consistente en inducir, a partir de una muestra de observaciones etiquetadas, una función f : X → Y donde el conjunto de llegada Y = {c₁, c₂, …, } es finito y no dotado de una relación de orden intrínseca. Los elementos de Y se llaman clases, categorías o modalidades. K designa el número de clases; K = 2 define la clasificación binaria, K > 2 la clasificación multiclase (capítulo 011).
Estructura del conjunto de llegada
La única relación definida sobre Y es la igualdad. Dos clases son idénticas o distintas; ninguna es «superior», y ninguna distancia está definida entre ellas. La proposición «la clase perro está más cerca de la clase gato que de la clase caballo» no tiene ningún estatus matemático en el marco estándar.
Traducción al lenguaje corriente
Colocar cada caso en uno de los casilleros de un conjunto fijado de antemano, sin que esos casilleros estén clasificados del más pequeño al más grande.
Punto de vigilancia
El conjunto de las clases se determina antes del aprendizaje y forma parte de la especificación del problema. Un modelo de clasificación nunca puede predecir una clase ausente de la muestra de entrenamiento. La aparición de una modalidad nueva en producción constituye una ruptura de especificación, no un error de predicción.
| Operación sobre dos valores objetivo | Clasificación | Justificación |
|---|---|---|
| Comprobar la igualdad y₁ = y₂ | Lícita | La igualdad es la relación fundadora de Y |
| Ordenar y₁ < y₂ | Ilícita | Ningún orden intrínseco sobre un conjunto nominal |
| Calcular la diferencia y₁ − y₂ | Ilícita | La sustracción no está definida |
| Calcular una media de los valores objetivo | Ilícita | La esperanza de una variable nominal no tiene sentido |
| Contar las ocurrencias de una clase | Lícita | Proporciona la distribución de las clases (capítulo 050) |
Consecuencia directa: el error de un modelo de clasificación no se mide por una diferencia sino por un conteo de desacuerdos, formalizado por la matriz de confusión (capítulo 052). No existe error «pequeño» o «grande» sobre una predicción única: es correcta o incorrecta.
Un clasificador produce en realidad dos salidas distintas, cuya confusión es una fuente de error frecuente.
| Salida | Naturaleza | Método scikit-learn | Conjunto de llegada |
|---|---|---|---|
| Puntuación o probabilidad por clase | Vector de K reales que suman 1 | predict_proba() | [0, 1]^K |
| Clase predicha | Una modalidad | predict() | {c₁, …, } |
El paso de la primera a la segunda se efectúa mediante la aplicación de una regla de decisión, la mayoría de las veces un umbral en binario (capítulo 062) o el argumento del máximo en multiclase. La producción de una puntuación real intermedia no transforma el problema en regresión: el conjunto de llegada del problema sigue siendo el conjunto finito de las clases, siendo la puntuación solo un intermediario de cálculo.
Definición rigurosa
Subconjunto del espacio de las variables explicativas X que separa las regiones asociadas a clases predichas diferentes. Formalmente, para un clasificador binario basado en una función de puntuación s(x) y un umbral t, la frontera es el conjunto {x ∈ X : s(x) = t}.
Traducción al lenguaje corriente
La línea, la superficie o el límite más allá del cual el modelo cambia de opinión sobre la categoría a atribuir.
Punto de vigilancia
El objeto geométrico aprendido en clasificación es una partición del espacio de entrada. En regresión, el objeto aprendido es una superficie de respuesta definida sobre todo el espacio de entrada. Esta diferencia de naturaleza explica que ciertos algoritmos se transponen mal de un marco al otro.
Un centro de clasificación dispone de un número fijo de casilleros, uno por región de destino. Cada paquete debe colocarse en exactamente un casillero. El clasificador no puede inventar un casillero, ni colocar un paquete «entre» dos casilleros.
Equivocarse de casillero es un error, sin grado: un paquete destinado a Lyon colocado en el casillero Marsella y un paquete destinado a Lyon colocado en el casillero Lille son dos errores equivalentes desde el punto de vista de la clasificación, aunque las consecuencias operativas difieran.
La vacilación del clasificador — «este paquete es probablemente para Lyon, quizá para Grenoble» — corresponde a la puntuación de probabilidad. La decisión final de depositarlo en un casillero corresponde a la clase predicha.
| Dominio | Pregunta de negocio | Conjunto de llegada | K |
|---|---|---|---|
| Pago | ¿Esta transacción es fraudulenta? | {fraude, normal} | 2 |
| Mensajería | ¿Este correo es no deseado? | {spam, legítimo} | 2 |
| Salud | ¿Este paciente presenta la patología? | {enfermo, sano} | 2 |
| Telecomunicaciones | ¿Este cliente va a cancelar? | {cancelación, permanencia} | 2 |
| Botánica | ¿De qué especie se trata? | {setosa, versicolor, virginica} | 3 |
| Industria | ¿Qué tipo de defecto afecta a esta pieza? | {rayadura, fisura, porosidad, ninguno} | 4 |
Definición rigurosa
Tarea de aprendizaje supervisado consistente en inducir, a partir de una muestra de observaciones etiquetadas, una función f : X → Y donde el conjunto de llegada Y es un subconjunto de ℝ — la mayoría de las veces ℝ entero, ℝ⁺, o un intervalo acotado. El conjunto de llegada está por tanto dotado de un orden total y de una distancia, lo que confiere sentido a la cantidad y − ŷ, llamada residuo (capítulo 066).
Formulación estadística
La regresión estima una característica de la distribución condicional de Y dado X. La regresión por mínimos cuadrados estima la esperanza condicional E[Y | X = x]; la regresión cuantílica estima un cuantil condicional; la regresión sobre el valor absoluto estima la mediana condicional.
Traducción al lenguaje corriente
Estimar una cantidad, es decir, producir un número situado sobre una escala graduada, sobre la cual es posible decir en cuánto uno se ha equivocado.
Punto de etimología
El término proviene de Francis Galton (1886), que observa la «regresión hacia la mediocridad» — hoy regresión hacia la media — en la transmisión de la estatura entre generaciones. La palabra designa hoy, por extensión, toda estimación de un objetivo numérico. No expresa ninguna noción de retroceso.
| Operación sobre dos valores objetivo | Regresión | Consecuencia práctica |
|---|---|---|
| Comprobar la igualdad y₁ = y₂ | Lícita pero sin interés | La probabilidad de igualdad exacta es nula sobre una variable continua |
| Ordenar y₁ < y₂ | Lícita | Permite las métricas basadas en los rangos |
| Calcular la diferencia y₁ − y₂ | Lícita | Fundamenta la noción de residuo |
| Calcular una media | Lícita | Fundamenta la baseline «predecir la media» |
| Elevar la diferencia al cuadrado | Lícita | Fundamenta MSE y RMSE (capítulos 068 y 069) |
Consecuencia directa: en regresión, el error es graduado. Predecir 248 000 € para un inmueble vendido a 250 000 € es un resultado de calidad; predecir 90 000 € para el mismo inmueble es un fallo. La distinción entre estas dos situaciones es imposible de formular en el marco de la clasificación, donde las dos predicciones serían igualmente «falsas».
| Salida | Naturaleza | Uso |
|---|---|---|
| Predicción puntual | Un real ŷ | Salida estándar de predict() |
| Intervalo de predicción | Un par [, ] | Comunicación de la incertidumbre |
| Cuantiles condicionales | Varios reales | Decisión asimétrica, gestión de stock |
Un regresor no dispone de ningún equivalente de predict_proba(): no existe
«probabilidad de cada valor posible» cuando el conjunto de llegada
es continuo. Esta asimetría se desarrolla en el capítulo 029.
Un farmacéutico ordena cajas en cajones etiquetados: antibióticos, analgésicos, antihistamínicos. Una caja está en el cajón correcto o en el incorrecto. No existe el «cajón casi correcto». Es una clasificación.
El mismo farmacéutico pesa una preparación magistral y apunta a 250 mg. Obtiene 248 mg: la diferencia es de 2 mg, cuantificable, y aceptable respecto a la tolerancia farmacéutica. Obtiene 90 mg: la diferencia es de 160 mg, y la preparación es inutilizable. Es una regresión.
El cajón no admite grado. La balanza sí lo admite. Toda la diferencia entre los dos marcos reside en esta propiedad de la escala de salida.
La tabla siguiente sitúa lado a lado, para un mismo dominio de negocio, un objetivo perteneciente a la clasificación y un objetivo perteneciente a la regresión. Establece que el dominio no determina nada.
| Dominio | Objetivo categórico → clasificación | Objetivo numérico → regresión |
|---|---|---|
| Inmobiliario | ¿El inmueble se venderá en menos de 90 días? | Precio de venta en euros |
| Salud | ¿El paciente es diabético? | Tasa de HbA1c en porcentaje |
| Energía | ¿Se superará el pico de consumo? | Consumo en kWh del día |
| Meteorología | ¿Lloverá mañana? | Temperatura máxima en °C |
| Pago | ¿La transacción es fraudulenta? | Importe de la pérdida en caso de fraude |
| Recursos humanos | ¿El candidato aceptará la oferta? | Salario de aceptación en euros |
| Industria | ¿La pieza es conforme? | Cota medida en milímetros |
| Marketing | ¿El cliente va a suscribirse? | Cifra de negocio a 12 meses |
Lectura de la tabla: cada fila describe un único dominio, a menudo un único conjunto de datos, con las mismas variables explicativas. Solo la columna seleccionada como objetivo cambia, y con ella el tipo de problema.
¿Qué se busca exactamente producir, y de qué naturaleza es el valor producido: una categoría tomada de una lista fijada, o un número situado sobre una escala?
Su forma abreviada, utilizable en reunión de encuadre:
| Forma de la pregunta de negocio | Tipo de problema |
|---|---|
| «¿Qué categoría?», «¿Cuál?», «¿Es que…?», «¿Sí o no?» | Clasificación |
| «¿Cuánto?», «¿Qué cantidad?», «¿Qué importe?», «¿Qué duración?» | Regresión |
Punto de vigilancia: la pregunta debe referirse al valor producido por el modelo, no a la decisión tomada después por la organización. Un modelo que estima un importe de pérdida (regresión) puede alimentar una decisión binaria de aceptación o de rechazo. La decisión posterior no modifica la naturaleza de la salida del modelo.
Cuando la pregunta de negocio sigue siendo ambigua, el test siguiente decide mecánicamente. Se aplica a los valores observados del objetivo.
| Operación probada | Interpretación si el resultado tiene un sentido de negocio |
|---|---|
| 1. ¿y₁ = y₂? | Siempre verdadero: condición mínima, no discrimina |
| 2. ¿y₁ < y₂? | Existe un orden: el objetivo es al menos ordinal |
| 3. ¿y₁ − y₂ interpretable como una diferencia? | Existe una métrica: el objetivo es numérico |
Regla de lectura
Ejemplo de aplicación al código postal: dos códigos postales pueden compararse por igualdad; el orden 69001 < 75015 no expresa nada de negocio; la diferencia 75015 − 69001 = 6014 no es una distancia. El código postal es una variable nominal a pesar de su almacenamiento numérico.
Definición rigurosa
Una variable aleatoria se dice discreta cuando el conjunto de sus valores posibles es finito o infinito numerable. Se dice continua cuando ese conjunto es un intervalo no degenerado de ℝ y su función de distribución es continua, siendo entonces nula la probabilidad de un valor puntual.
Traducción al lenguaje corriente
Discreto: los valores se cuentan uno por uno, y entre dos valores vecinos no hay nada. Continuo: entre dos valores, por muy próximos que sean, hay una infinidad de otros.
Punto de vigilancia — la confusión central
Discreto no es sinónimo de categórico. Un número de visitas mensuales es discreto (0, 1, 2, …) y sin embargo perfectamente numérico: el orden y la diferencia tienen sentido ahí. La dicotomía útil para calificar un problema de aprendizaje no es discreto/continuo sino nominal/numérico.
Punto de vigilancia — la medida física
Toda medida registrada es discreta por construcción, debido a la resolución finita del instrumento y a la representación en coma flotante. Una temperatura medida a la décima de grado toma un número finito de valores. Se trata como continua, porque su estructura subyacente es un intervalo de ℝ.
| Objetivo | Discreto o continuo | Nominal o numérico | Tipo de problema |
|---|---|---|---|
| Especie de iris | Discreto | Nominal | Clasificación |
| Estatus de transacción | Discreto | Nominal | Clasificación |
| Código postal | Discreto | Nominal | Clasificación |
| Número de visitas mensuales | Discreto | Numérico | Regresión |
| Número de siniestros declarados | Discreto | Numérico | Regresión |
| Temperatura máxima | Continuo | Numérico | Regresión |
| Precio de venta | Continuo | Numérico | Regresión |
Scikit-learn expone una función de inspección del tipo de objetivo. Constituye un control útil, a condición de conocer sus límites.
import numpy as np
from sklearn.utils.multiclass import type_of_target
cibles = {
"statut_transaction ": np.array(["normal", "fraude", "normal", "fraude"]),
"espece_iris ": np.array(["setosa", "versicolor", "virginica", "setosa"]),
"temperature_celsius ": np.array([18.4, 21.0, 19.7, 23.2]),
"prix_vente_eur ": np.array([245000.0, 312500.0, 189900.0, 405000.0]),
"nb_visites_mensuelles ": np.array([0, 3, 1, 12]),
"note_satisfaction_1_5 ": np.array([1, 3, 2, 5]),
}
for nom, y in cibles.items():
print(f"{nom} dtype={str(y.dtype):8s} -> type_of_target = {type_of_target(y)}")Salida
statut_transaction dtype=<U6 -> type_of_target = binary
espece_iris dtype=<U10 -> type_of_target = multiclass
temperature_celsius dtype=float64 -> type_of_target = continuous
prix_vente_eur dtype=float64 -> type_of_target = multiclass
nb_visites_mensuelles dtype=int64 -> type_of_target = multiclass
note_satisfaction_1_5 dtype=int64 -> type_of_target = multiclassInterpretación
Las tres primeras líneas son conformes al análisis de negocio. Las tres siguientes no lo son:
prix_vente_eur es un objetivo de regresión, calificado multiclass porque
los cuatro valores, aunque de tipo flotante, son enteros y poco
numerosos;nb_visites_mensuelles es un objetivo de regresión en el sentido del test de las tres
operaciones, calificado multiclass porque es entero;note_satisfaction_1_5 es un objetivo ordinal, que la función no distingue
de un objetivo nominal.Conclusión operativa: type_of_target aplica una heurística
sintáctica basada en el tipo de almacenamiento y el número de valores distintos.
Detecta incoherencias de formato; no califica un problema. La
calificación sigue siendo un acto de análisis basado en el conocimiento del dominio.
Cinco configuraciones resisten a la calificación directa. Cada una exige una decisión documentada, no una elección por defecto.
Naturaleza: conjunto finito, dotado de un orden significativo para el negocio, sin distancia interpretable entre modalidades consecutivas. Ejemplos: nivel de riesgo {bajo, medio, alto}, nota de satisfacción de 1 a 5, estadio tumoral I a IV, calificación financiera de AAA a D.
El dilema: tratar el objetivo en clasificación multiclase equivale a destruir la información de orden — confundir «alto» con «bajo» y con «medio» cuenta como el mismo error. Tratarlo en regresión equivale a postular una equidistancia entre modalidades, hipótesis generalmente falsa: la diferencia de gravedad entre los estadios I y II no iguala la de entre III y IV.
Elección retenida: clasificación, como calificación del problema, permaneciendo finito el conjunto de llegada. Se recomiendan dos ajustes:
| Ajuste | Puesta en práctica | Justificación |
|---|---|---|
| Métrica sensible al orden | Kappa ponderado cuadráticamente, MAE sobre los rangos | Penaliza más los errores alejados en el orden |
| Modelo ordinal dedicado | Modelo de odds proporcionales (McCullagh, 1980), descomposición en K−1 clasificadores binarios acumulados | Explota el orden sin postular la equidistancia |
Recurso a la regresión: aceptable cuando el número de modalidades es elevado (a partir de una decena) y la equidistancia es defendible, siendo entonces la predicción real redondeada. Esta elección debe justificarse explícitamente. La clasificación ordinal se detalla en el capítulo 011.
Naturaleza: conjunto de los enteros naturales, infinito numerable, ordenado, dotado de una distancia interpretable. Ejemplos: número de siniestros anuales, número de visitas, número de defectos por lote.
Elección retenida: regresión. Las tres operaciones del test tienen sentido; el conjunto de llegada no es finito. El hecho de que los valores sean enteros no constituye un criterio de clasificación.
| Punto de atención | Tratamiento recomendado |
|---|---|
| Soporte positivo y asimetría fuerte | Pérdida de devianza de Poisson o binomial negativa en lugar de MSE |
| Sobredispersión (varianza superior a la media) | Modelo binomial negativo |
| Exceso de ceros | Modelo con inflación de ceros, o descomposición en un clasificador «cero o no» seguido de un regresor sobre los no ceros |
| Predicción real no entera | Redondeo en posprocesamiento, nunca en la función de pérdida |
Error frecuente: tratar un conteo acotado en la práctica (0, 1, 2, 3 siniestros) como una clasificación de cuatro clases. Esta formulación prohíbe al modelo predecir 4, destruye el orden y hace ininterpretable el residuo.
Naturaleza: duración hasta la ocurrencia de un evento, observada de forma incompleta para una parte de los sujetos — el contrato sigue activo, el paciente sigue vivo, la máquina aún no se ha averiado al final del periodo de observación.
Definición rigurosa
Situación en la que la duración de interés T de un sujeto no se observa directamente, estando disponible únicamente el dato del par (min(T, C), 1{T ≤ C}), donde C designa la duración de seguimiento. La información disponible es entonces «T es superior a C» y no el valor de T.
Traducción al lenguaje corriente
Se sabe que el evento aún no había ocurrido cuando se dejó de observar, sin saber cuándo ocurrirá.
Consecuencia metodológica
Descartar las observaciones censuradas sesga la estimación hacia las duraciones cortas, porque los sujetos de larga duración de vida son precisamente los que están censurados. Reemplazar la duración censurada por la duración de seguimiento sesga igualmente la estimación, hacia abajo. El marco apropiado es el análisis de supervivencia: estimador de Kaplan-Meier (1958), modelo de riesgos proporcionales de Cox (1972), bosques de supervivencia.
Punto de vigilancia
La censura no es un dato faltante en el sentido del capítulo 018. Una duración censurada porta una información parcial explotable, no una ausencia de información.
Elección retenida: ni clasificación ni regresión en sentido estricto cuando la censura es sustancial. La tabla siguiente fija la conducta a seguir.
| Situación | Formulación retenida | Justificación |
|---|---|---|
| Histórico completo, todos los eventos observados | Regresión sobre la duración | Ninguna censura, marco estándar aplicable |
| Censura presente, estimación de la duración requerida | Análisis de supervivencia | Único marco que explota correctamente las observaciones censuradas |
| Censura presente, decisión a horizonte fijo H | Clasificación binaria «evento antes de H» | Válida a condición de retener solo los sujetos cuyo seguimiento alcanza H |
| Censura importante y seguimiento heterogéneo | Análisis de supervivencia obligatorio | La restricción del campo destruiría una parte mayor de la muestra |
Naturaleza: el valor a producir es un número del intervalo [0, 1]. La calificación depende enteramente de lo que se observa en la muestra de entrenamiento, no de lo que se pide en salida.
| Lo que se observa para cada fila | Tipo de problema | Modelado |
|---|---|---|
| Un desenlace binario, 0 o 1 | Clasificación binaria | Clasificador probabilístico, salida predict_proba, pérdida log loss (capítulo 061), calibración verificada |
| Una proporción medida, por ejemplo una tasa de conversión por tienda | Regresión sobre [0, 1] | Regresión beta, o regresión sobre la transformación logit, o pérdida adaptada al soporte acotado |
Punto central: pedir una probabilidad en salida no convierte un problema en una regresión. Un modelo de detección de fraude que devuelve p = 0,83 sigue siendo un modelo de clasificación: el objetivo observado en el entrenamiento vale 0 o 1. La salida continua es una estimación de P(Y = 1 | X = x), no un objetivo numérico aprendido como tal.
Punto de vigilancia: una puntuación de probabilidad producida por un clasificador no está necesariamente calibrada. Una puntuación de 0,83 no significa que el 83 % de los casos que reciben esa puntuación sean positivos, salvo verificación explícita (capítulo 061).
Naturaleza: el objetivo disponible es numérico — un importe, una edad, una tasa — y la organización pide una salida en clases definidas por umbrales: «cliente de bajo, medio o alto potencial», «riesgo aceptable o inaceptable».
Elección retenida: regresión sobre el objetivo numérico, luego aplicación del umbral a la predicción. La discretización previa del objetivo destruye información y degrada la potencia estadística; esta práctica está documentada en la literatura metodológica bajo el término de dicotomización abusiva (Royston, Altman y Sauerbrei, 2006).
| Criterio | Discretizar el objetivo antes del aprendizaje | Regresar y luego aplicar umbral |
|---|---|---|
| Información conservada | Pérdida de la variación intraclase | Integridad conservada |
| Efecto de umbral | Dos valores separados por 1 € se convierten en dos clases diferentes | Ninguno: tratamiento continuo |
| Cambio de umbral de negocio | Reetiquetado y reentrenamiento completos | Modificación de una constante, sin reentrenamiento |
| Umbrales múltiples simultáneos | Un modelo por partición | Un modelo único |
| Legibilidad para el negocio | Inmediata | Requiere una capa de restitución |
Excepción admitida: cuando el objetivo numérico subyacente no es observable y solo la clase está registrada en el sistema fuente — un tramo de ingresos declarativo, un nivel de riesgo atribuido por un experto. El dato disponible es entonces nativamente categórico y el problema es una clasificación, sin reformulación posible.
| Caso | Estructura del objetivo | Elección retenida | Motivo determinante |
|---|---|---|---|
| Ordinal | Finito, ordenado, no métrico | Clasificación, con métrica y modelo sensibles al orden | El conjunto de llegada sigue siendo finito |
| Conteo | Enteros, infinito, métrico | Regresión, pérdida de Poisson | Las tres operaciones tienen sentido |
| Duración censurada | ℝ⁺ parcialmente observado | Análisis de supervivencia, o clasificación a horizonte fijo | La censura invalida la regresión ingenua |
| Probabilidad | [0, 1] | Clasificación si la etiqueta observada es binaria, regresión si se mide una proporción | La calificación depende del objetivo observado |
| Numérico discretizado | ℝ recodificado en clases | Regresión y luego umbral, salvo objetivo nativamente categórico | La discretización destruye información |
La calificación interviene en la etapa 3 del ciclo de vida (capítulo 012). Todas las etapas ulteriores dependen de ella.
| Dimensión | Clasificación | Regresión |
|---|---|---|
| Conjunto de llegada | {c₁, …, }, finito, no ordenado | Subconjunto de ℝ, ordenado y métrico |
| Objeto aprendido | Partición del espacio de entrada, frontera de decisión | Superficie de respuesta definida sobre todo el espacio de entrada |
| Cantidad estimada | P(Y = c dado X = x), probabilidad condicional de cada clase | E[Y dado X = x], esperanza condicional, o un cuantil condicional |
| Salida bruta del modelo | Vector de K puntuaciones | Un real |
| Salida entregada | Una clase, tras aplicación de un umbral o de un argmax | El valor, eventualmente encuadrado por un intervalo |
| Noción de error | Desacuerdo binario, contado | Residuo con signo, graduado |
| Funciones de pérdida usuales | Entropía cruzada, log loss, hinge, focal loss; criterios de división Gini y entropía | MSE, MAE, Huber, pinball cuantílica, devianza de Poisson, RMSLE |
| Métricas de evaluación | Accuracy, precisión, recall, especificidad, F1, F-beta, balanced accuracy, log loss, ROC-AUC, PR-AUC | MAE, MSE, RMSE, R², R² ajustado, MAPE, sMAPE, MedAE, RMSLE |
| Algoritmos representativos | Regresión logística, árbol, bosque aleatorio, boosting, SVC, k-NN, Naive Bayes, MLP | Regresión lineal, Ridge, Lasso, ElasticNet, árbol, bosque aleatorio, boosting, SVR, k-NN, MLP |
| Sufijo scikit-learn | …Classifier | …Regressor |
| Baseline de referencia | Predecir sistemáticamente la clase mayoritaria | Predecir sistemáticamente la media o la mediana |
| Partición de los datos | Estratificación sobre el objetivo recomendada (capítulo 027) | Partición aleatoria, estratificación por tramos si el objetivo es muy asimétrico |
| Patología de distribución | Desequilibrio de clases (capítulos 050 y 051) | Asimetría, valores extremos, heterocedasticidad |
| Ajuste posentrenamiento | Umbral de decisión (capítulo 062) | Ningún equivalente directo; recalibración eventual de la escala |
| Diagnóstico de error | Matriz de confusión, análisis FP/FN | Gráfico de residuos, residuos contra valores predichos |
| Naturaleza del arbitraje de negocio | Qué error cuesta más caro, falso positivo o falso negativo | Qué error cuesta más caro, sobreestimación o subestimación |
| Supervisión en producción | Deriva de la distribución de las clases predichas | Deriva de la distribución y de la media de las predicciones |
La función de pérdida no es la métrica. La pérdida se optimiza durante el entrenamiento y debe ser derivable para los algoritmos de gradiente; la métrica evalúa el modelo y responde a una pregunta de negocio. Un clasificador optimiza la log loss y se juzga por el recall; un regresor optimiza el MSE y se juzga por el MAE. Esta distinción se desarrolla en el capítulo 030.
El umbral de decisión solo existe en clasificación binaria. Constituye una palanca posentrenamiento potente: con el modelo sin cambios, hacer variar el umbral desplaza el equilibrio entre falsos positivos y falsos negativos. La regresión no ofrece ninguna palanca equivalente sobre el modelo mismo; el umbral eventualmente aplicado a su salida pertenece a la regla de decisión posterior, no al modelo.
Una necesidad de negocio no es un problema de aprendizaje. Se convierte en un problema de aprendizaje en el momento en que se elige una variable objetivo. Cuando varios objetivos están disponibles para responder a la misma necesidad, varias formulaciones coexisten, eventualmente en marcos diferentes.
El caso de referencia: el mantenimiento predictivo. Un operador supervisa un parque de bombas industriales instrumentadas. La necesidad es única: intervenir antes del fallo sin multiplicar las inmovilizaciones inútiles. Dos objetivos son construibles a partir del mismo histórico y de los mismos sensores.
Definición rigurosa
Duración que separa el instante de observación del instante de fallo de un equipo, condicionalmente a su estado constatado y a su histórico de explotación. Constituye el objetivo de referencia de los enfoques pronósticos en mantenimiento condicional.
Traducción en lenguaje corriente
El número de días que le quedan a la máquina antes de la avería, estimado a partir de su estado actual.
Punto de vigilancia
El etiquetado de una vida útil residual exige ciclos de vida completos: el valor solo se conoce para los equipos que han llegado efectivamente hasta el fallo. Los equipos aún en servicio al término del período de observación están censurados en el sentido de la sección 5.3. Un conjunto de datos de mantenimiento comporta casi sistemáticamente censura, lo que constituye el primer obstáculo práctico a la formulación en regresión.
El protocolo siguiente construye un conjunto de datos de degradación, deriva los dos objetivos de las mismas variables explicativas, entrena los dos modelos, y ajusta para cada uno su propio umbral de decisión sobre una partición de validación, a la luz de una función de coste explícita: 800 € para una intervención preventiva, 12 000 € para un fallo sufrido.
import numpy as np
from sklearn.ensemble import RandomForestClassifier, RandomForestRegressor
from sklearn.model_selection import train_test_split
from sklearn.metrics import precision_score, recall_score, mean_absolute_error
rng = np.random.default_rng(42)
n = 6000
# Parque de bombas industriales : las MISMAS variables explicativas
heures = rng.uniform(0, 20000, n) # horas acumuladas
vibration = 1.2 + 0.00018 * heures + rng.normal(0, 0.35, n) # mm/s RMS
temp = 55 + 0.0011 * heures + rng.normal(0, 3.0, n) # °C en el cojinete
delta_p = 2.6 - 0.00007 * heures + rng.normal(0, 0.20, n) # bar
nb_maint = rng.poisson(0.5 + heures / 9000) # intervenciones pasadas
usure = 0.55 * vibration + 0.035 * temp - 0.9 * delta_p + 0.00004 * heures
rul = 300 * np.exp(-0.5 * usure) * np.exp(rng.normal(0, 0.22, n)) # dias restantes
X = np.column_stack([heures, vibration, temp, delta_p, nb_maint])
y_reg = rul # objetivo continuo -> REGRESION
y_clf = (rul <= 30).astype(int) # objetivo binario -> CLASIFICACION
Xtr, Xte, yr_tr, yr_te, yc_tr, yc_te = train_test_split(
X, y_reg, y_clf, test_size=0.3, random_state=0, stratify=y_clf)
Xtr, Xva, yr_tr, yr_va, yc_tr, yc_va = train_test_split(
Xtr, yr_tr, yc_tr, test_size=0.25, random_state=0, stratify=yc_tr)
C_PREV, C_PANNE = 800, 12000 # euros : intervencion preventiva / fallo sufrido
def cout(y_vrai, pred):
return int(pred.sum()) * C_PREV + int(((y_vrai == 1) & (pred == 0)).sum()) * C_PANNE
clf = RandomForestClassifier(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yc_tr)
reg = RandomForestRegressor(n_estimators=300, min_samples_leaf=5, random_state=0).fit(Xtr, yr_tr)
p_va, p_te = clf.predict_proba(Xva)[:, 1], clf.predict_proba(Xte)[:, 1]
r_va, r_te = reg.predict(Xva), reg.predict(Xte)
# Cada formulacion recibe su umbral de decision, ajustado sobre el coste, en validacion
seuil_a = min(np.arange(0.02, 0.61, 0.01), key=lambda s: cout(yc_va, (p_va >= s).astype(int)))
seuil_b = min(np.arange(10, 121, 1), key=lambda t: cout(yc_va, (r_va <= t).astype(int)))
print(f"Umbrales ajustados sobre la validacion : A p >= {seuil_a:.2f} B RUL_pred <= {seuil_b} dias")
print(f"MAE de B sobre la vida util residual : {mean_absolute_error(yr_te, r_te):.1f} dias")
print(f"Coste de referencia, ninguna alerta : {int(yc_te.sum()) * C_PANNE} EUR\n")
for nom, pred in [("A - clasificacion binaria ", (p_te >= seuil_a).astype(int)),
("B - regresion sobre la vida util", (r_te <= seuil_b).astype(int))]:
print(f"{nom} precision={precision_score(yc_te, pred, zero_division=0):.3f} "
f"recall={recall_score(yc_te, pred):.3f} alertas={int(pred.sum()):3d} "
f"omitidas={int(((yc_te == 1) & (pred == 0)).sum()):2d} coste={cout(yc_te, pred):6d} EUR")
print("\nB - horizonte de intervencion modificado sin reentrenamiento :")
for h in (60, 90):
cible_h, pred_h = (yr_te <= h).astype(int), (r_te <= h).astype(int)
print(f" horizonte {h:2d} d : precision={precision_score(cible_h, pred_h):.3f} "
f"recall={recall_score(cible_h, pred_h):.3f} alertas={int(pred_h.sum()):3d}")Salida
Umbrales ajustados sobre la validacion : A p >= 0.05 B RUL_pred <= 40 dias
MAE de B sobre la vida util residual : 18.5 dias
Coste de referencia, ninguna alerta : 2076000 EUR
A - clasificacion binaria precision=0.431 recall=0.954 alertas=383 omitidas= 8 coste=402400 EUR
B - regresion sobre la vida util precision=0.486 recall=0.913 alertas=325 omitidas=15 coste=440000 EUR
B - horizonte de intervencion modificado sin reentrenamiento :
horizonte 60 d : precision=0.900 recall=0.888 alertas=668
horizonte 90 d : precision=0.932 recall=0.927 alertas=979Interpretación
| Observación | Lectura |
|---|---|
| Las dos formulaciones reducen el coste de 2 076 000 € a unos 0,4 M€ | La necesidad es tratable en ambos marcos; la calificación no se juega en la viabilidad |
| A obtiene 402 400 € frente a 440 000 € para B en el horizonte de 30 días | La clasificación optimiza directamente la separación en el horizonte considerado; la regresión optimiza el error en toda la escala de las duraciones, incluso allí donde ninguna decisión se juega |
| B muestra una precisión ligeramente superior y 58 alertas menos, por 7 fallos omitidos de más | Las dos formulaciones no ocupan el mismo punto del compromiso precisión-recall; la comparación solo tiene sentido a función de coste fijada |
| El umbral óptimo de B es 40 días, no 30 | La salida de un regresor no se utiliza con el umbral de negocio bruto: está regresada hacia la media y debe reajustarse empíricamente |
| B trata los horizontes 60 y 90 días con el mismo modelo entrenado | Cambiar de horizonte en la formulación A impone un reetiquetado y un reentrenamiento completos |
| El MAE de B es de 18,5 días | Un error medio de 18,5 días hace inexplotable la formulación B para un horizonte de 7 o 14 días, información que la sola métrica de clasificación no revela |
| Criterio | Orienta hacia la clasificación | Orienta hacia la regresión |
|---|---|---|
| Horizonte de decisión | Único, fijo, estable en el tiempo | Múltiple, variable, o negociado caso por caso |
| Disponibilidad de las etiquetas | Solo se registra la ocurrencia del evento | Los ciclos de vida completos están documentados |
| Censura en el histórico | Importante: la clasificación a horizonte fijo es más robusta | Débil o tratable por análisis de supervivencia |
| Volumen de eventos | Bajo: concentrar la capacidad del modelo sobre la frontera | Elevado: la riqueza del objetivo continuo es explotable |
| Naturaleza de la decisión aguas abajo | Binaria, inmediata, sin priorización | Ordenación, planificación, asignación de recursos |
| Necesidad de jerarquizar los casos | Satisfecha por la puntuación de probabilidad | Satisfecha por el valor predicho, directamente interpretable |
| Comunicación al negocio | «83 % de riesgo en menos de 30 días» | «unos 45 días restantes» |
| Sensibilidad al cambio de política | Baja: todo cambio de umbral impone un reentrenamiento | Alta: un cambio de horizonte es una constante a modificar |
| Control del compromiso de errores | Directo, por el umbral de decisión | Indirecto, por el umbral aplicado a la salida |
Regla de conducta: cuando las dos formulaciones son realizables, construirlas ambas, evaluarlas sobre la misma función de coste de negocio y sobre el mismo conjunto de test, y luego decidir sobre ese resultado. La comparación de métricas heterogéneas — un MAE frente a un F1 — no constituye un arbitraje.
Un cruce puede señalizarse de dos maneras. El semáforo tricolor proporciona una categoría: rojo, naranja, verde. La cuenta atrás muestra un número de segundos restantes.
El semáforo basta para decidir si hay que detenerse: la decisión es binaria y su horizonte es inmediato. La cuenta atrás permite además anticipar, modular la velocidad y coordinar varios vehículos; exige en cambio una información más rica y más difícil de producir.
La elección entre los dos dispositivos no depende del cruce, sino de lo que se quiere poder decidir y de la precisión realmente alcanzable.
Los enunciados «lo médico es clasificación» o «las finanzas son regresión» no tienen ningún fundamento. Un mismo servicio hospitalario produce problemas de clasificación (diagnóstico) y de regresión (duración de la estancia, posología, tasa biológica).
Formulación correcta: «El tipo de problema lo determina la estructura del conjunto de valores que puede tomar la variable objetivo, independientemente del dominio de aplicación.»
Las familias algorítmicas mayores — árboles, bosques, boosting, k-NN, SVM, redes de neuronas — existen en las dos variantes. La elección del algoritmo interviene después de la calificación y no puede, por tanto, determinarla.
Formulación correcta: «El objetivo califica el problema; el problema restringe el conjunto de algoritmos admisibles; el algoritmo se elige en ese conjunto.»
La regresión logística es un modelo de clasificación. El término «regresión» designa en ella la regresión lineal operada sobre el logit de la probabilidad, no la naturaleza del objetivo, que es categórico. El capítulo 036 detalla este punto.
Formulación correcta: «La regresión logística modela linealmente el logaritmo de las cuotas de un objetivo binario; pertenece a la clasificación.»
Un código postal, un identificador de gama de producto o un código de departamento
se almacenan como enteros sin constituir cantidades. Recíprocamente, un número
de siniestros almacenado como entero constituye una cantidad. La inspección del dtype
no sustituye el análisis semántico.
Formulación correcta: «El tipo informático de la columna es una propiedad del formato de almacenamiento; la estructura del conjunto de llegada es una propiedad del dominio.»
Trocear un objetivo numérico en tramos antes del aprendizaje reduce la potencia estadística, introduce efectos de umbral arbitrarios y hace el modelo inutilizable en cuanto los umbrales de negocio evolucionan. La legibilidad para los equipos de negocio se obtiene discretizando la predicción, no el objetivo.
Formulación correcta: «El modelo se aprende sobre el objetivo numérico; la puesta en clases se aplica a la salida, en la capa de restitución.»
Un clasificador binario produce una puntuación continua en [0, 1]. Esta salida continua es una estimación de la probabilidad condicional de pertenencia a la clase positiva. El conjunto de llegada del problema permanece finito.
Formulación correcta: «La calificación recae sobre el objetivo observado en el entrenamiento, no sobre la forma de la salida intermedia del modelo.»
Restringir la muestra a los equipos que efectivamente se averiaron, o reemplazar las duraciones censuradas por la duración de seguimiento, sesga sistemáticamente la estimación hacia duraciones demasiado cortas.
Formulación correcta: «En presencia de censura a la derecha, el marco apropiado es el análisis de supervivencia; la clasificación a horizonte fijo constituye una alternativa válida si el seguimiento de cada sujeto cubre el horizonte retenido.»
Un MAE de 18,5 días y un F1 de 0,60 no son comparables. El arbitraje entre una formulación en clasificación y una formulación en regresión exige reducirlas ambas a una decisión y evaluarlas sobre la misma función de coste, sobre el mismo conjunto de test.
Formulación correcta: «Dos formulaciones de una misma necesidad se comparan sobre la decisión que producen y sobre su coste, nunca sobre sus métricas nativas respectivas.»
CRITERIO ÚNICO DE CALIFICACIÓN
La estructura del conjunto de llegada de la variable objetivo.
Ni el dominio, ni el algoritmo, ni el tipo de las variables de entrada,
ni el formato de almacenamiento.
CLASIFICACIÓN
f : X -> {c1, ..., cK}, conjunto FINITO y NO ORDENADO.
Solo la igualdad está definida. El error se cuenta.
REGRESIÓN
f : X -> intervalo de R, conjunto ORDENADO y MÉTRICO.
El desvío y - y_pred tiene sentido. El error se mide.
EL TEST DE LAS TRES OPERACIONES
Igualdad sola -> clasificación
Igualdad + orden -> caso ordinal, tratado en clasificación
Igualdad + orden + desvío -> regresión
LOS CINCO CASOS AMBIGUOS
Ordinal -> clasificación, métrica sensible al orden
Recuento -> regresión, pérdida de Poisson
Duración censurada -> análisis de supervivencia, o clasificación a horizonte fijo
Probabilidad -> según la etiqueta OBSERVADA: binaria o proporción
Numérico troceado -> regresión, luego umbral aplicado a la predicción
LO QUE LA ELECCIÓN DETERMINA A CONTINUACIÓN
Algoritmos admisibles, función de pérdida, métricas de evaluación,
forma de la salida, baseline, estratificación, diagnóstico de error,
palanca de ajuste posentrenamiento, indicadores de vigilancia.
REFORMULACIÓN
Una necesidad de negocio puede formularse en los dos marcos.
Las dos formulaciones se comparan sobre la MISMA función de coste
y el MISMO conjunto de test, nunca sobre sus métricas nativas.Enunciado de síntesis
Un problema de aprendizaje supervisado es una clasificación cuando su objetivo toma sus valores en un conjunto finito no ordenado, y una regresión cuando su objetivo toma sus valores en una escala numérica donde el desvío entre dos valores es interpretable; esta calificación depende exclusivamente de la naturaleza de la variable objetivo retenida, y determina a continuación la integridad de la cadena de modelado, desde los algoritmos admisibles hasta los indicadores de vigilancia en producción.
Cuestionarios asociados
010.1-quiz-critere-de-qualification.md010.2-quiz-classification.md010.3-quiz-regression.md010.4-quiz-arbre-de-decision.md010.5-quiz-cas-ambigus.md010.6-quiz-consequences-du-choix.md010.7-quiz-reformulation.mdCapítulo siguiente: 011-types-de-classification.md