Variables explicativas y variable objetivo

44 min
Bloque 1 — El vocabulario fundamental
Objetivo
saber definir rigurosamente la variable explicativa y la variable objetivo, dominar sus sinónimos concurrentes y la disciplina de la que cada uno procede, formalizar una observación como un vector de características en un espacio de dimensión p, y aplicar los criterios profesionales que determinan si una columna disponible puede legítimamente someterse a un modelo.
Duración estimada
40 minutos
Requisitos previos
capítulos 001 a 005
Quiz asociados
006.1-quiz-relation-features-target.md a 006.7-quiz-etudes-de-cas.md

1. La estructura de un problema supervisado: FEATURES → MODELO → TARGET

1.1 La fórmula mental

Todo problema de aprendizaje supervisado, sea cual sea el dominio de aplicación, el algoritmo elegido o el volumen de datos, se reduce a una estructura única:

Esta fórmula debe retenerse literalmente. Conlleva tres compromisos metodológicos:

  1. Lo que está a la izquierda es conocido en el momento de la predicción. Una variable colocada como entrada que no estará disponible en el instante en que la predicción deba producirse invalida el dispositivo entero. Este punto constituye el criterio de selección primero, desarrollado en el apartado 6.
  2. Lo que está a la derecha es lo que se busca obtener. La variable objetivo nunca se proporciona al modelo en fase de predicción: es precisamente su valor lo que se solicita.
  3. La flecha no es una relación causal. Expresa una asociación estadística explotada con fines de predicción. La distinción entre correlación y causalidad se trata en el capítulo 016.

1.2 Los dos regímenes de funcionamiento

La misma estructura se lee de forma diferente según la fase. Es la fuente de confusión más frecuente entre los principiantes.

FaseVariables explicativasVariable objetivoLo que se produce
AprendizajeConocidas, proporcionadasConocida, proporcionadaEl modelo
ValidaciónConocidas, proporcionadasConocida pero oculta al modelo, utilizada para compararUna medida de rendimiento
Predicción en producciónConocidas, proporcionadasDesconocidaUna estimación ŷ
Supervisión a posterioriConocidasObservada después, con retrasoUna medida de deriva

Punto de vigilancia: en fase de aprendizaje, el objetivo está presente en el conjunto de datos al igual que las demás columnas. No deja de ser por ello de una naturaleza funcional radicalmente diferente. Confundirlo con una columna ordinaria, u omitir retirarlo de las entradas, produce un modelo que predice perfectamente en aprendizaje y que es inutilizable en producción.

ANALOGÍA — El detective y sus indicios

Un investigador nunca dispone de la respuesta. Dispone de indicios: una huella, un horario, un testimonio, un rastro bancario. Cada indicio es una información parcial, incompleta, a veces engañosa. El investigador solo puede razonar sobre lo que ha recogido.

Las variables explicativas son exactamente esos indicios: son las únicas informaciones que el modelo posee para pronunciarse. La variable objetivo es la identidad del culpable, es decir, lo que la investigación debe establecer.

Tres consecuencias de esta analogía, todas exactas técnicamente:

  • Un indicio no disponible no existe. Un investigador no puede fundar su deducción en una videovigilancia que nunca fue instalada. Un modelo no puede utilizar una variable que no estará informada en el momento de la predicción.
  • Un indicio posterior al crimen no es un indicio, es una confesión. Si el investigador «deduce» la identidad del culpable a partir de la confesión firmada, no deduce nada. Es el mecanismo de la fuga de datos, tratado en el capítulo 028.
  • La calidad de los indicios determina la calidad de la investigación, más que el método de interrogatorio. Este punto se desarrolla en el apartado 6.8.

2. La variable explicativa

2.1 Definición

DEFINICIÓN — Variable explicativa (feature, característica)

Definición rigurosa

Magnitud medida o construida, asociada a cada observación de un conjunto de datos, cuyos valores se someten al modelo como entrada y a partir de los cuales este produce una estimación de la variable objetivo.

Formulación equivalente en teoría del aprendizaje

Componente del vector de entrada x perteneciente al espacio de características 𝒳, sobre el cual está definida la función de predicción f : 𝒳 → 𝒴 que el algoritmo de aprendizaje selecciona en una clase de hipótesis.

Traducción al lenguaje corriente

Una información que se da a la máquina para ayudarla a responder.

Naturaleza del concepto

La variable explicativa designa un rol funcional, no un tipo de dato. Una columna no es una variable explicativa por naturaleza: lo llega a ser por una decisión de diseño, revocable. La misma columna puede ser explicativa en un proyecto, objetivo en otro, excluida en un tercero. Este punto se desarrolla en el apartado 4.4.

Punto de vigilancia

El término explicativa es engañoso tomado al pie de la letra. Una variable explicativa no explica nada en sentido causal: aporta una información estadísticamente asociada al objetivo. Una variable fuertemente predictiva puede no mantener ningún vínculo causal con el objetivo y no ser más que un indicador indirecto de una causa común no observada.

2.2 Lo que una variable explicativa no es

Enunciado corrienteEstatusJustificación
«Toda columna del archivo es una feature»IncorrectoLos identificadores, el objetivo y las variables de fuga quedan excluidos (capítulo 005, apartado 3.2)
«Una feature explica el objetivo»Incorrecto en sentido estrictoEstá asociada al objetivo; la explicación causal pertenece a otro marco metodológico (capítulo 016)
«Una feature debe ser numérica»IncorrectoPuede ser categórica, temporal o textual; la codificación numérica es una etapa posterior (capítulos 022 y 023)
«Cuantas más features hay, mejor es el modelo»IncorrectoMás allá de un umbral, la adición de variables degrada el rendimiento en generalización (capítulos 025 y 031)
«Una feature es proporcionada por los datos»Parcialmente inexactoUna parte importante de las variables más predictivas se construye, no se registra (capítulo 024)

2.3 La taxonomía de los sinónimos

El dominio agrega vocabulario procedente de disciplinas distintas, cada una habiendo forjado su propio término para el mismo objeto. Las denominaciones siguientes son estrictamente equivalentes en la práctica; difieren por su origen, su registro y las connotaciones que transmiten.

TérminoDisciplina de origenConnotación propiaRegistro de uso actual
FeatureReconocimiento de patrones y visión por computadorMagnitud extraída de la señal bruta, eventualmente construidaDominante en Machine Learning, incluso en español profesional
CaracterísticaTraducción de featureIdéntica a featureRecomendado por escrito en español; uso oral minoritario
Variable explicativaEstadística aplicada, modeladoSugiere una contribución a la explicación del fenómenoEstándar académico hispanohablante
Variable independienteEstadística experimental, diseño de experimentos, psicología experimental (herencia de Fisher, 1935)Sugiere una variable manipulada por el experimentadorFrecuente pero problemático en ML (apartado 4)
Variable de entrada, inputAutomática, teoría de sistemas, ingenieríaNeutro: lo que entra en la cajaMuy corriente, sin ambigüedad
Predictor, predictorEstadística aplicada, literatura de la regresiónSubraya la finalidad predictiva más que explicativaCorriente, particularmente adaptado al marco del ML
RegresorEconometríaTérmino del modelo de regresión, asociado a un coeficienteReservado a los modelos paramétricos lineales
Covariable, covariateBioestadística, epidemiología, ensayos clínicosVariable cuyo efecto se ajusta para aislar el de un tratamientoEstándar en investigación clínica
AtributoAprendizaje simbólico, minería de datos, bases de datos relacionales (Quinlan, 1986)Propiedad descriptiva de una entidadAnticuado en ML, vivo en bases de datos
DescriptorQuimiometría, quimioinformáticaMagnitud calculada que describe una estructuraEspecializado
Variable exógenaEconometría estructuralDeterminada fuera del sistema modeladoEspecializado, con fuerte carga teórica
FactorDiseño de experimentos, análisis de la varianzaVariable categórica controladaAmbiguo: significa otra cosa en análisis factorial

Recomendación profesional. Por escrito en español, emplear variable explicativa o característica. Oralmente y en el código, feature es el uso establecido y no debe evitarse. En contexto de comunicación con interlocutores de negocio, variable de entrada o información proporcionada al modelo son las formulaciones más inmediatamente comprendidas. Evitar variable independiente por las razones expuestas en el apartado 4.

DEFINICIÓN — Predictor (predictor)

Definición rigurosa

Variable cuyos valores se utilizan para estimar los de otra variable, independientemente de toda pretensión explicativa o causal.

Interés del término

Es el término más honesto epistemológicamente para el Machine Learning: nombra exactamente lo que se busca, a saber, un poder predictivo, sin sugerir una comprensión del mecanismo subyacente.

Punto de vigilancia

No confundir predictor en el sentido de variable de entrada, y predictor en el sentido de modelo entero, acepción encontrada en la literatura anglófona donde a predictor designa a veces el sistema de predicción completo. El contexto resuelve la ambigüedad; en español, reservar el término a la variable.

DEFINICIÓN — Regresor y covariable

Regresor (econometría)

Variable que figura en el miembro derecho de una ecuación de regresión, asociada a un coeficiente estimado. En el modelo y = β₀ + β₁x₁ + … + βp\beta_p xpx_p + ε, las xjx_j son los regresores y la variable explicada y es el regresando.

El término es indisociable de un modelo paramétrico explícito. Hablar de «regresores» a propósito de un bosque aleatorio es un abuso de lenguaje: ningún coeficiente está asociado ahí a una variable.

Covariable (bioestadística)

Variable medida cuyo efecto se tiene en cuenta en el modelo a fin de aislar el efecto de una variable de interés, típicamente un tratamiento. En un ensayo clínico que evalúa un medicamento, la edad y el sexo de los pacientes son covariables: no son el objeto del estudio pero influyen en el resultado.

Punto de vigilancia

El vocabulario de la covariable presupone una jerarquía entre variables: una variable de interés, variables de ajuste. Esta jerarquía no existe en Machine Learning predictivo, donde todas las variables explicativas tienen el mismo estatus funcional. Retomar este vocabulario en un proyecto de ML importa una estructura conceptual sin objeto.

2.4 Las dos acepciones de la palabra feature

El término se emplea en la literatura con dos alcances diferentes, cuya confusión es una fuente de error real.

AcepciónLo que designaEjemplo
Acepción ampliaToda columna descriptiva del conjunto de datos, independientemente de su usodate_souscription es una «feature del dataset»
Acepción estrictaToda entrada efectivamente sometida al modelo tras la preparaciónanciennete_jours, derivada de date_souscription, es una feature del modelo

La diferencia entre las dos acepciones es exactamente el perímetro del feature engineering (capítulo 024) y de la feature selection (capítulo 025).

Consecuencia de notación: el número de variables explicativas p de un modelo casi nunca es igual al número de columnas del archivo de origen. Formular «mi conjunto de datos tiene 14 features» sin precisar la acepción es una fuente de incomprensión entre profesionales.


3. La variable objetivo

3.1 Definición

DEFINICIÓN — Variable objetivo (target, variable a predecir)

Definición rigurosa

Magnitud cuyo valor es desconocido en el momento en que el sistema debe pronunciarse, y cuya estimación constituye la finalidad del modelo. En aprendizaje supervisado, su valor observado está disponible para las observaciones del conjunto de entrenamiento, lo que autoriza la constitución de una señal de error y por tanto el aprendizaje.

Posición en el formalismo

Elemento y del espacio de salida 𝒴. El par (x, y) constituye un ejemplo etiquetado; el conjunto de entrenamiento es una colección de tales pares supuestamente procedentes de una distribución conjunta P(X, Y) desconocida y fija.

Traducción al lenguaje corriente

Lo que se quiere que la máquina adivine.

El criterio discriminante del aprendizaje supervisado

Es la existencia de una variable objetivo observada lo que define el aprendizaje supervisado y lo separa del aprendizaje no supervisado (capítulo 003). En ausencia de objetivo, no existe ninguna señal de error, por tanto nada que minimizar, por tanto ningún aprendizaje supervisado posible.

Punto de vigilancia

La variable objetivo no viene dada por la naturaleza. Es construida por una decisión de diseño que fija lo que cuenta como el fenómeno a predecir y a qué horizonte. Este punto se desarrolla en el apartado 3.4.

3.2 La taxonomía de los sinónimos

TérminoDisciplina de origenAlcance particularRegistro de uso
Target, objetivoMachine Learning anglófonoNeutro, todo tipo de objetivoDominante
Variable objetivoTraducción al españolIdénticaEstándar hispanohablante
Variable dependienteEstadística experimental, psicología experimentalSugiere una dependencia causal respecto a las variables manipuladasFrecuente, problemático en ML (apartado 4)
Variable respuesta, response variableEstadística, metodología del diseño de experimentosLo que responde a una variación controlada de las entradasEstándar académico
Variable explicada, variable a explicarEstadística y econometríaSimétrica de «variable explicativa»Corriente en español
Variable endógena, regresandoEconometría estructuralDeterminada en el interior del sistema modeladoEspecializado
Salida, outputAutomática, teoría de sistemasNeutro: lo que sale de la cajaMuy corriente
Label, etiquetaAprendizaje supervisado, anotación de datosRestringido a los objetivos categóricosDominante en clasificación
ClaseReconocimiento de patrones, clasificaciónUna modalidad particular del labelDominante en clasificación
Verdad de campo, ground truthTeledetección, luego visión por computadorEl valor de referencia tenido por verdadero, por oposición a la predicciónEstándar en anotación
Patrón de referencia, gold standardBioestadística, diagnóstico médicoEl procedimiento de referencia que sirve para establecer el valor verdaderoEstándar en medicina
Variable criterioPsicometría, selección de personalEl resultado que el dispositivo busca predecirEspecializado
DEFINICIÓN — Label (etiqueta)

Definición rigurosa

Valor categórico atribuido a una observación, que designa su pertenencia a una de las modalidades de un conjunto finito de clases predefinidas.

El punto discriminante

Label no es un sinónimo exacto de target. Todo label es un objetivo, todo objetivo no es un label.

Tipo de problemaObjetivo¿Se puede decir «label»?
Clasificación binaria: fraude / normalCategórico con 2 modalidades
Clasificación multiclase: gato / perro / caballoCategórico con k modalidades
Regresión: precio en eurosNumérico continuoNo, por convención de uso

Traducción al lenguaje corriente

La etiqueta pegada sobre el ejemplo: «esto es un spam», «esto es un fraude».

Punto de vigilancia

La expresión datos etiquetados (labeled data) se emplea en la literatura para designar todo conjunto de datos que comporta un objetivo observado, incluso en regresión. El uso es, por tanto, más amplio que la definición estricta del label. El capítulo 007 precisa la articulación entre label, clase y codificación numérica.

DEFINICIÓN — Verdad de campo (ground truth)

Definición rigurosa

Valor de la variable objetivo tenido por exacto, establecido por un procedimiento de referencia independiente del modelo, y que sirve de referencial para el aprendizaje y la evaluación.

Origen del término

La expresión proviene de la teledetección: la validación de las interpretaciones de imágenes satelitales exigía mediciones efectuadas en el terreno, sobre el suelo.

Punto de vigilancia mayor

La verdad de campo no es la verdad. Es una medida, producida por un protocolo falible: anotación humana sujeta a desacuerdo, diagnóstico médico imperfecto, transacción fraudulenta no detectada y por tanto etiquetada «normal». El rendimiento medido de un modelo está limitado por la calidad del etiquetado. Un modelo no puede aprender correctamente una distinción que sus etiquetas no codifican correctamente.

Consecuencia operativa

Antes de imputar un bajo rendimiento al algoritmo, verificar el protocolo de etiquetado: quién etiquetó, según qué definición, con qué tasa de acuerdo entre anotadores.

3.3 Unicidad y pluralidad del objetivo

ConfiguraciónEstructura del objetivoDenominaciónReferencia
Una sola columna objetivo, valor único por observacióny ∈ ℝ o y ∈ {c₁, …, ckc_k}Caso estándarCapítulo 010
Una observación puede pertenecer a varias clases simultáneamentey ∈ {0,1}k\{0,1\}^kClasificación multietiquetaCapítulo 011
Varios objetivos numéricos predichos conjuntamentey ∈ Rm\mathbb{R}^mRegresión multisalidaCapítulo 048
Objetivo categórico con modalidades ordenadasy ∈ {c₁ < … < ckc_k}Clasificación ordinalCapítulo 011

Punto de vigilancia: la presencia de varias columnas candidatas al rol de objetivo en un archivo no autoriza a tratarlas como un objetivo único. Dos objetivos distintos definen dos problemas distintos, exigiendo cada uno su modelo, sus métricas y su validación.

3.4 El objetivo es una construcción, no un dato natural

Ningún sistema operativo produce espontáneamente una columna llamada «a_resilie». Esta columna resulta de una cadena de decisiones explícitas.

DecisiónEfecto sobre el proyecto
Definición del eventoDetermina la tasa de positivos, y por tanto el grado de desequilibrio (capítulo 050)
Horizonte temporalDetermina la dificultad del problema y la utilidad operativa de la predicción
Población afectadaDetermina el perímetro de validez del modelo y los sesgos de selección
Fecha de observaciónDetermina qué variables explicativas están legítimamente disponibles (apartado 6.1)

Principio director: una variable objetivo mal definida no puede compensarse con ningún refinamiento algorítmico. La formalización del objetivo es la primera etapa del ciclo de vida de un proyecto (capítulo 012), y pertenece a una discusión con el negocio, no a una decisión técnica.


4. Variable dependiente y variable independiente

4.1 Origen de la terminología

DEFINICIÓN — Variable independiente y variable dependiente

Definición rigurosa en el marco experimental de origen

En un diseño de experimentos, la variable independiente es la magnitud cuyos valores fija deliberadamente el experimentador, independientemente de cualquier otro factor del dispositivo; la variable dependiente es la magnitud medida de la que se busca establecer si varía en función de la primera.

Contexto histórico

Esta terminología proviene de la metodología experimental formalizada por Ronald Fisher (The Design of Experiments, 1935) y difundida por la psicología experimental. Supone un dispositivo en el que el experimentador manipula una variable, controla las demás y aleatoriza la asignación de las unidades, lo que autoriza una inferencia causal.

Traducción al lenguaje corriente

Lo que uno regula por sí mismo, y lo que se observa en consecuencia.

Punto de vigilancia

Estas condiciones prácticamente nunca se reúnen en Machine Learning aplicado, que opera sobre datos observacionales recogidos sin diseño experimental. El vocabulario subsiste, su justificación ha desaparecido.

4.2 Por qué esta terminología es engañosa en Machine Learning

DificultadLo que el término sugiereLo que ocurre en Machine Learning
Independencia estadísticaLas variables explicativas serían independientes entre síCasi siempre están correlacionadas entre sí. La correlación fuerte entre variables explicativas tiene un nombre, la multicolinealidad, y constituye un problema tratado en el capítulo 017
Manipulación experimentalEl analista fijaría los valores de las variables de entradaSon observadas, no manipuladas. Nadie «fija» la edad de un cliente o la superficie de una vivienda
Dependencia causalEl objetivo variaría a causa de las variables de entradaEl modelo capta una asociación. La inferencia causal exige un marco específico, no un modelo predictivo (capítulo 016)
Propiedad intrínsecaUna variable sería independiente o dependiente por naturalezaEl estatus es un rol asignado por el proyecto, reversible de un proyecto a otro
Simetría lógicaUna sola lectura sería posibleEl sentido de la flecha es una elección de diseño, restringida por la disponibilidad temporal, no por la lógica

El contrasentido más frecuente: concluir que las variables explicativas deben ser independientes entre sí porque se llaman «independientes». La exigencia de ausencia de fuerte colinealidad existe para ciertos modelos paramétricos, pero no tiene ninguna relación con el origen del término, que remite a la independencia respecto al dispositivo experimental, no entre variables.

4.3 El rol es funcional, no intrínseco

Una misma magnitud cambia de rol según la pregunta planteada. La columna no cambia; el proyecto cambia.

MagnitudProyecto donde es objetivoProyecto donde es explicativa
Importe de una transacciónPrevisión del ticket medioDetección de fraude bancario
Nota de satisfacción del clientePredicción de la satisfacción tras la llamadaPredicción del abandono
Duración de hospitalizaciónPlanificación de la capacidad hospitalariaPredicción del riesgo de reingreso
Temperatura de un rodamientoPrevisión térmica de un equipoDetección de una avería inminente
SalarioEstimación salarial en la contrataciónPuntuación de concesión de crédito

4.4 Recomendación terminológica

SituaciónFormulación recomendadaFormulación a evitar
Informe técnico en españolVariables explicativas / variable objetivoVariables independientes / dependiente
Código y documentación técnicafeatures / target, X / y
Presentación a un público de negocioInformaciones proporcionadas / valor a predecirTodo término estadístico sin traducir
Artículo científico en estadísticaPredictores / variable respuesta
Entrevista de trabajoVariables explicativas, señalando el conocimiento de los sinónimosEmpleo de un solo término sin perspectiva

Posición profesional esperada: conocer los sinónimos, saber traducirlos de un registro a otro, y saber explicar por qué variable independiente es una herencia inadaptada al marco observacional del Machine Learning.


5. Vector de características y espacio de características

5.1 De la fila al vector

DEFINICIÓN — Vector de características (feature vector)

Definición rigurosa

Representación de una observación en forma de una p-tupla ordenada de valores, uno por variable explicativa retenida:

x=(x1,x2,,xp)Rp\displaystyle x = (x_{1}, x_{2}, \dots , x_p)^{\top} \in \mathbb{R} ^p

donde p designa el número de variables explicativas y xjx_j el valor tomado por la j-ésima variable para esta observación.

Tres propiedades restrictivas

  1. El orden está fijado y es significativo. La j-ésima componente corresponde siempre a la misma variable, para todas las observaciones. Una permutación entre el entrenamiento y la predicción produce predicciones numéricamente válidas y semánticamente absurdas.
  2. La dimensión es constante. Todas las observaciones se describen por el mismo número de componentes. Una observación a la que le falta una variable no puede tratarse tal cual: exige una imputación o una exclusión (capítulo 019).
  3. Las componentes son numéricas. Las variables categóricas deben haber sido codificadas previamente (capítulo 022).

Traducción al lenguaje corriente

Una fila de la tabla, reducida a las columnas útiles y convertida en una sucesión de números.

DEFINICIÓN — Matriz de diseño (design matrix, X)

Definición rigurosa

Matriz X ∈ Rn×p\mathbb{R}^{\text{n×p}} cuya i-ésima fila es el vector de características xᵢᵀ de la i-ésima observación y cuya j-ésima columna es el vector de los valores tomados por la j-ésima variable explicativa sobre las n observaciones.

El vector objetivo asociado es y ∈ Yn\mathcal{Y}^n, donde 𝒴 = ℝ en regresión y 𝒴 = {c₁, …, ckc_k} en clasificación.

Origen del término

Design matrix proviene de la literatura del diseño de experimentos, donde las filas de la matriz describían la configuración experimental de cada ensayo. El término se conserva en regresión y en aprendizaje estadístico.

Convención de notación

X mayúscula para la matriz, y minúscula para el vector objetivo: la caja señala la diferencia de dimensionalidad, dos dimensiones frente a una. Esta convención es universal en la literatura y en las bibliotecas de software.

ObjetoNotaciónDimensiónContenido
Conjunto de entrenamiento(X, y)n pares (observación, objetivo)
Matriz de las variables explicativasXn × pValores numéricos
Vector objetivoynUn valor por observación
Vector de características de una observaciónxᵢpLa fila i de X
Valor de una variable para una observaciónxijx_{ij}escalarCelda (i, j)
Vector de una variable sobre todo el conjuntoX[:, j]nLa columna j de X
Predicción para una observaciónŷᵢescalar o vectorSalida del modelo

5.2 Separación de X y de y en la práctica

python
import pandas as pd

df = pd.read_csv("clients_telecom.csv")

cible = "a_resilie"
identifiants = ["client_id"]

X = df.drop(columns=[cible] + identifiants)
y = df[cible]

print("X :", X.shape)
print("y :", y.shape)
print()
print(X.dtypes)
X : (10000, 7)
y : (10000,)

age                    int64
anciennete_mois        int64
type_forfait             str
engagement               str
facture_mensuelle    float64
nb_appels_support      int64
satisfaction         float64
dtype: object

Interpretación. El conjunto comprende n = 10 000 observaciones. La matriz X comprende siete columnas, habiéndose retirado el objetivo y el identificador. La forma de y, (10000,), confirma que se trata de un vector de una dimensión y no de una matriz de una columna: esta distinción es fuente de advertencias y de errores en varias bibliotecas.

Punto de vigilancia: df.drop(columns=[cible]) debe escribirse antes de cualquier otra transformación. Toda etapa de preparación calculada sobre un conjunto que contenga todavía el objetivo expone a una fuga (capítulo 028).

5.3 El vector de características de una observación

python
print(X.iloc[0])
age                       49
anciennete_mois           80
type_forfait          Mobile
engagement           12_mois
facture_mensuelle      43.81
nb_appels_support          3
satisfaction             4.0
Name: 0, dtype: object

Esta fila no es todavía un vector de Rp\mathbb{R}^p: dos componentes son textuales. La codificación de las variables categóricas produce la representación numérica efectivamente sometida al modelo.

python
X_encode = pd.get_dummies(X, columns=["type_forfait", "engagement"])
X_num = X_encode.astype(float)

print("Número de columnas antes de la codificación:", X.shape[1])
print("Número de columnas después de la codificación:", X_encode.shape[1])
print(list(X_encode.columns))
print("Tipo:", X_num.to_numpy().dtype, "| forma:", X_num.to_numpy().shape)
print("Vector de características de la primera observación:")
print(X_num.to_numpy()[0])
Número de columnas antes de la codificación: 7
Número de columnas después de la codificación: 11
['age', 'anciennete_mois', 'facture_mensuelle', 'nb_appels_support',
 'satisfaction', 'type_forfait_Fibre', 'type_forfait_Fibre+TV',
 'type_forfait_Mobile', 'engagement_12_mois', 'engagement_24_mois',
 'engagement_Sans_eng']
Tipo: float64 | forma: (10000, 11)
Vector de características de la primera observación:
[49.   80.   43.81  3.    4.    0.    0.    1.    1.    0.    0.  ]

Interpretación. La observación, inicialmente descrita por siete columnas heterogéneas, es ahora un punto de ℝ¹¹. Las cinco primeras componentes son las variables numéricas de origen; las seis siguientes son indicadoras binarias que codifican las modalidades de las dos variables categóricas. Los valores 1 en las posiciones ocho y nueve indican una tarifa Mobile con un compromiso de doce meses.

Dos enseñanzas de alcance general:

  • p ≠ número de columnas del archivo. Aquí, siete columnas producen once dimensiones. Con variables categóricas de alta cardinalidad, la diferencia se vuelve considerable: una variable «municipio» con 400 modalidades añade por sí sola 400 dimensiones en codificación indicadora.
  • Las escalas son heterogéneas. anciennete_mois varía de 1 a 120, facture_mensuelle de 15 a 95, las indicadoras valen 0 o 1. Esta heterogeneidad no tiene efecto sobre un árbol de decisión y es determinante para todo modelo basado en distancias o en un descenso de gradiente (capítulo 023).

5.4 El espacio de características

DEFINICIÓN — Espacio de características (feature space)

Definición rigurosa

Conjunto 𝒳 de todos los valores admisibles del vector de características. En el caso usual de p variables con valores reales, 𝒳 ⊆ Rp\mathbb{R}^p, dotado de una estructura de espacio vectorial normado que permite definir una distancia entre observaciones.

Formulación geométrica

Cada observación es un punto de este espacio; cada variable explicativa es un eje; el conjunto de datos es una nube de n puntos en un espacio de dimensión p. La tarea de aprendizaje consiste en identificar en este espacio una estructura —una frontera que separa regiones en clasificación, una superficie de respuesta en regresión— que reproduce correctamente el vínculo entre posición y valor objetivo.

Traducción al lenguaje corriente

El conjunto de todas las fichas descriptivas posibles, vistas como puntos sobre un mapa de p dimensiones.

Punto de vigilancia

La intuición geométrica adquirida en dimensión 2 o 3 deja de ser fiable más allá. En alta dimensión, el volumen se concentra en las regiones periféricas, las distancias entre pares de puntos se vuelven casi todas equivalentes, y la noción de vecindad pierde su poder discriminante. Este fenómeno, llamado maldición de la dimensionalidad, afecta particularmente a los métodos basados en distancias (capítulo 040).

ANALOGÍA — El mapa y los puntos de medida

Un mapa plano posee dos ejes, longitud y latitud. Cada ciudad ocupa en él un punto único. Dos ciudades vecinas en el mapa lo son en la realidad: la proximidad en el espacio de representación tiene sentido.

El espacio de características es ese mapa, con p ejes en lugar de dos. Dos clientes cuyos vectores de características están próximos son clientes «semejantes» en el sentido de las variables retenidas.

Tres prolongaciones exactas de la analogía:

  • Cambiar las variables equivale a cambiar de mapa. Un mapa de relieves y un mapa de redes ferroviarias sitúan las mismas ciudades con proximidades diferentes. Ese es el reto del feature engineering: construir el mapa sobre el cual el fenómeno se vuelve legible.
  • Cambiar de unidad deforma el mapa. Si un eje está graduado en metros y el otro en kilómetros, la noción de proximidad queda dominada por el primero. Esa es la justificación del escalado (capítulo 023).
  • Un mapa de 300 ejes no es consultable a simple vista. La visualización exige una proyección en dos o tres dimensiones, operación que pierde necesariamente información (capítulo 015).

5.5 El modelo como función sobre el espacio de características

ElementoFormalizaciónLectura
Una observaciónx ∈ 𝒳 ⊆ Rp\mathbb{R}^pUn punto
El objetivo realy ∈ 𝒴El valor verdadero
El modelof : 𝒳 → 𝒴Una función definida sobre todo el espacio
La predicciónŷ = f(x)El valor asignado al punto
El error sobre una observaciónℓ(y, ŷ)La desviación medida por una función de pérdida
El objetivo de aprendizajeminimizar 𝔼[ℓ(Y, f(X))]Reducir el error esperado sobre la distribución, no sobre la muestra

Punto esencial. El modelo está definido sobre todo el espacio, incluso en las regiones donde no se ha registrado ninguna observación. Producirá una predicción para un vector de características situado fuera del dominio cubierto por el entrenamiento, sin señalar que esa región nunca ha sido observada. Esta extrapolación silenciosa es una fuente mayor de fallo en producción y motiva la supervisión de la deriva de los datos (capítulo 082).


6. Criterios de selección de una variable explicativa

Disponer de una columna no autoriza a utilizarla. Cuatro filtros sucesivos se aplican, en este orden, antes de toda consideración de rendimiento.

6.1 Criterio primero: la disponibilidad en el momento de la predicción

DEFINICIÓN — Disponibilidad en el instante de predicción

Definición rigurosa

Una variable está disponible en el instante de predicción tpredt_{\mathrm{pred}} si su valor es observado, accesible y definitivo en los sistemas de información en ese instante, para toda observación sobre la que el modelo deba pronunciarse.

Formulación operativa

Sea tpredt_{\mathrm{pred}} el instante en que la predicción debe producirse y tobst_{\mathrm{obs}} el instante en que el valor de la variable se vuelve efectivamente conocido. La variable es admisible si y solo si:

tobst_{\mathrm{obs}}tpredt_{\mathrm{pred}}, para todas las observaciones, sin excepción

Traducción al lenguaje corriente

¿Tendré realmente esta información en el momento de tener que responder, o solo en mi histórico porque miro el pasado?

Punto de vigilancia

El conjunto de datos histórico se constituye a posteriori: contiene naturalmente informaciones acumuladas después del instante de decisión. Nada en el archivo distingue una variable disponible de una variable posterior. Solo un conocimiento del proceso de negocio permite decidir. Esta verificación no puede automatizarse.

Caso de usoVariable candidatatobst_{\mathrm{obs}} respecto a tpredt_{\mathrm{pred}}Veredicto
Abandono de cliente a 90 díasAntigüedad en mesesAnteriorAdmisible
Abandono de cliente a 90 díasFecha de cancelaciónPosterior, y definido por el eventoExclusión, fuga manifiesta
Abandono de cliente a 90 díasMotivo de baja introducido por el asesorPosteriorExclusión
Abandono de cliente a 90 díasNúmero de llamadas al soporte en los últimos 6 mesesAnterior si la ventana está limitada a tpredt_{\mathrm{pred}}Admisible bajo condición de ventana estricta
Concesión de créditoIngreso declarado en la solicitudAnteriorAdmisible
Concesión de créditoNúmero de incidentes de pago sobre el préstamo concedidoPosteriorExclusión
Estimación del precio de venta de una viviendaSuperficie, año de construcciónAnteriorAdmisible
Estimación del precio de venta de una viviendaDuración de la puesta en ventaPosterior a la puesta en venta, conocido solo despuésExclusión
Mantenimiento predictivo a 7 díasVibración media de las últimas 24 horasAnteriorAdmisible
Mantenimiento predictivo a 7 díasCódigo de anomalía del diagnóstico de averíaPosteriorExclusión
Diagnóstico médico en el ingresoConstantes vitales a la llegadaAnteriorAdmisible
Diagnóstico médico en el ingresoTratamiento administradoPosterior, y consecuencia del diagnósticoExclusión

Tres formas de indisponibilidad, de las cuales dos se omiten frecuentemente:

FormaDescripciónIlustración
Indisponibilidad temporalEl valor aún no existe en tpredt_{\mathrm{pred}}El importe total facturado en el año en curso
Indisponibilidad de latenciaEl valor existe pero solo se consolida en los sistemas con un retraso superior a la ventana de decisiónUna puntuación externa actualizada mensualmente, explotada en un scoring en tiempo real
Indisponibilidad de perímetroEl valor existe para la población histórica pero no para la población objetivoUna variable informada únicamente para los clientes de una filial absorbida

Punto de vigilancia sobre la latencia. Un modelo validado sobre un histórico completo puede derrumbarse en producción porque una variable llega con cuarenta y ocho horas de retraso y se presenta por tanto sistemáticamente como faltante en el instante de la predicción. La verificación se refiere no solo a la existencia de la variable, sino a su disponibilidad efectiva en el sistema que la invoca, con la frescura requerida.

El mecanismo completo por el cual una variable no disponible degrada un proyecto, sus formas sutiles y los protocolos de detección se tratan en el capítulo 028.

6.2 Segundo criterio: la ausencia de fuga

DEFINICIÓN — Fuga de datos (data leakage)

Definición rigurosa

Presencia, entre las informaciones utilizadas para construir el modelo, de una información que no estará legítimamente disponible en el instante de la predicción, o que está determinada por el valor del objetivo, provocando una sobreestimación del rendimiento medido y un fallo en producción.

Traducción al lenguaje corriente

El modelo ha visto la respuesta, directa o indirectamente, durante su aprendizaje.

Las dos grandes familias

FamiliaMecanismoDetección
Fuga por la variableUna columna codifica todo o parte del objetivoRendimiento anormalmente alto, importancia concentrada en una variable
Fuga por el protocoloUna estadística calculada sobre el conjunto de los datos antes de la separación contamina el conjunto de testDiferencia pequeña entre validación y test, derrumbe en producción

Señal de alerta más fiable

Un rendimiento netamente superior a las expectativas del negocio. Un modelo que alcanza 0,99 de AUC en un problema reputado difícil debe ser sospechoso de fuga antes de ser celebrado.

Punto de vigilancia

La fuga no provoca ningún error de ejecución. Produce excelentes resultados. Es precisamente lo que la hace peligrosa: nada invita a buscarla.

Tipo de variable sospechosaPregunta de controlEjemplo
Variable de consecuencia¿El valor se produce porque el evento ha tenido lugar?date_resiliation, motif_annulation, montant_rembourse
Variable de tratamiento¿El valor refleja una acción desencadenada por el conocimiento del resultado?offre_de_retention_proposee, dossier_transmis_au_contentieux
Variable agregada sin ventana¿El agregado cubre un periodo posterior a tpredt_{\mathrm{pred}}?nb_transactions_total, moyenne_annuelle
Variable proxy casi perfecta¿La correlación con el objetivo es sospechosa de trivialidad?statut_compte = "clos" para predecir el abandono
Identificador portador de orden¿El identificador codifica implícitamente la cronología o el grupo?Números secuenciales atribuidos por lote, un lote por clase

6.3 Tercer criterio: la plausibilidad de negocio

Una variable estadísticamente asociada al objetivo sin mecanismo plausible debe examinarse antes de ser retenida. Tres resultados son posibles.

DiagnósticoNaturaleza del vínculoConducta a seguir
Mecanismo de negocio identificadoAsociación fundadaConservar
Variable indirecta de una causa no observadaAsociación real pero frágilConservar con reserva, documentar, supervisar la estabilidad
Correlación fortuita propia de la muestraAsociación sin fundamentoExcluir; no se reproducirá
Artefacto de recogidaLa asociación proviene del proceso de constitución de los datosExcluir y corregir la recogida

Punto de vigilancia: la plausibilidad de negocio es un filtro, no una prueba. Una variable plausible puede ser inútil, y una variable cuyo mecanismo no se comprende puede ser auténticamente predictiva. El criterio sirve para identificar las variables a examinar, no para decidir por sí solo.

Punto de vigilancia sobre la estabilidad. Una variable cuya distribución o cuya definición evoluciona en el tiempo —rediseño de una nomenclatura, cambio de sistema de recogida, modificación de una regla de gestión— degrada el modelo sin que ninguna alerta técnica se dispare. La supervisión de estas evoluciones se trata en el capítulo 082.

6.4 Cuarto criterio: licitud y ética

CategoríaEstatusDificultad propia
Variables directamente sensibles: origen, religión, opiniones políticas, salud, orientación sexualUso estrictamente regulado o prohibido según las jurisdicciones y las finalidadesIdentificación fácil
Variables indirectas fuertemente correlacionadas con una variable sensibleProhibición a menudo eludida sin intenciónEl código postal puede sustituir al origen; el nombre de pila al género
Variables procedentes de una recogida sin base legalInexplotablesTrazabilidad de la procedencia exigida
Variables producidas por otro modeloExplotables con precauciónDependencia en cascada, opacidad acrecentada, propagación de los sesgos

Punto de vigilancia: retirar las variables sensibles no basta para producir un modelo equitativo. Las variables indirectas reconstituyen la información suprimida. La auditoría de equidad se realiza sobre las predicciones del modelo, no sobre la sola lista de sus entradas (capítulo 080).

6.5 Cuadrícula de control en ocho preguntas

#PreguntaSi la respuesta es desfavorable
1¿La variable estará informada en el instante de la predicción, para toda la población objetivo?Exclusión
2¿Su valor es definitivo en ese instante, o se revisa posteriormente?Exclusión o ventana explícita
3¿Su valor es una consecuencia del evento a predecir?Exclusión por fuga
4¿Un agregado que contiene desborda sobre el periodo posterior?Recálculo con ventana limitada
5¿Un mecanismo de negocio plausible relaciona esta variable con el objetivo?Examen en profundidad
6¿Su definición y su distribución son estables en el tiempo?Supervisión reforzada
7¿Su uso es lícito respecto a la finalidad y la reglamentación?Exclusión
8¿Su coste de adquisición en producción es compatible con el uso previsto?Arbitraje

Estas ocho preguntas preceden a toda medida estadística. Los métodos de selección basados en la importancia, la correlación o el rendimiento intervienen después de este filtrado, y se tratan en el capítulo 025.

6.6 La primacía de las variables explicativas sobre la elección del algoritmo

La constatación, ampliamente documentada por la práctica industrial y por las competiciones de modelado, es la siguiente: para un conjunto de datos dado, la ganancia obtenida enriqueciendo la información proporcionada supera generalmente la ganancia obtenida sustituyendo un algoritmo por otro.

La ilustración siguiente es reproducible. Los datos están simulados, siendo el mecanismo generador conocido: el precio es el producto de la superficie por el precio por metro cuadrado local, corregido por la vetustez. El conjunto contiene también seis variables de ruido sin relación con el objetivo.

python
import numpy as np
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.ensemble import HistGradientBoostingRegressor
from sklearn.metrics import r2_score

rng = np.random.default_rng(7)
n = 600

surface = rng.uniform(20, 160, n)
prix_m2_commune = rng.uniform(2000, 7000, n)
annee_construction = rng.integers(1900, 2021, n)
age_bien = 2024 - annee_construction

# Mecanismo generador: el precio es un PRODUCTO, corregido por la vetustez
prix = surface * prix_m2_commune * (1 - 0.0025 * age_bien) + rng.normal(0, 40000, n)

X_brut = pd.DataFrame({
    "surface_m2": surface,
    "prix_m2_commune": prix_m2_commune,
    "annee_construction": annee_construction,
})
for j in range(6):
    X_brut[f"var_bruit_{j+1}"] = rng.normal(0, 1, n)

X_enrichi = X_brut.copy()
X_enrichi["valeur_theorique"] = surface * prix_m2_commune
X_enrichi["age_bien"] = age_bien

configurations = [("Variables brutas", X_brut), ("Variables enriquecidas", X_enrichi)]
modeles = [("Regresion lineal", LinearRegression()),
           ("Gradient boosting", HistGradientBoostingRegressor(random_state=0))]

for nom_config, X in configurations:
    X_tr, X_te, y_tr, y_te = train_test_split(X, prix, test_size=0.3, random_state=0)
    for nom_modele, modele in modeles:
        modele.fit(X_tr, y_tr)
        r2 = r2_score(y_te, modele.predict(X_te))
        print(f"{nom_config:22s} | {nom_modele:20s} | p = {X.shape[1]:2d} | R2 = {r2:.3f}")
Variables brutas       | Regresion lineal     | p =  9 | R2 = 0.898
Variables brutas       | Gradient boosting    | p =  9 | R2 = 0.927
Variables enriquecidas | Regresion lineal     | p = 11 | R2 = 0.946
Variables enriquecidas | Gradient boosting    | p = 11 | R2 = 0.929
ComparaciónDiferencia de R²Lectura
Cambio de algoritmo, con variables brutas constantes+0,029Ganancia obtenida reemplazando la regresión lineal por el gradient boosting
Enriquecimiento de las variables, con algoritmo lineal constante+0,048Ganancia obtenida añadiendo dos variables construidas
Modelo lineal enriquecido frente a gradient boosting bruto+0,019 a favor del linealEl modelo más simple, correctamente informado, supera al modelo más potente mal informado

Interpretación. El mecanismo generador es multiplicativo. Un modelo lineal no puede representar un producto de dos variables: es estructuralmente incapaz de ello mientras ese producto no se le proporcione. En cuanto la variable valeur_theorique se construye, el problema vuelve a ser lineal y el modelo más simple alcanza el mejor rendimiento del conjunto. El gradient boosting, que aproxima el producto mediante una suma de árboles, lo consigue parcialmente, a un coste computacional superior y al precio de una interpretabilidad menor.

Alcance de la demostración y límites. Este resultado está construido sobre datos simulados cuyo mecanismo es conocido; ilustra un principio y no constituye una medida generalizable. Sobre datos reales, la diferencia depende del problema: existen casos en que el cambio de algoritmo domina. El principio director sigue no obstante sólidamente establecido.

Un algoritmo, sea cual sea, solo puede explotar la información contenida en las variables que se le proporcionan. Ninguna sofisticación algorítmica compensa una información ausente.

Palanca de mejoraEfecto típicoCostePrioridad
Corregir la definición del objetivoDeterminanteBajo, pero exige un acuerdo de negocio1
Eliminar las fugas y las variables no disponiblesDeterminante para la validezBajo2
Adquirir una fuente de datos nueva y pertinenteA menudo altoAlto3
Construir variables derivadas adaptadas al mecanismoA menudo altoModerado4
Aumentar el volumen de observacionesVariable, decrecienteModerado a alto5
Cambiar de algoritmoModeradoBajo6
Optimizar los hiperparámetrosBajo a moderadoModerado7

7. Tres casos prácticos anotados

7.1 Abandono en las telecomunicaciones

client_idageanciennete_moistype_forfaitfacture_mensuellenb_appels_supportsatisfactiondate_resiliationmotif_departa_resilie
C-00001348Mobile29,90040
C-000026745Fibre64,90320
C-00003292Mobile19,9012025-01-14Prix1
C-000045261Fibre+TV89,90050
C-000054117Fibre49,90712024-11-22Service1
ElementoDeterminación
Variable objetivoa_resilie, binaria, cancelación constatada en los 90 días siguientes a la fecha de observación
Tipo de problemaClasificación binaria
Variables explicativas retenidasage, anciennete_mois, type_forfait, facture_mensuelle, nb_appels_support, satisfaction
Columnas excluidas como identificadoresclient_id
Columnas excluidas por fugadate_resiliation y motif_depart: ambas se informan solo si la cancelación ha tenido lugar. Su sola presencia determina el objetivo
Dimensión tras la codificaciónp = 8: cinco numéricas y tres indicadoras para type_forfait
Punto de vigilancia sobre la ventananb_appels_support debe calcularse sobre una ventana limitada a la fecha de observación. Un conteo sobre toda la vida del cliente incluye las llamadas posteriores, en particular la propia llamada de cancelación

Diagnóstico de fuga por la tasa de valores faltantes. La columna motif_depart está vacía para todas las observaciones no canceladas. Una columna cuya tasa de completitud coincide exactamente con la tasa de positivos del objetivo es una variable de fuga hasta que se demuestre lo contrario. Este control es poco costoso y detecta una amplia parte de las fugas por la variable.

7.2 Estimación de precio inmobiliario

annonce_idcommunesurface_m2nb_piecesannee_constructionclasse_energieascenseurduree_mise_en_vente_jnb_visitesprix_vente
A-10471Lyon 3e6831972D14712331 000
A-10472Villeurbanne4222015B12219218 500
A-10473Lyon 6e10551930E01188712 000
A-10474Bron7741988D06311249 000
A-10475Lyon 3e3112019A11524189 900
ElementoDeterminación
Variable objetivoprix_vente, numérica continua estrictamente positiva
Tipo de problemaRegresión
Variables explicativas retenidascommune, surface_m2, nb_pieces, annee_construction, classe_energie, ascenseur
Columnas excluidas como identificadoresannonce_id
Columnas excluidas por indisponibilidadduree_mise_en_vente_j y nb_visites: estos valores solo se conocen después de la venta. El uso previsto es la estimación en la puesta en venta, instante en el que valen cero o están indefinidos
Variables a construirage_bien = annee_vente − annee_construction; prix_m2_median_commune calculado únicamente sobre el periodo de entrenamiento; surface_par_piece
Dimensión tras la codificaciónDepende de la cardinalidad de commune; una codificación indicadora sobre 60 municipios lleva p más allá de 65

Punto de vigilancia sobre la variable construida prix_m2_median_commune. Esta variable es la palanca de rendimiento más fuerte del problema, y simultáneamente un vector de fuga. Calculada sobre el conjunto de los datos, incorpora los precios de venta del conjunto de test en las entradas del entrenamiento. Debe estimarse exclusivamente sobre el conjunto de entrenamiento, y luego aplicarse a los demás conjuntos, lo que impone integrarla en un pipeline (capítulos 079 y 092) y no calcularla previamente.

Punto de vigilancia sobre la dependencia temporal. El nivel general de los precios deriva. Si el uso objetivo consiste en estimar transacciones futuras, la separación debe ser cronológica (capítulo 027) y la supervisión de la deriva debe ponerse en marcha (capítulo 082).

7.3 Mantenimiento predictivo en equipo industrial

capteur_idmachine_idhorodatagetemperature_cvibration_rmspression_barheures_fonctionnementjours_depuis_maintenancecode_defaut_diagpanne_sous_7j
S-0001M-142025-03-02 06:0062,41,824,1018 420340
S-0002M-142025-03-02 07:0071,93,474,0818 42134E-2071
S-0003M-222025-03-02 06:0058,11,443,956 210120
S-0004M-222025-03-02 07:0058,61,513,966 211120
S-0005M-072025-03-02 06:0079,24,914,4241 003961
ElementoDeterminación
Variable objetivopanne_sous_7j, binaria, ocurrencia de una parada no planificada en los siete días
Tipo de problemaClasificación binaria con objetivo fuertemente desequilibrado
Qué representa una observaciónUna lectura horaria para una máquina, no una máquina. La misma máquina ocupa miles de filas
Variables explicativas retenidastemperature_c, vibration_rms, pression_bar, heures_fonctionnement, jours_depuis_maintenance, más agregados temporales a construir
Columnas excluidas como identificadorescapteur_id; machine_id se conserva como clave de agrupamiento, no como variable explicativa
Columnas excluidas por fugacode_defaut_diag: este código lo emite el diagnóstico efectuado en el momento de la avería. Su presencia determina mecánicamente el objetivo
Variables a construirMedias, desviaciones típicas y pendientes de vibration_rms sobre ventanas deslizantes de 6, 24 y 72 horas; desviación respecto al valor de referencia por máquina

Punto de vigilancia sobre la estructura de grupo. Una separación aleatoria situaría lecturas de la misma máquina y del mismo día a la vez en entrenamiento y en test. El modelo memorizaría la firma de la máquina en lugar del mecanismo de degradación, y el rendimiento medido quedaría fuertemente sobreestimado. La separación debe realizarse por grupo de máquinas y respetar la cronología (capítulo 027).

Punto de vigilancia sobre la ventana de los agregados. Toda ventana deslizante debe ser estrictamente anterior a la marca de tiempo de la observación. Una media centrada en el instante actual integra medidas futuras y produce una fuga que solo se manifestará en producción.

DominioFuga más frecuenteVariable de disponibilidad más crítica
Abandono en telecomunicacionesColumnas informadas únicamente para los que se vanAgregados de contactos con el soporte, con ventana limitada
InmobiliarioEstadísticas de precios calculadas sobre todo el conjuntoVariables que describen el desarrollo de la venta
Mantenimiento industrialCódigos de diagnóstico posteriores a la averíaAgregados sobre ventanas deslizantes estrictamente anteriores

8. Errores de razonamiento frecuentes

ERROR — Tratar toda columna disponible como variable explicativa

La disponibilidad de una columna en un archivo histórico no establece ni su disponibilidad en el momento de la predicción, ni su legitimidad. Identificadores, variables de consecuencia y variables consolidadas tardíamente deben descartarse antes de todo modelado.

Formulación correcta: «Una columna se convierte en variable explicativa tras haber satisfecho cuatro criterios: disponibilidad en el instante de predicción, ausencia de fuga, plausibilidad de negocio y licitud.»

ERROR — Interpretar «variable independiente» como una exigencia de independencia mutua

El calificativo proviene del marco experimental donde la variable es fijada por el experimentador independientemente del dispositivo. No prescribe ninguna independencia estadística entre las variables de entrada, las cuales están generalmente correlacionadas.

Formulación correcta: «El término independiente es una herencia del diseño de experimentos; la correlación entre variables explicativas es un fenómeno distinto, la multicolinealidad, tratada en el capítulo 017.»

ERROR — Confundir label y target

Label designa un valor categórico asignado a una observación. Un objetivo numérico continuo es un target sin ser un label. Hablar del «label» de un problema de regresión es un abuso de lenguaje que señala un dominio incompleto del vocabulario.

Formulación correcta: «El objetivo es un label en clasificación y un valor numérico en regresión; target cubre los dos casos, label solo el primero.»

ERROR — Suponer que el rol de una variable es intrínseco

Ninguna magnitud es explicativa u objetivo por naturaleza. El importe de una transacción es objetivo en un proyecto de previsión del ticket medio y explicativa en un proyecto de detección de fraude.

Formulación correcta: «El rol de una variable lo asigna la pregunta planteada, no la variable misma.»

ERROR — Considerar que la adición de variables mejora mecánicamente el modelo

La adición de variables no informativas aumenta la dimensión del espacio de características, acrecienta la varianza de la estimación, favorece el sobreajuste y sobrecarga la cadena de producción. La relación entre número de variables y rendimiento en generalización no es monótona.

Formulación correcta: «La información pertinente mejora el modelo; el número de columnas, en sí mismo, no lo mejora.»

ERROR — Deducir el espacio de características del número de columnas del archivo

La codificación de las variables categóricas, la construcción de variables derivadas y la selección modifican la dimensión p. Siete columnas fuente pueden producir once dimensiones, o varios cientos con variables de alta cardinalidad.

Formulación correcta: «p designa el número de componentes del vector efectivamente sometido al modelo, tras la preparación.»

ERROR — Buscar una ganancia de rendimiento en la elección del algoritmo antes de haber examinado las variables

El orden de las palancas está establecido: definición del objetivo, eliminación de las fugas, enriquecimiento de la información, y solo después elección del algoritmo y optimización de los hiperparámetros. Invertir este orden lleva a consumir un presupuesto importante para una ganancia marginal.

Formulación correcta: «Antes de cambiar de modelo, verificar que la información necesaria para la predicción figura efectivamente en las entradas.»

ERROR — Considerar la verdad de campo como exacta por definición

El etiquetado lo produce un protocolo falible. Los desacuerdos entre anotadores, los diagnósticos erróneos y los fraudes no detectados introducen un ruido en el objetivo que limita el rendimiento alcanzable.

Formulación correcta: «La verdad de campo es una medida de referencia, no la verdad; la calidad del etiquetado condiciona el techo de rendimiento del modelo.»


9. Síntesis

LA FÓRMULA MENTAL
    FEATURES  →  MODELO  →  TARGET
    lo que es conocido   la función      lo que se busca
    en el instante t_pred  aprendida     y es desconocido en t_pred

VARIABLE EXPLICATIVA — SINÓNIMOS Y ORÍGENES
    feature, característica       reconocimiento de patrones
    variable explicativa          estadística aplicada
    variable independiente        diseño de experimentos (Fisher, 1935)
    variable de entrada, input    automática, teoría de sistemas
    predictor                     estadística de la regresión
    regresor                      econometría
    covariable                    bioestadística, ensayos clínicos
    atributo                      minería de datos, bases relacionales
    descriptor                    quimiometría

VARIABLE OBJETIVO — SINÓNIMOS Y ORÍGENES
    target, objetivo              Machine Learning
    variable dependiente          estadística experimental
    variable respuesta            diseño de experimentos
    variable explicada            estadística en español
    variable endógena             econometría
    output, salida                automática
    label, etiqueta               clasificación únicamente
    verdad de campo               teledetección, luego visión
    gold standard                 bioestadística

TERMINOLOGÍA DEPENDIENTE / INDEPENDIENTE
    Herencia del diseño de experimentos, inadaptada al ML observacional.
    «Independiente» no significa independiente de las demás variables.
    «Dependiente» no significa causalmente determinada.
    El rol es funcional y reversible de un proyecto a otro.

FORMALIZACIÓN
    x = (x1, …, xp)ᵀ ∈ ℝ^p        vector de características
    X ∈ ℝ^(n×p)                   matriz de diseño
    y ∈ 𝒴^n                       vector objetivo
    f : 𝒳 → 𝒴                     el modelo
    ŷ = f(x)                      la predicción
    p ≠ número de columnas del archivo fuente

LOS CUATRO FILTROS, EN ESTE ORDEN
    1. Disponibilidad en el instante de la predicción → si no, exclusión
    2. Ausencia de fuga                               → si no, exclusión
    3. Plausibilidad de negocio                       → si no, examen
    4. Licitud y ética                                → si no, exclusión
    La selección estadística solo interviene después.

EL CRITERIO PRIMERO
    t_obs ≤ t_pred, para todas las observaciones, sin excepción.
    Tres formas de indisponibilidad: temporal, de latencia, de perímetro.

LA JERARQUÍA DE LAS PALANCAS
    objetivo bien definido > ausencia de fuga > información nueva
    > variables construidas > volumen > algoritmo > hiperparámetros

Enunciado de síntesis

Las variables explicativas constituyen la totalidad de la información de la que dispone el modelo y la variable objetivo la magnitud que debe estimar; su designación varía según la disciplina de origen sin que la noción cambie, siendo la terminología estadística de dependencia e independencia una herencia experimental inadaptada al marco observacional del Machine Learning. Una observación se representa como un vector de Rp\mathbb{R}^p y el modelo como una función definida sobre ese espacio. Una columna solo se convierte en variable explicativa tras haber satisfecho cuatro criterios, el primero de los cuales es su disponibilidad efectiva en el instante en que la predicción deba producirse; y la calidad de esa información determina el rendimiento alcanzable más que la elección del algoritmo.


Quiz asociados

  • 006.1-quiz-relation-features-target.md
  • 006.2-quiz-variable-explicative.md
  • 006.3-quiz-variable-cible.md
  • 006.4-quiz-dependante-independante.md
  • 006.5-quiz-vecteur-espace-caracteristiques.md
  • 006.6-quiz-criteres-de-selection.md
  • 006.7-quiz-etudes-de-cas.md

Capítulo siguiente: 007-x-et-y-label-classe.md