Todo problema de aprendizaje supervisado, sea cual sea el dominio de aplicación, el algoritmo elegido o el volumen de datos, se reduce a una estructura única:
Esta fórmula debe retenerse literalmente. Conlleva tres compromisos metodológicos:
La misma estructura se lee de forma diferente según la fase. Es la fuente de confusión más frecuente entre los principiantes.
| Fase | Variables explicativas | Variable objetivo | Lo que se produce |
|---|---|---|---|
| Aprendizaje | Conocidas, proporcionadas | Conocida, proporcionada | El modelo |
| Validación | Conocidas, proporcionadas | Conocida pero oculta al modelo, utilizada para comparar | Una medida de rendimiento |
| Predicción en producción | Conocidas, proporcionadas | Desconocida | Una estimación ŷ |
| Supervisión a posteriori | Conocidas | Observada después, con retraso | Una medida de deriva |
Punto de vigilancia: en fase de aprendizaje, el objetivo está presente en el conjunto de datos al igual que las demás columnas. No deja de ser por ello de una naturaleza funcional radicalmente diferente. Confundirlo con una columna ordinaria, u omitir retirarlo de las entradas, produce un modelo que predice perfectamente en aprendizaje y que es inutilizable en producción.
Un investigador nunca dispone de la respuesta. Dispone de indicios: una huella, un horario, un testimonio, un rastro bancario. Cada indicio es una información parcial, incompleta, a veces engañosa. El investigador solo puede razonar sobre lo que ha recogido.
Las variables explicativas son exactamente esos indicios: son las únicas informaciones que el modelo posee para pronunciarse. La variable objetivo es la identidad del culpable, es decir, lo que la investigación debe establecer.
Tres consecuencias de esta analogía, todas exactas técnicamente:
Definición rigurosa
Magnitud medida o construida, asociada a cada observación de un conjunto de datos, cuyos valores se someten al modelo como entrada y a partir de los cuales este produce una estimación de la variable objetivo.
Formulación equivalente en teoría del aprendizaje
Componente del vector de entrada x perteneciente al espacio de características 𝒳, sobre el cual está definida la función de predicción f : 𝒳 → 𝒴 que el algoritmo de aprendizaje selecciona en una clase de hipótesis.
Traducción al lenguaje corriente
Una información que se da a la máquina para ayudarla a responder.
Naturaleza del concepto
La variable explicativa designa un rol funcional, no un tipo de dato. Una columna no es una variable explicativa por naturaleza: lo llega a ser por una decisión de diseño, revocable. La misma columna puede ser explicativa en un proyecto, objetivo en otro, excluida en un tercero. Este punto se desarrolla en el apartado 4.4.
Punto de vigilancia
El término explicativa es engañoso tomado al pie de la letra. Una variable explicativa no explica nada en sentido causal: aporta una información estadísticamente asociada al objetivo. Una variable fuertemente predictiva puede no mantener ningún vínculo causal con el objetivo y no ser más que un indicador indirecto de una causa común no observada.
| Enunciado corriente | Estatus | Justificación |
|---|---|---|
| «Toda columna del archivo es una feature» | Incorrecto | Los identificadores, el objetivo y las variables de fuga quedan excluidos (capítulo 005, apartado 3.2) |
| «Una feature explica el objetivo» | Incorrecto en sentido estricto | Está asociada al objetivo; la explicación causal pertenece a otro marco metodológico (capítulo 016) |
| «Una feature debe ser numérica» | Incorrecto | Puede ser categórica, temporal o textual; la codificación numérica es una etapa posterior (capítulos 022 y 023) |
| «Cuantas más features hay, mejor es el modelo» | Incorrecto | Más allá de un umbral, la adición de variables degrada el rendimiento en generalización (capítulos 025 y 031) |
| «Una feature es proporcionada por los datos» | Parcialmente inexacto | Una parte importante de las variables más predictivas se construye, no se registra (capítulo 024) |
El dominio agrega vocabulario procedente de disciplinas distintas, cada una habiendo forjado su propio término para el mismo objeto. Las denominaciones siguientes son estrictamente equivalentes en la práctica; difieren por su origen, su registro y las connotaciones que transmiten.
| Término | Disciplina de origen | Connotación propia | Registro de uso actual |
|---|---|---|---|
| Feature | Reconocimiento de patrones y visión por computador | Magnitud extraída de la señal bruta, eventualmente construida | Dominante en Machine Learning, incluso en español profesional |
| Característica | Traducción de feature | Idéntica a feature | Recomendado por escrito en español; uso oral minoritario |
| Variable explicativa | Estadística aplicada, modelado | Sugiere una contribución a la explicación del fenómeno | Estándar académico hispanohablante |
| Variable independiente | Estadística experimental, diseño de experimentos, psicología experimental (herencia de Fisher, 1935) | Sugiere una variable manipulada por el experimentador | Frecuente pero problemático en ML (apartado 4) |
| Variable de entrada, input | Automática, teoría de sistemas, ingeniería | Neutro: lo que entra en la caja | Muy corriente, sin ambigüedad |
| Predictor, predictor | Estadística aplicada, literatura de la regresión | Subraya la finalidad predictiva más que explicativa | Corriente, particularmente adaptado al marco del ML |
| Regresor | Econometría | Término del modelo de regresión, asociado a un coeficiente | Reservado a los modelos paramétricos lineales |
| Covariable, covariate | Bioestadística, epidemiología, ensayos clínicos | Variable cuyo efecto se ajusta para aislar el de un tratamiento | Estándar en investigación clínica |
| Atributo | Aprendizaje simbólico, minería de datos, bases de datos relacionales (Quinlan, 1986) | Propiedad descriptiva de una entidad | Anticuado en ML, vivo en bases de datos |
| Descriptor | Quimiometría, quimioinformática | Magnitud calculada que describe una estructura | Especializado |
| Variable exógena | Econometría estructural | Determinada fuera del sistema modelado | Especializado, con fuerte carga teórica |
| Factor | Diseño de experimentos, análisis de la varianza | Variable categórica controlada | Ambiguo: significa otra cosa en análisis factorial |
Recomendación profesional. Por escrito en español, emplear variable explicativa o característica. Oralmente y en el código, feature es el uso establecido y no debe evitarse. En contexto de comunicación con interlocutores de negocio, variable de entrada o información proporcionada al modelo son las formulaciones más inmediatamente comprendidas. Evitar variable independiente por las razones expuestas en el apartado 4.
Definición rigurosa
Variable cuyos valores se utilizan para estimar los de otra variable, independientemente de toda pretensión explicativa o causal.
Interés del término
Es el término más honesto epistemológicamente para el Machine Learning: nombra exactamente lo que se busca, a saber, un poder predictivo, sin sugerir una comprensión del mecanismo subyacente.
Punto de vigilancia
No confundir predictor en el sentido de variable de entrada, y predictor en el sentido de modelo entero, acepción encontrada en la literatura anglófona donde a predictor designa a veces el sistema de predicción completo. El contexto resuelve la ambigüedad; en español, reservar el término a la variable.
Regresor (econometría)
Variable que figura en el miembro derecho de una ecuación de regresión, asociada a un coeficiente estimado. En el modelo y = β₀ + β₁x₁ + … + + ε, las son los regresores y la variable explicada y es el regresando.
El término es indisociable de un modelo paramétrico explícito. Hablar de «regresores» a propósito de un bosque aleatorio es un abuso de lenguaje: ningún coeficiente está asociado ahí a una variable.
Covariable (bioestadística)
Variable medida cuyo efecto se tiene en cuenta en el modelo a fin de aislar el efecto de una variable de interés, típicamente un tratamiento. En un ensayo clínico que evalúa un medicamento, la edad y el sexo de los pacientes son covariables: no son el objeto del estudio pero influyen en el resultado.
Punto de vigilancia
El vocabulario de la covariable presupone una jerarquía entre variables: una variable de interés, variables de ajuste. Esta jerarquía no existe en Machine Learning predictivo, donde todas las variables explicativas tienen el mismo estatus funcional. Retomar este vocabulario en un proyecto de ML importa una estructura conceptual sin objeto.
El término se emplea en la literatura con dos alcances diferentes, cuya confusión es una fuente de error real.
| Acepción | Lo que designa | Ejemplo |
|---|---|---|
| Acepción amplia | Toda columna descriptiva del conjunto de datos, independientemente de su uso | date_souscription es una «feature del dataset» |
| Acepción estricta | Toda entrada efectivamente sometida al modelo tras la preparación | anciennete_jours, derivada de date_souscription, es una feature del modelo |
La diferencia entre las dos acepciones es exactamente el perímetro del feature engineering (capítulo 024) y de la feature selection (capítulo 025).
Consecuencia de notación: el número de variables explicativas p de un modelo casi nunca es igual al número de columnas del archivo de origen. Formular «mi conjunto de datos tiene 14 features» sin precisar la acepción es una fuente de incomprensión entre profesionales.
Definición rigurosa
Magnitud cuyo valor es desconocido en el momento en que el sistema debe pronunciarse, y cuya estimación constituye la finalidad del modelo. En aprendizaje supervisado, su valor observado está disponible para las observaciones del conjunto de entrenamiento, lo que autoriza la constitución de una señal de error y por tanto el aprendizaje.
Posición en el formalismo
Elemento y del espacio de salida 𝒴. El par (x, y) constituye un ejemplo etiquetado; el conjunto de entrenamiento es una colección de tales pares supuestamente procedentes de una distribución conjunta P(X, Y) desconocida y fija.
Traducción al lenguaje corriente
Lo que se quiere que la máquina adivine.
El criterio discriminante del aprendizaje supervisado
Es la existencia de una variable objetivo observada lo que define el aprendizaje supervisado y lo separa del aprendizaje no supervisado (capítulo 003). En ausencia de objetivo, no existe ninguna señal de error, por tanto nada que minimizar, por tanto ningún aprendizaje supervisado posible.
Punto de vigilancia
La variable objetivo no viene dada por la naturaleza. Es construida por una decisión de diseño que fija lo que cuenta como el fenómeno a predecir y a qué horizonte. Este punto se desarrolla en el apartado 3.4.
| Término | Disciplina de origen | Alcance particular | Registro de uso |
|---|---|---|---|
| Target, objetivo | Machine Learning anglófono | Neutro, todo tipo de objetivo | Dominante |
| Variable objetivo | Traducción al español | Idéntica | Estándar hispanohablante |
| Variable dependiente | Estadística experimental, psicología experimental | Sugiere una dependencia causal respecto a las variables manipuladas | Frecuente, problemático en ML (apartado 4) |
| Variable respuesta, response variable | Estadística, metodología del diseño de experimentos | Lo que responde a una variación controlada de las entradas | Estándar académico |
| Variable explicada, variable a explicar | Estadística y econometría | Simétrica de «variable explicativa» | Corriente en español |
| Variable endógena, regresando | Econometría estructural | Determinada en el interior del sistema modelado | Especializado |
| Salida, output | Automática, teoría de sistemas | Neutro: lo que sale de la caja | Muy corriente |
| Label, etiqueta | Aprendizaje supervisado, anotación de datos | Restringido a los objetivos categóricos | Dominante en clasificación |
| Clase | Reconocimiento de patrones, clasificación | Una modalidad particular del label | Dominante en clasificación |
| Verdad de campo, ground truth | Teledetección, luego visión por computador | El valor de referencia tenido por verdadero, por oposición a la predicción | Estándar en anotación |
| Patrón de referencia, gold standard | Bioestadística, diagnóstico médico | El procedimiento de referencia que sirve para establecer el valor verdadero | Estándar en medicina |
| Variable criterio | Psicometría, selección de personal | El resultado que el dispositivo busca predecir | Especializado |
Definición rigurosa
Valor categórico atribuido a una observación, que designa su pertenencia a una de las modalidades de un conjunto finito de clases predefinidas.
El punto discriminante
Label no es un sinónimo exacto de target. Todo label es un objetivo, todo objetivo no es un label.
| Tipo de problema | Objetivo | ¿Se puede decir «label»? |
|---|---|---|
| Clasificación binaria: fraude / normal | Categórico con 2 modalidades | Sí |
| Clasificación multiclase: gato / perro / caballo | Categórico con k modalidades | Sí |
| Regresión: precio en euros | Numérico continuo | No, por convención de uso |
Traducción al lenguaje corriente
La etiqueta pegada sobre el ejemplo: «esto es un spam», «esto es un fraude».
Punto de vigilancia
La expresión datos etiquetados (labeled data) se emplea en la literatura para designar todo conjunto de datos que comporta un objetivo observado, incluso en regresión. El uso es, por tanto, más amplio que la definición estricta del label. El capítulo 007 precisa la articulación entre label, clase y codificación numérica.
Definición rigurosa
Valor de la variable objetivo tenido por exacto, establecido por un procedimiento de referencia independiente del modelo, y que sirve de referencial para el aprendizaje y la evaluación.
Origen del término
La expresión proviene de la teledetección: la validación de las interpretaciones de imágenes satelitales exigía mediciones efectuadas en el terreno, sobre el suelo.
Punto de vigilancia mayor
La verdad de campo no es la verdad. Es una medida, producida por un protocolo falible: anotación humana sujeta a desacuerdo, diagnóstico médico imperfecto, transacción fraudulenta no detectada y por tanto etiquetada «normal». El rendimiento medido de un modelo está limitado por la calidad del etiquetado. Un modelo no puede aprender correctamente una distinción que sus etiquetas no codifican correctamente.
Consecuencia operativa
Antes de imputar un bajo rendimiento al algoritmo, verificar el protocolo de etiquetado: quién etiquetó, según qué definición, con qué tasa de acuerdo entre anotadores.
| Configuración | Estructura del objetivo | Denominación | Referencia |
|---|---|---|---|
| Una sola columna objetivo, valor único por observación | y ∈ ℝ o y ∈ {c₁, …, } | Caso estándar | Capítulo 010 |
| Una observación puede pertenecer a varias clases simultáneamente | y ∈ | Clasificación multietiqueta | Capítulo 011 |
| Varios objetivos numéricos predichos conjuntamente | y ∈ | Regresión multisalida | Capítulo 048 |
| Objetivo categórico con modalidades ordenadas | y ∈ {c₁ < … < } | Clasificación ordinal | Capítulo 011 |
Punto de vigilancia: la presencia de varias columnas candidatas al rol de objetivo en un archivo no autoriza a tratarlas como un objetivo único. Dos objetivos distintos definen dos problemas distintos, exigiendo cada uno su modelo, sus métricas y su validación.
Ningún sistema operativo produce espontáneamente una columna llamada «a_resilie». Esta columna resulta de una cadena de decisiones explícitas.
| Decisión | Efecto sobre el proyecto |
|---|---|
| Definición del evento | Determina la tasa de positivos, y por tanto el grado de desequilibrio (capítulo 050) |
| Horizonte temporal | Determina la dificultad del problema y la utilidad operativa de la predicción |
| Población afectada | Determina el perímetro de validez del modelo y los sesgos de selección |
| Fecha de observación | Determina qué variables explicativas están legítimamente disponibles (apartado 6.1) |
Principio director: una variable objetivo mal definida no puede compensarse con ningún refinamiento algorítmico. La formalización del objetivo es la primera etapa del ciclo de vida de un proyecto (capítulo 012), y pertenece a una discusión con el negocio, no a una decisión técnica.
Definición rigurosa en el marco experimental de origen
En un diseño de experimentos, la variable independiente es la magnitud cuyos valores fija deliberadamente el experimentador, independientemente de cualquier otro factor del dispositivo; la variable dependiente es la magnitud medida de la que se busca establecer si varía en función de la primera.
Contexto histórico
Esta terminología proviene de la metodología experimental formalizada por Ronald Fisher (The Design of Experiments, 1935) y difundida por la psicología experimental. Supone un dispositivo en el que el experimentador manipula una variable, controla las demás y aleatoriza la asignación de las unidades, lo que autoriza una inferencia causal.
Traducción al lenguaje corriente
Lo que uno regula por sí mismo, y lo que se observa en consecuencia.
Punto de vigilancia
Estas condiciones prácticamente nunca se reúnen en Machine Learning aplicado, que opera sobre datos observacionales recogidos sin diseño experimental. El vocabulario subsiste, su justificación ha desaparecido.
| Dificultad | Lo que el término sugiere | Lo que ocurre en Machine Learning |
|---|---|---|
| Independencia estadística | Las variables explicativas serían independientes entre sí | Casi siempre están correlacionadas entre sí. La correlación fuerte entre variables explicativas tiene un nombre, la multicolinealidad, y constituye un problema tratado en el capítulo 017 |
| Manipulación experimental | El analista fijaría los valores de las variables de entrada | Son observadas, no manipuladas. Nadie «fija» la edad de un cliente o la superficie de una vivienda |
| Dependencia causal | El objetivo variaría a causa de las variables de entrada | El modelo capta una asociación. La inferencia causal exige un marco específico, no un modelo predictivo (capítulo 016) |
| Propiedad intrínseca | Una variable sería independiente o dependiente por naturaleza | El estatus es un rol asignado por el proyecto, reversible de un proyecto a otro |
| Simetría lógica | Una sola lectura sería posible | El sentido de la flecha es una elección de diseño, restringida por la disponibilidad temporal, no por la lógica |
El contrasentido más frecuente: concluir que las variables explicativas deben ser independientes entre sí porque se llaman «independientes». La exigencia de ausencia de fuerte colinealidad existe para ciertos modelos paramétricos, pero no tiene ninguna relación con el origen del término, que remite a la independencia respecto al dispositivo experimental, no entre variables.
Una misma magnitud cambia de rol según la pregunta planteada. La columna no cambia; el proyecto cambia.
| Magnitud | Proyecto donde es objetivo | Proyecto donde es explicativa |
|---|---|---|
| Importe de una transacción | Previsión del ticket medio | Detección de fraude bancario |
| Nota de satisfacción del cliente | Predicción de la satisfacción tras la llamada | Predicción del abandono |
| Duración de hospitalización | Planificación de la capacidad hospitalaria | Predicción del riesgo de reingreso |
| Temperatura de un rodamiento | Previsión térmica de un equipo | Detección de una avería inminente |
| Salario | Estimación salarial en la contratación | Puntuación de concesión de crédito |
| Situación | Formulación recomendada | Formulación a evitar |
|---|---|---|
| Informe técnico en español | Variables explicativas / variable objetivo | Variables independientes / dependiente |
| Código y documentación técnica | features / target, X / y | — |
| Presentación a un público de negocio | Informaciones proporcionadas / valor a predecir | Todo término estadístico sin traducir |
| Artículo científico en estadística | Predictores / variable respuesta | — |
| Entrevista de trabajo | Variables explicativas, señalando el conocimiento de los sinónimos | Empleo de un solo término sin perspectiva |
Posición profesional esperada: conocer los sinónimos, saber traducirlos de un registro a otro, y saber explicar por qué variable independiente es una herencia inadaptada al marco observacional del Machine Learning.
Definición rigurosa
Representación de una observación en forma de una p-tupla ordenada de valores, uno por variable explicativa retenida:
donde p designa el número de variables explicativas y el valor tomado por la j-ésima variable para esta observación.
Tres propiedades restrictivas
Traducción al lenguaje corriente
Una fila de la tabla, reducida a las columnas útiles y convertida en una sucesión de números.
Definición rigurosa
Matriz X ∈ cuya i-ésima fila es el vector de características xᵢᵀ de la i-ésima observación y cuya j-ésima columna es el vector de los valores tomados por la j-ésima variable explicativa sobre las n observaciones.
El vector objetivo asociado es y ∈ , donde 𝒴 = ℝ en regresión y 𝒴 = {c₁, …, } en clasificación.
Origen del término
Design matrix proviene de la literatura del diseño de experimentos, donde las filas de la matriz describían la configuración experimental de cada ensayo. El término se conserva en regresión y en aprendizaje estadístico.
Convención de notación
X mayúscula para la matriz, y minúscula para el vector objetivo: la caja señala la diferencia de dimensionalidad, dos dimensiones frente a una. Esta convención es universal en la literatura y en las bibliotecas de software.
| Objeto | Notación | Dimensión | Contenido |
|---|---|---|---|
| Conjunto de entrenamiento | (X, y) | — | n pares (observación, objetivo) |
| Matriz de las variables explicativas | X | n × p | Valores numéricos |
| Vector objetivo | y | n | Un valor por observación |
| Vector de características de una observación | xᵢ | p | La fila i de X |
| Valor de una variable para una observación | escalar | Celda (i, j) | |
| Vector de una variable sobre todo el conjunto | X[:, j] | n | La columna j de X |
| Predicción para una observación | ŷᵢ | escalar o vector | Salida del modelo |
import pandas as pd
df = pd.read_csv("clients_telecom.csv")
cible = "a_resilie"
identifiants = ["client_id"]
X = df.drop(columns=[cible] + identifiants)
y = df[cible]
print("X :", X.shape)
print("y :", y.shape)
print()
print(X.dtypes)X : (10000, 7)
y : (10000,)
age int64
anciennete_mois int64
type_forfait str
engagement str
facture_mensuelle float64
nb_appels_support int64
satisfaction float64
dtype: objectInterpretación. El conjunto comprende n = 10 000 observaciones. La matriz X
comprende siete columnas, habiéndose retirado el objetivo y el identificador. La forma de
y, (10000,), confirma que se trata de un vector de una dimensión y no de una
matriz de una columna: esta distinción es fuente de advertencias y
de errores en varias bibliotecas.
Punto de vigilancia: df.drop(columns=[cible]) debe escribirse antes de cualquier
otra transformación. Toda etapa de preparación calculada sobre un conjunto que contenga
todavía el objetivo expone a una fuga (capítulo 028).
print(X.iloc[0])age 49
anciennete_mois 80
type_forfait Mobile
engagement 12_mois
facture_mensuelle 43.81
nb_appels_support 3
satisfaction 4.0
Name: 0, dtype: objectEsta fila no es todavía un vector de : dos componentes son textuales. La codificación de las variables categóricas produce la representación numérica efectivamente sometida al modelo.
X_encode = pd.get_dummies(X, columns=["type_forfait", "engagement"])
X_num = X_encode.astype(float)
print("Número de columnas antes de la codificación:", X.shape[1])
print("Número de columnas después de la codificación:", X_encode.shape[1])
print(list(X_encode.columns))
print("Tipo:", X_num.to_numpy().dtype, "| forma:", X_num.to_numpy().shape)
print("Vector de características de la primera observación:")
print(X_num.to_numpy()[0])Número de columnas antes de la codificación: 7
Número de columnas después de la codificación: 11
['age', 'anciennete_mois', 'facture_mensuelle', 'nb_appels_support',
'satisfaction', 'type_forfait_Fibre', 'type_forfait_Fibre+TV',
'type_forfait_Mobile', 'engagement_12_mois', 'engagement_24_mois',
'engagement_Sans_eng']
Tipo: float64 | forma: (10000, 11)
Vector de características de la primera observación:
[49. 80. 43.81 3. 4. 0. 0. 1. 1. 0. 0. ]Interpretación. La observación, inicialmente descrita por siete columnas
heterogéneas, es ahora un punto de ℝ¹¹. Las cinco primeras componentes son
las variables numéricas de origen; las seis siguientes son indicadoras
binarias que codifican las modalidades de las dos variables categóricas. Los valores
1 en las posiciones ocho y nueve indican una tarifa Mobile con un compromiso de
doce meses.
Dos enseñanzas de alcance general:
anciennete_mois varía de 1 a 120,
facture_mensuelle de 15 a 95, las indicadoras valen 0 o 1. Esta
heterogeneidad no tiene efecto sobre un árbol de decisión y es determinante para todo
modelo basado en distancias o en un descenso de gradiente (capítulo 023).Definición rigurosa
Conjunto 𝒳 de todos los valores admisibles del vector de características. En el caso usual de p variables con valores reales, 𝒳 ⊆ , dotado de una estructura de espacio vectorial normado que permite definir una distancia entre observaciones.
Formulación geométrica
Cada observación es un punto de este espacio; cada variable explicativa es un eje; el conjunto de datos es una nube de n puntos en un espacio de dimensión p. La tarea de aprendizaje consiste en identificar en este espacio una estructura —una frontera que separa regiones en clasificación, una superficie de respuesta en regresión— que reproduce correctamente el vínculo entre posición y valor objetivo.
Traducción al lenguaje corriente
El conjunto de todas las fichas descriptivas posibles, vistas como puntos sobre un mapa de p dimensiones.
Punto de vigilancia
La intuición geométrica adquirida en dimensión 2 o 3 deja de ser fiable más allá. En alta dimensión, el volumen se concentra en las regiones periféricas, las distancias entre pares de puntos se vuelven casi todas equivalentes, y la noción de vecindad pierde su poder discriminante. Este fenómeno, llamado maldición de la dimensionalidad, afecta particularmente a los métodos basados en distancias (capítulo 040).
Un mapa plano posee dos ejes, longitud y latitud. Cada ciudad ocupa en él un punto único. Dos ciudades vecinas en el mapa lo son en la realidad: la proximidad en el espacio de representación tiene sentido.
El espacio de características es ese mapa, con p ejes en lugar de dos. Dos clientes cuyos vectores de características están próximos son clientes «semejantes» en el sentido de las variables retenidas.
Tres prolongaciones exactas de la analogía:
| Elemento | Formalización | Lectura |
|---|---|---|
| Una observación | x ∈ 𝒳 ⊆ | Un punto |
| El objetivo real | y ∈ 𝒴 | El valor verdadero |
| El modelo | f : 𝒳 → 𝒴 | Una función definida sobre todo el espacio |
| La predicción | ŷ = f(x) | El valor asignado al punto |
| El error sobre una observación | ℓ(y, ŷ) | La desviación medida por una función de pérdida |
| El objetivo de aprendizaje | minimizar 𝔼[ℓ(Y, f(X))] | Reducir el error esperado sobre la distribución, no sobre la muestra |
Punto esencial. El modelo está definido sobre todo el espacio, incluso en las regiones donde no se ha registrado ninguna observación. Producirá una predicción para un vector de características situado fuera del dominio cubierto por el entrenamiento, sin señalar que esa región nunca ha sido observada. Esta extrapolación silenciosa es una fuente mayor de fallo en producción y motiva la supervisión de la deriva de los datos (capítulo 082).
Disponer de una columna no autoriza a utilizarla. Cuatro filtros sucesivos se aplican, en este orden, antes de toda consideración de rendimiento.
Definición rigurosa
Una variable está disponible en el instante de predicción si su valor es observado, accesible y definitivo en los sistemas de información en ese instante, para toda observación sobre la que el modelo deba pronunciarse.
Formulación operativa
Sea el instante en que la predicción debe producirse y el instante en que el valor de la variable se vuelve efectivamente conocido. La variable es admisible si y solo si:
≤ , para todas las observaciones, sin excepción
Traducción al lenguaje corriente
¿Tendré realmente esta información en el momento de tener que responder, o solo en mi histórico porque miro el pasado?
Punto de vigilancia
El conjunto de datos histórico se constituye a posteriori: contiene naturalmente informaciones acumuladas después del instante de decisión. Nada en el archivo distingue una variable disponible de una variable posterior. Solo un conocimiento del proceso de negocio permite decidir. Esta verificación no puede automatizarse.
| Caso de uso | Variable candidata | respecto a | Veredicto |
|---|---|---|---|
| Abandono de cliente a 90 días | Antigüedad en meses | Anterior | Admisible |
| Abandono de cliente a 90 días | Fecha de cancelación | Posterior, y definido por el evento | Exclusión, fuga manifiesta |
| Abandono de cliente a 90 días | Motivo de baja introducido por el asesor | Posterior | Exclusión |
| Abandono de cliente a 90 días | Número de llamadas al soporte en los últimos 6 meses | Anterior si la ventana está limitada a | Admisible bajo condición de ventana estricta |
| Concesión de crédito | Ingreso declarado en la solicitud | Anterior | Admisible |
| Concesión de crédito | Número de incidentes de pago sobre el préstamo concedido | Posterior | Exclusión |
| Estimación del precio de venta de una vivienda | Superficie, año de construcción | Anterior | Admisible |
| Estimación del precio de venta de una vivienda | Duración de la puesta en venta | Posterior a la puesta en venta, conocido solo después | Exclusión |
| Mantenimiento predictivo a 7 días | Vibración media de las últimas 24 horas | Anterior | Admisible |
| Mantenimiento predictivo a 7 días | Código de anomalía del diagnóstico de avería | Posterior | Exclusión |
| Diagnóstico médico en el ingreso | Constantes vitales a la llegada | Anterior | Admisible |
| Diagnóstico médico en el ingreso | Tratamiento administrado | Posterior, y consecuencia del diagnóstico | Exclusión |
Tres formas de indisponibilidad, de las cuales dos se omiten frecuentemente:
| Forma | Descripción | Ilustración |
|---|---|---|
| Indisponibilidad temporal | El valor aún no existe en | El importe total facturado en el año en curso |
| Indisponibilidad de latencia | El valor existe pero solo se consolida en los sistemas con un retraso superior a la ventana de decisión | Una puntuación externa actualizada mensualmente, explotada en un scoring en tiempo real |
| Indisponibilidad de perímetro | El valor existe para la población histórica pero no para la población objetivo | Una variable informada únicamente para los clientes de una filial absorbida |
Punto de vigilancia sobre la latencia. Un modelo validado sobre un histórico completo puede derrumbarse en producción porque una variable llega con cuarenta y ocho horas de retraso y se presenta por tanto sistemáticamente como faltante en el instante de la predicción. La verificación se refiere no solo a la existencia de la variable, sino a su disponibilidad efectiva en el sistema que la invoca, con la frescura requerida.
El mecanismo completo por el cual una variable no disponible degrada un proyecto, sus formas sutiles y los protocolos de detección se tratan en el capítulo 028.
Definición rigurosa
Presencia, entre las informaciones utilizadas para construir el modelo, de una información que no estará legítimamente disponible en el instante de la predicción, o que está determinada por el valor del objetivo, provocando una sobreestimación del rendimiento medido y un fallo en producción.
Traducción al lenguaje corriente
El modelo ha visto la respuesta, directa o indirectamente, durante su aprendizaje.
Las dos grandes familias
| Familia | Mecanismo | Detección |
|---|---|---|
| Fuga por la variable | Una columna codifica todo o parte del objetivo | Rendimiento anormalmente alto, importancia concentrada en una variable |
| Fuga por el protocolo | Una estadística calculada sobre el conjunto de los datos antes de la separación contamina el conjunto de test | Diferencia pequeña entre validación y test, derrumbe en producción |
Señal de alerta más fiable
Un rendimiento netamente superior a las expectativas del negocio. Un modelo que alcanza 0,99 de AUC en un problema reputado difícil debe ser sospechoso de fuga antes de ser celebrado.
Punto de vigilancia
La fuga no provoca ningún error de ejecución. Produce excelentes resultados. Es precisamente lo que la hace peligrosa: nada invita a buscarla.
| Tipo de variable sospechosa | Pregunta de control | Ejemplo |
|---|---|---|
| Variable de consecuencia | ¿El valor se produce porque el evento ha tenido lugar? | date_resiliation, motif_annulation, montant_rembourse |
| Variable de tratamiento | ¿El valor refleja una acción desencadenada por el conocimiento del resultado? | offre_de_retention_proposee, dossier_transmis_au_contentieux |
| Variable agregada sin ventana | ¿El agregado cubre un periodo posterior a ? | nb_transactions_total, moyenne_annuelle |
| Variable proxy casi perfecta | ¿La correlación con el objetivo es sospechosa de trivialidad? | statut_compte = "clos" para predecir el abandono |
| Identificador portador de orden | ¿El identificador codifica implícitamente la cronología o el grupo? | Números secuenciales atribuidos por lote, un lote por clase |
Una variable estadísticamente asociada al objetivo sin mecanismo plausible debe examinarse antes de ser retenida. Tres resultados son posibles.
| Diagnóstico | Naturaleza del vínculo | Conducta a seguir |
|---|---|---|
| Mecanismo de negocio identificado | Asociación fundada | Conservar |
| Variable indirecta de una causa no observada | Asociación real pero frágil | Conservar con reserva, documentar, supervisar la estabilidad |
| Correlación fortuita propia de la muestra | Asociación sin fundamento | Excluir; no se reproducirá |
| Artefacto de recogida | La asociación proviene del proceso de constitución de los datos | Excluir y corregir la recogida |
Punto de vigilancia: la plausibilidad de negocio es un filtro, no una prueba. Una variable plausible puede ser inútil, y una variable cuyo mecanismo no se comprende puede ser auténticamente predictiva. El criterio sirve para identificar las variables a examinar, no para decidir por sí solo.
Punto de vigilancia sobre la estabilidad. Una variable cuya distribución o cuya definición evoluciona en el tiempo —rediseño de una nomenclatura, cambio de sistema de recogida, modificación de una regla de gestión— degrada el modelo sin que ninguna alerta técnica se dispare. La supervisión de estas evoluciones se trata en el capítulo 082.
| Categoría | Estatus | Dificultad propia |
|---|---|---|
| Variables directamente sensibles: origen, religión, opiniones políticas, salud, orientación sexual | Uso estrictamente regulado o prohibido según las jurisdicciones y las finalidades | Identificación fácil |
| Variables indirectas fuertemente correlacionadas con una variable sensible | Prohibición a menudo eludida sin intención | El código postal puede sustituir al origen; el nombre de pila al género |
| Variables procedentes de una recogida sin base legal | Inexplotables | Trazabilidad de la procedencia exigida |
| Variables producidas por otro modelo | Explotables con precaución | Dependencia en cascada, opacidad acrecentada, propagación de los sesgos |
Punto de vigilancia: retirar las variables sensibles no basta para producir un modelo equitativo. Las variables indirectas reconstituyen la información suprimida. La auditoría de equidad se realiza sobre las predicciones del modelo, no sobre la sola lista de sus entradas (capítulo 080).
| # | Pregunta | Si la respuesta es desfavorable |
|---|---|---|
| 1 | ¿La variable estará informada en el instante de la predicción, para toda la población objetivo? | Exclusión |
| 2 | ¿Su valor es definitivo en ese instante, o se revisa posteriormente? | Exclusión o ventana explícita |
| 3 | ¿Su valor es una consecuencia del evento a predecir? | Exclusión por fuga |
| 4 | ¿Un agregado que contiene desborda sobre el periodo posterior? | Recálculo con ventana limitada |
| 5 | ¿Un mecanismo de negocio plausible relaciona esta variable con el objetivo? | Examen en profundidad |
| 6 | ¿Su definición y su distribución son estables en el tiempo? | Supervisión reforzada |
| 7 | ¿Su uso es lícito respecto a la finalidad y la reglamentación? | Exclusión |
| 8 | ¿Su coste de adquisición en producción es compatible con el uso previsto? | Arbitraje |
Estas ocho preguntas preceden a toda medida estadística. Los métodos de selección basados en la importancia, la correlación o el rendimiento intervienen después de este filtrado, y se tratan en el capítulo 025.
La constatación, ampliamente documentada por la práctica industrial y por las competiciones de modelado, es la siguiente: para un conjunto de datos dado, la ganancia obtenida enriqueciendo la información proporcionada supera generalmente la ganancia obtenida sustituyendo un algoritmo por otro.
La ilustración siguiente es reproducible. Los datos están simulados, siendo el mecanismo generador conocido: el precio es el producto de la superficie por el precio por metro cuadrado local, corregido por la vetustez. El conjunto contiene también seis variables de ruido sin relación con el objetivo.
import numpy as np
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
from sklearn.ensemble import HistGradientBoostingRegressor
from sklearn.metrics import r2_score
rng = np.random.default_rng(7)
n = 600
surface = rng.uniform(20, 160, n)
prix_m2_commune = rng.uniform(2000, 7000, n)
annee_construction = rng.integers(1900, 2021, n)
age_bien = 2024 - annee_construction
# Mecanismo generador: el precio es un PRODUCTO, corregido por la vetustez
prix = surface * prix_m2_commune * (1 - 0.0025 * age_bien) + rng.normal(0, 40000, n)
X_brut = pd.DataFrame({
"surface_m2": surface,
"prix_m2_commune": prix_m2_commune,
"annee_construction": annee_construction,
})
for j in range(6):
X_brut[f"var_bruit_{j+1}"] = rng.normal(0, 1, n)
X_enrichi = X_brut.copy()
X_enrichi["valeur_theorique"] = surface * prix_m2_commune
X_enrichi["age_bien"] = age_bien
configurations = [("Variables brutas", X_brut), ("Variables enriquecidas", X_enrichi)]
modeles = [("Regresion lineal", LinearRegression()),
("Gradient boosting", HistGradientBoostingRegressor(random_state=0))]
for nom_config, X in configurations:
X_tr, X_te, y_tr, y_te = train_test_split(X, prix, test_size=0.3, random_state=0)
for nom_modele, modele in modeles:
modele.fit(X_tr, y_tr)
r2 = r2_score(y_te, modele.predict(X_te))
print(f"{nom_config:22s} | {nom_modele:20s} | p = {X.shape[1]:2d} | R2 = {r2:.3f}")Variables brutas | Regresion lineal | p = 9 | R2 = 0.898
Variables brutas | Gradient boosting | p = 9 | R2 = 0.927
Variables enriquecidas | Regresion lineal | p = 11 | R2 = 0.946
Variables enriquecidas | Gradient boosting | p = 11 | R2 = 0.929| Comparación | Diferencia de R² | Lectura |
|---|---|---|
| Cambio de algoritmo, con variables brutas constantes | +0,029 | Ganancia obtenida reemplazando la regresión lineal por el gradient boosting |
| Enriquecimiento de las variables, con algoritmo lineal constante | +0,048 | Ganancia obtenida añadiendo dos variables construidas |
| Modelo lineal enriquecido frente a gradient boosting bruto | +0,019 a favor del lineal | El modelo más simple, correctamente informado, supera al modelo más potente mal informado |
Interpretación. El mecanismo generador es multiplicativo. Un modelo lineal
no puede representar un producto de dos variables: es estructuralmente
incapaz de ello mientras ese producto no se le proporcione. En cuanto la variable
valeur_theorique se construye, el problema vuelve a ser lineal y el modelo más
simple alcanza el mejor rendimiento del conjunto. El gradient boosting,
que aproxima el producto mediante una suma de árboles, lo consigue parcialmente, a un
coste computacional superior y al precio de una interpretabilidad menor.
Alcance de la demostración y límites. Este resultado está construido sobre datos simulados cuyo mecanismo es conocido; ilustra un principio y no constituye una medida generalizable. Sobre datos reales, la diferencia depende del problema: existen casos en que el cambio de algoritmo domina. El principio director sigue no obstante sólidamente establecido.
Un algoritmo, sea cual sea, solo puede explotar la información contenida en las variables que se le proporcionan. Ninguna sofisticación algorítmica compensa una información ausente.
| Palanca de mejora | Efecto típico | Coste | Prioridad |
|---|---|---|---|
| Corregir la definición del objetivo | Determinante | Bajo, pero exige un acuerdo de negocio | 1 |
| Eliminar las fugas y las variables no disponibles | Determinante para la validez | Bajo | 2 |
| Adquirir una fuente de datos nueva y pertinente | A menudo alto | Alto | 3 |
| Construir variables derivadas adaptadas al mecanismo | A menudo alto | Moderado | 4 |
| Aumentar el volumen de observaciones | Variable, decreciente | Moderado a alto | 5 |
| Cambiar de algoritmo | Moderado | Bajo | 6 |
| Optimizar los hiperparámetros | Bajo a moderado | Moderado | 7 |
| client_id | age | anciennete_mois | type_forfait | facture_mensuelle | nb_appels_support | satisfaction | date_resiliation | motif_depart | a_resilie |
|---|---|---|---|---|---|---|---|---|---|
| C-00001 | 34 | 8 | Mobile | 29,90 | 0 | 4 | — | — | 0 |
| C-00002 | 67 | 45 | Fibre | 64,90 | 3 | 2 | — | — | 0 |
| C-00003 | 29 | 2 | Mobile | 19,90 | 1 | — | 2025-01-14 | Prix | 1 |
| C-00004 | 52 | 61 | Fibre+TV | 89,90 | 0 | 5 | — | — | 0 |
| C-00005 | 41 | 17 | Fibre | 49,90 | 7 | 1 | 2024-11-22 | Service | 1 |
| Elemento | Determinación |
|---|---|
| Variable objetivo | a_resilie, binaria, cancelación constatada en los 90 días siguientes a la fecha de observación |
| Tipo de problema | Clasificación binaria |
| Variables explicativas retenidas | age, anciennete_mois, type_forfait, facture_mensuelle, nb_appels_support, satisfaction |
| Columnas excluidas como identificadores | client_id |
| Columnas excluidas por fuga | date_resiliation y motif_depart: ambas se informan solo si la cancelación ha tenido lugar. Su sola presencia determina el objetivo |
| Dimensión tras la codificación | p = 8: cinco numéricas y tres indicadoras para type_forfait |
| Punto de vigilancia sobre la ventana | nb_appels_support debe calcularse sobre una ventana limitada a la fecha de observación. Un conteo sobre toda la vida del cliente incluye las llamadas posteriores, en particular la propia llamada de cancelación |
Diagnóstico de fuga por la tasa de valores faltantes. La columna
motif_depart está vacía para todas las observaciones no canceladas. Una columna
cuya tasa de completitud coincide exactamente con la tasa de positivos del
objetivo es una variable de fuga hasta que se demuestre lo contrario. Este control es poco
costoso y detecta una amplia parte de las fugas por la variable.
| annonce_id | commune | surface_m2 | nb_pieces | annee_construction | classe_energie | ascenseur | duree_mise_en_vente_j | nb_visites | prix_vente |
|---|---|---|---|---|---|---|---|---|---|
| A-10471 | Lyon 3e | 68 | 3 | 1972 | D | 1 | 47 | 12 | 331 000 |
| A-10472 | Villeurbanne | 42 | 2 | 2015 | B | 1 | 22 | 19 | 218 500 |
| A-10473 | Lyon 6e | 105 | 5 | 1930 | E | 0 | 118 | 8 | 712 000 |
| A-10474 | Bron | 77 | 4 | 1988 | D | 0 | 63 | 11 | 249 000 |
| A-10475 | Lyon 3e | 31 | 1 | 2019 | A | 1 | 15 | 24 | 189 900 |
| Elemento | Determinación |
|---|---|
| Variable objetivo | prix_vente, numérica continua estrictamente positiva |
| Tipo de problema | Regresión |
| Variables explicativas retenidas | commune, surface_m2, nb_pieces, annee_construction, classe_energie, ascenseur |
| Columnas excluidas como identificadores | annonce_id |
| Columnas excluidas por indisponibilidad | duree_mise_en_vente_j y nb_visites: estos valores solo se conocen después de la venta. El uso previsto es la estimación en la puesta en venta, instante en el que valen cero o están indefinidos |
| Variables a construir | age_bien = annee_vente − annee_construction; prix_m2_median_commune calculado únicamente sobre el periodo de entrenamiento; surface_par_piece |
| Dimensión tras la codificación | Depende de la cardinalidad de commune; una codificación indicadora sobre 60 municipios lleva p más allá de 65 |
Punto de vigilancia sobre la variable construida prix_m2_median_commune.
Esta variable es la palanca de rendimiento más fuerte del problema, y
simultáneamente un vector de fuga. Calculada sobre el conjunto de los datos,
incorpora los precios de venta del conjunto de test en las entradas del
entrenamiento. Debe estimarse exclusivamente sobre el conjunto de entrenamiento,
y luego aplicarse a los demás conjuntos, lo que impone integrarla en un pipeline
(capítulos 079 y 092) y no calcularla previamente.
Punto de vigilancia sobre la dependencia temporal. El nivel general de los precios deriva. Si el uso objetivo consiste en estimar transacciones futuras, la separación debe ser cronológica (capítulo 027) y la supervisión de la deriva debe ponerse en marcha (capítulo 082).
| capteur_id | machine_id | horodatage | temperature_c | vibration_rms | pression_bar | heures_fonctionnement | jours_depuis_maintenance | code_defaut_diag | panne_sous_7j |
|---|---|---|---|---|---|---|---|---|---|
| S-0001 | M-14 | 2025-03-02 06:00 | 62,4 | 1,82 | 4,10 | 18 420 | 34 | — | 0 |
| S-0002 | M-14 | 2025-03-02 07:00 | 71,9 | 3,47 | 4,08 | 18 421 | 34 | E-207 | 1 |
| S-0003 | M-22 | 2025-03-02 06:00 | 58,1 | 1,44 | 3,95 | 6 210 | 12 | — | 0 |
| S-0004 | M-22 | 2025-03-02 07:00 | 58,6 | 1,51 | 3,96 | 6 211 | 12 | — | 0 |
| S-0005 | M-07 | 2025-03-02 06:00 | 79,2 | 4,91 | 4,42 | 41 003 | 96 | — | 1 |
| Elemento | Determinación |
|---|---|
| Variable objetivo | panne_sous_7j, binaria, ocurrencia de una parada no planificada en los siete días |
| Tipo de problema | Clasificación binaria con objetivo fuertemente desequilibrado |
| Qué representa una observación | Una lectura horaria para una máquina, no una máquina. La misma máquina ocupa miles de filas |
| Variables explicativas retenidas | temperature_c, vibration_rms, pression_bar, heures_fonctionnement, jours_depuis_maintenance, más agregados temporales a construir |
| Columnas excluidas como identificadores | capteur_id; machine_id se conserva como clave de agrupamiento, no como variable explicativa |
| Columnas excluidas por fuga | code_defaut_diag: este código lo emite el diagnóstico efectuado en el momento de la avería. Su presencia determina mecánicamente el objetivo |
| Variables a construir | Medias, desviaciones típicas y pendientes de vibration_rms sobre ventanas deslizantes de 6, 24 y 72 horas; desviación respecto al valor de referencia por máquina |
Punto de vigilancia sobre la estructura de grupo. Una separación aleatoria situaría lecturas de la misma máquina y del mismo día a la vez en entrenamiento y en test. El modelo memorizaría la firma de la máquina en lugar del mecanismo de degradación, y el rendimiento medido quedaría fuertemente sobreestimado. La separación debe realizarse por grupo de máquinas y respetar la cronología (capítulo 027).
Punto de vigilancia sobre la ventana de los agregados. Toda ventana deslizante debe ser estrictamente anterior a la marca de tiempo de la observación. Una media centrada en el instante actual integra medidas futuras y produce una fuga que solo se manifestará en producción.
| Dominio | Fuga más frecuente | Variable de disponibilidad más crítica |
|---|---|---|
| Abandono en telecomunicaciones | Columnas informadas únicamente para los que se van | Agregados de contactos con el soporte, con ventana limitada |
| Inmobiliario | Estadísticas de precios calculadas sobre todo el conjunto | Variables que describen el desarrollo de la venta |
| Mantenimiento industrial | Códigos de diagnóstico posteriores a la avería | Agregados sobre ventanas deslizantes estrictamente anteriores |
La disponibilidad de una columna en un archivo histórico no establece ni su disponibilidad en el momento de la predicción, ni su legitimidad. Identificadores, variables de consecuencia y variables consolidadas tardíamente deben descartarse antes de todo modelado.
Formulación correcta: «Una columna se convierte en variable explicativa tras haber satisfecho cuatro criterios: disponibilidad en el instante de predicción, ausencia de fuga, plausibilidad de negocio y licitud.»
El calificativo proviene del marco experimental donde la variable es fijada por el experimentador independientemente del dispositivo. No prescribe ninguna independencia estadística entre las variables de entrada, las cuales están generalmente correlacionadas.
Formulación correcta: «El término independiente es una herencia del diseño de experimentos; la correlación entre variables explicativas es un fenómeno distinto, la multicolinealidad, tratada en el capítulo 017.»
Label designa un valor categórico asignado a una observación. Un objetivo numérico continuo es un target sin ser un label. Hablar del «label» de un problema de regresión es un abuso de lenguaje que señala un dominio incompleto del vocabulario.
Formulación correcta: «El objetivo es un label en clasificación y un valor numérico en regresión; target cubre los dos casos, label solo el primero.»
Ninguna magnitud es explicativa u objetivo por naturaleza. El importe de una transacción es objetivo en un proyecto de previsión del ticket medio y explicativa en un proyecto de detección de fraude.
Formulación correcta: «El rol de una variable lo asigna la pregunta planteada, no la variable misma.»
La adición de variables no informativas aumenta la dimensión del espacio de características, acrecienta la varianza de la estimación, favorece el sobreajuste y sobrecarga la cadena de producción. La relación entre número de variables y rendimiento en generalización no es monótona.
Formulación correcta: «La información pertinente mejora el modelo; el número de columnas, en sí mismo, no lo mejora.»
La codificación de las variables categóricas, la construcción de variables derivadas y la selección modifican la dimensión p. Siete columnas fuente pueden producir once dimensiones, o varios cientos con variables de alta cardinalidad.
Formulación correcta: «p designa el número de componentes del vector efectivamente sometido al modelo, tras la preparación.»
El orden de las palancas está establecido: definición del objetivo, eliminación de las fugas, enriquecimiento de la información, y solo después elección del algoritmo y optimización de los hiperparámetros. Invertir este orden lleva a consumir un presupuesto importante para una ganancia marginal.
Formulación correcta: «Antes de cambiar de modelo, verificar que la información necesaria para la predicción figura efectivamente en las entradas.»
El etiquetado lo produce un protocolo falible. Los desacuerdos entre anotadores, los diagnósticos erróneos y los fraudes no detectados introducen un ruido en el objetivo que limita el rendimiento alcanzable.
Formulación correcta: «La verdad de campo es una medida de referencia, no la verdad; la calidad del etiquetado condiciona el techo de rendimiento del modelo.»
LA FÓRMULA MENTAL
FEATURES → MODELO → TARGET
lo que es conocido la función lo que se busca
en el instante t_pred aprendida y es desconocido en t_pred
VARIABLE EXPLICATIVA — SINÓNIMOS Y ORÍGENES
feature, característica reconocimiento de patrones
variable explicativa estadística aplicada
variable independiente diseño de experimentos (Fisher, 1935)
variable de entrada, input automática, teoría de sistemas
predictor estadística de la regresión
regresor econometría
covariable bioestadística, ensayos clínicos
atributo minería de datos, bases relacionales
descriptor quimiometría
VARIABLE OBJETIVO — SINÓNIMOS Y ORÍGENES
target, objetivo Machine Learning
variable dependiente estadística experimental
variable respuesta diseño de experimentos
variable explicada estadística en español
variable endógena econometría
output, salida automática
label, etiqueta clasificación únicamente
verdad de campo teledetección, luego visión
gold standard bioestadística
TERMINOLOGÍA DEPENDIENTE / INDEPENDIENTE
Herencia del diseño de experimentos, inadaptada al ML observacional.
«Independiente» no significa independiente de las demás variables.
«Dependiente» no significa causalmente determinada.
El rol es funcional y reversible de un proyecto a otro.
FORMALIZACIÓN
x = (x1, …, xp)ᵀ ∈ ℝ^p vector de características
X ∈ ℝ^(n×p) matriz de diseño
y ∈ 𝒴^n vector objetivo
f : 𝒳 → 𝒴 el modelo
ŷ = f(x) la predicción
p ≠ número de columnas del archivo fuente
LOS CUATRO FILTROS, EN ESTE ORDEN
1. Disponibilidad en el instante de la predicción → si no, exclusión
2. Ausencia de fuga → si no, exclusión
3. Plausibilidad de negocio → si no, examen
4. Licitud y ética → si no, exclusión
La selección estadística solo interviene después.
EL CRITERIO PRIMERO
t_obs ≤ t_pred, para todas las observaciones, sin excepción.
Tres formas de indisponibilidad: temporal, de latencia, de perímetro.
LA JERARQUÍA DE LAS PALANCAS
objetivo bien definido > ausencia de fuga > información nueva
> variables construidas > volumen > algoritmo > hiperparámetrosEnunciado de síntesis
Las variables explicativas constituyen la totalidad de la información de la que dispone el modelo y la variable objetivo la magnitud que debe estimar; su designación varía según la disciplina de origen sin que la noción cambie, siendo la terminología estadística de dependencia e independencia una herencia experimental inadaptada al marco observacional del Machine Learning. Una observación se representa como un vector de y el modelo como una función definida sobre ese espacio. Una columna solo se convierte en variable explicativa tras haber satisfecho cuatro criterios, el primero de los cuales es su disponibilidad efectiva en el instante en que la predicción deba producirse; y la calidad de esa información determina el rendimiento alcanzable más que la elección del algoritmo.
Quiz asociados
006.1-quiz-relation-features-target.md006.2-quiz-variable-explicative.md006.3-quiz-variable-cible.md006.4-quiz-dependante-independante.md006.5-quiz-vecteur-espace-caracteristiques.md006.6-quiz-criteres-de-selection.md006.7-quiz-etudes-de-cas.mdCapítulo siguiente: 007-x-et-y-label-classe.md