Algoritmo, modelo, entrenamiento y predicción

25 min
Bloque 1 — El vocabulario fundamental
Objetivo
definir rigurosamente el algoritmo de aprendizaje y el modelo, establecer la distinción estricta entre ambos, caracterizar el entrenamiento como procedimiento de selección en un espacio de hipótesis y la predicción como evaluación de una función, e identificar lo que efectivamente se versiona, serializa y despliega en producción.
Duración estimada
35 minutos
Requisitos previos
capítulos 001 a 007
Quiz asociados
008.1-quiz-algorithme-apprentissage.md a 008.6-quiz-cycle-complet.md

1. El algoritmo de aprendizaje

1.1 El problema del vocabulario

Los cuatro enunciados siguientes se encuentran corrientemente en informes de proyecto. Tres son incorrectos.

EnunciadoEstatusMotivo
«Hemos entrenado un Random Forest sobre 40 000 observaciones.»AceptableElipsis admitida: entrenar con el algoritmo Random Forest
«El algoritmo predice una probabilidad de cancelación de 0,72.»IncorrectoUn algoritmo no predice; el modelo produce la predicción
«Hemos desplegado un XGBoost en producción.»IncorrectoLo que se despliega es un modelo procedente de XGBoost, no la biblioteca
«El algoritmo ha aprendido que la antigüedad reduce el riesgo.»IncorrectoEl algoritmo ejecuta un procedimiento; la información aprendida reside en los parámetros del modelo

La diferencia no es puramente léxica: lo que se versiona, lo que es reproducible, lo que debe reejecutarse cuando los datos evolucionan y lo que se transmite a explotación no son los mismos objetos según se hable del algoritmo o del modelo (apartado 3).

1.2 Definiciones

DEFINICIÓN — Algoritmo, en sentido general

Definición rigurosa. Sucesión finita y no ambigua de operaciones elementales que permite, a partir de entradas pertenecientes a un dominio especificado, producir una salida en un número finito de etapas. La caracterización clásica retiene cinco propiedades (Knuth, The Art of Computer Programming, 1968): finitud, definición no ambigua de cada etapa, entradas especificadas, salidas especificadas, efectividad de las operaciones.

Traducción al lenguaje corriente. Un método escrito de una vez por todas, que describe lo que hay que hacer y en qué orden, independientemente de los valores sobre los que se ejecutará.

Punto de vigilancia. Un algoritmo es una descripción de procedimiento: no tiene estado, no contiene ningún conocimiento sobre un dominio particular y no cambia cuando los datos cambian.

DEFINICIÓN — Algoritmo de aprendizaje (learning algorithm, learner)

Definición rigurosa. Caso particular del anterior: procedimiento que, aplicado a un conjunto de datos D = {(x₁, y₁), …, (xₙ, yₙ)} y a una configuración de hiperparámetros λ, selecciona un elemento ĥ de un espacio de hipótesis H según un criterio explícito evaluado sobre D. Formalmente, A : (D, λ) ⟼ ĥ ∈ H.

Traducción al lenguaje corriente. El método que, a partir de una tabla de ejemplos ya etiquetados, fabrica la regla de decisión. Describe cómo buscar, no lo que se encontrará. Tres elementos deben nombrarse para que quede especificado: el espacio de hipótesis recorrido (apartado 1.3), el criterio evaluado sobre los datos, y la estrategia de búsqueda (apartado 4.2).

Punto de vigilancia. El algoritmo es idéntico para todos los proyectos que lo emplean: RandomForestClassifier es el mismo para todos los usuarios de una versión dada de scikit-learn. Lo que difiere de un proyecto a otro es el modelo producido, nunca el algoritmo.

1.3 El espacio de hipótesis y el sesgo inductivo

DEFINICIÓN — Espacio de hipótesis (hypothesis space, H)

Definición rigurosa. Conjunto H de todas las funciones candidatas h : X → Y que el algoritmo es estructuralmente capaz de producir, designando X el espacio de las variables explicativas e Y el de la variable objetivo. H está determinado conjuntamente por la familia de funciones retenida y por los hiperparámetros que restringen su forma: fijar max_depth=3 no modifica el algoritmo, pero restringe H a los árboles de profundidad máxima 3.

Traducción al lenguaje corriente. El conjunto de todas las reglas que el método tiene derecho a fabricar: nunca producirá una regla ausente de ese conjunto, sea cual sea la cantidad de datos proporcionada. Para una regresión lineal con dos variables, H es el conjunto de las funciones h(x) = β₀ + β₁x₁ + β₂x₂, de cardinal infinito pero parametrizado por tres reales; ningún conjunto de datos permitirá producir en él una función escalonada o periódica.

Punto de vigilancia. Un modelo de bajo rendimiento lo es por dos razones distintas: la función correcta no pertenece a H (error de aproximación, ligado a la elección del algoritmo), o pertenece a él sin haber sido encontrada (error de estimación, ligado a los datos y a la optimización) — capítulo 032.

DEFINICIÓN — Sesgo inductivo (inductive bias)

Definición rigurosa (Mitchell, 1980). Conjunto de las hipótesis suplementarias, no deducibles de los datos de entrenamiento, que un algoritmo moviliza para preferir ciertas generalizaciones a otras entre las compatibles con los datos observados. Se manifiesta bajo dos formas: la restricción del espacio de hipótesis y la preferencia dentro de H, por ejemplo por la hipótesis más simple a igual rendimiento.

Traducción al lenguaje corriente. Un conjunto de ejemplos nunca determina una sola regla: una infinidad de reglas pasan por los mismos puntos. El sesgo inductivo es el conjunto de preferencias integradas en el método, que deciden entre esas reglas.

Resultado asociado (Wolpert, 1996 — No Free Lunch). Promediado sobre el conjunto de todos los problemas posibles, ningún algoritmo es superior a otro: su rendimiento sobre un problema dado proviene de la adecuación entre su sesgo inductivo y la estructura real del fenómeno. Elegir un algoritmo equivale por tanto a apostar sobre esa estructura (capítulo 049).

Punto de vigilancia. Un aprendizaje sin sesgo inductivo es imposible: un algoritmo desprovisto de toda preferencia no podría afirmar nada sobre una observación ausente del conjunto de entrenamiento.

1.4 Las principales familias de algoritmos

AlgoritmoEspacio de hipótesis HForma de una hipótesisSesgo inductivo principal
Regresión linealFunciones afines de XSuma ponderada de las variablesLinealidad y aditividad de los efectos
Regresión logísticaLogísticas de funciones afinesSigmoide de una combinación linealFrontera de decisión lineal
Árbol de decisión (CART)Particiones de X por cortes ortogonales a los ejesSucesión de tests de umbral, constante por hojaCortes paralelos a los ejes, preferencia por los árboles cortos
k vecinos más cercanosFunciones constantes por vecindadVoto o media localContinuidad local: dos observaciones próximas tienen objetivos próximos
Naive BayesDistribuciones condicionales factorizadasProducto de verosimilitudes por variableIndependencia condicional de las variables dada la clase
Perceptrón multicapaComposiciones de aplicaciones afines y de no linealidadesGrafo de cálculo por capasComposicionalidad y regularidad de las funciones representables

Lectura: cada fila describe una apuesta diferente sobre la estructura del fenómeno. Un efecto de umbral marcado será mal servido por una regresión lineal y bien servido por un árbol; un fenómeno aditivo y suave, lo contrario.


2. El modelo como artefacto parametrizado

2.1 Definición

DEFINICIÓN — Modelo (model, modelo entrenado, fitted model)

Definición rigurosa. Elemento ĥ ∈ H seleccionado por el algoritmo A al término de su ejecución sobre un conjunto de datos D con hiperparámetros λ. El modelo está enteramente especificado por dos componentes: una estructura — la forma funcional, fijada por A y λ — y un conjunto de valores de parámetros ajustado a partir de D.

Definición operativa. Artefacto de software que implementa una función determinista de las variables explicativas hacia el espacio de salida, cuyo comportamiento depende íntegramente del conjunto de datos sobre el que fue ajustado, y que puede ser serializado, versionado, transportado y evaluado independientemente del procedimiento que lo produjo.

Traducción al lenguaje corriente. El resultado del entrenamiento: una regla de decisión congelada, en memoria o en archivo, que responde a una pregunta precisa para una observación dada.

Punto de vigilancia. El modelo no es el archivo: este no es más que un soporte de serialización, al igual que una partitura no es la música. Un mismo modelo se exporta en joblib, en ONNX o en PMML sin cambiar de naturaleza.

2.2 Estructura y parámetros

Familia de modelosEstructura fijada por el algoritmo y λParámetros ajustados sobre los datosOrden de magnitud
Regresión lineal con p variablesUna ecuación afínp coeficientes y una constantep + 1
Regresión logística con p variablesUna ecuación afín compuesta con una logísticap coeficientes y una constantep + 1
Árbol de decisiónUn árbol binario de profundidad limitadaVariable y umbral de cada nodo, valor de cada hoja10¹ a 10³
Bosque aleatorio de 200 árboles200 árboles agregados por voto o mediaTodos los parámetros de los 200 árboles10⁴ a 10⁷
k vecinos más cercanosUna métrica y un entero kNinguno en sentido estricto: el conjunto de entrenamiento se memorizan × p valores almacenados
Perceptrón multicapaNúmero de capas, anchuras, activacionesPesos y sesgos de todas las conexiones10³ a 10¹¹

Punto de vigilancia — los k vecinos más cercanos. Este algoritmo no produce parámetros en el sentido usual: conserva las observaciones de entrenamiento y difiere todo cálculo al momento de la predicción (modelo perezoso, lazy learner). La definición del modelo como artefacto sigue siendo válida: la estructura es la regla de voto sobre los k vecinos, el contenido ajustado es el conjunto memorizado (capítulo 040).

La frontera entre lo que regula el humano y lo que se aprende es objeto del capítulo 009; el principio aquí es que los hiperparámetros definen H y que los parámetros designan el elemento retenido en H.

2.3 Lectura de un modelo en Python

En scikit-learn, los atributos cuyo nombre termina en un carácter de subrayado solo existen después del entrenamiento: su presencia es el criterio operativo que distingue un algoritmo instanciado de un modelo.

python
from sklearn.linear_model import LinearRegression

def appris(objet):
    return [a for a in dir(objet) if a.endswith("_") and not a.startswith("_")]

estimateur = LinearRegression()
print("Antes de fit — hiperparámetros      :", estimateur.get_params())
print("Antes de fit — atributos aprendidos :", appris(estimateur))
estimateur.fit(X, y)
print("Después de fit — atributos aprendidos :", appris(estimateur))
Antes de fit — hiperparámetros      : {'copy_X': True, 'fit_intercept': True,
                                       'n_jobs': None, 'positive': False, 'tol': 1e-06}
Antes de fit — atributos aprendidos : []
Después de fit — atributos aprendidos : ['coef_', 'feature_names_in_', 'intercept_',
                                         'n_features_in_', 'rank_', 'singular_']

Interpretación: antes de la llamada, el objeto materializa el algoritmo y el espacio de hipótesis, estando sus hiperparámetros informados y su conocimiento nulo. Después, coef_ e intercept_ llevan la información inducida de los datos, y n_features_in_ así como feature_names_in_ registran el esquema de entrada esperado (apartado 5.2). El mismo objeto desempeña sucesivamente dos roles: scikit-learn denomina estimator al objeto tanto antes como después del fit.


3. La distinción y sus consecuencias en producción

3.1 Tabla de distinción

CriterioAlgoritmo de aprendizajeModelo
NaturalezaUn procedimientoUn artefacto
Momento de existenciaAntes de todo datoDespués del entrenamiento
Dependencia de los datosNulaTotal
ContenidoInstruccionesUna estructura y valores de parámetros
Determinado porUna elección de diseño humanaLos datos de entrenamiento
Soporte materialCódigo, una biblioteca instaladaUn objeto en memoria, un archivo serializado
UnicidadUn algoritmo, numerosos modelosUn modelo para un entrenamiento fechado
Lo que se versionaUna dependencia de software (scikit-learn==1.8.0)Un entregable identificado (modele_attrition_v3.joblib)
Lo que se despliegaNo, salvo para reentrenar
EnvejecimientoPor obsolescencia de la bibliotecaPor deriva de la distribución de los datos (capítulo 082)

3.2 La analogía de la receta y el pastel

ANALOGÍA — La receta y el pastel

Una receta es un texto: no se come, no caduca, permanece idéntica sea cual sea el número de veces que se ejecute y se fotocopia sin pérdida. El pastel es un objeto: resulta de la ejecución de la receta sobre ingredientes precisos, en un horno regulado de cierta manera, un día dado. Dos pasteles procedentes de la misma receta difieren si los ingredientes difieren; el pastel se transporta, se fecha, caduca.

Elemento culinarioCorrespondiente en aprendizaje supervisadoJustificación
La receta escritaEl algoritmo de aprendizajeProcedimiento reproducible, independiente de toda ejecución
Los ingredientesEl conjunto de datos de entrenamientoMateria prima consumida por el procedimiento
El ajuste del horno y el tiempo de cocciónLos hiperparámetrosFijados antes de la ejecución, por un humano, no deducidos de la materia
El acto de cocciónEl entrenamientoEjecución del procedimiento sobre la materia prima
El pastel obtenidoEl modeloResultado único, fechado, dependiente íntegramente de los ingredientes
Una porción servida a un invitadoUna predicciónUso del resultado sobre un caso particular
Enviar la receta a un invitado hambrientoDesplegar el algoritmo en lugar del modeloEl invitado debería comprar los ingredientes y cocinar él mismo
El pastel envasado y entregadoEl modelo serializado y desplegadoLo que efectivamente se transmite al consumidor
Rehacer una hornada con ingredientes frescosEl reentrenamientoMisma receta, nueva materia, nuevo resultado

Límites de la analogía. El pastel es un objeto pasivo, mientras que el modelo es una función de entrada a salida (apartado 5.2); una porción consumida ya no está disponible, mientras que un modelo produce un número ilimitado de predicciones sin agotarse; por último, el pastel caduca por alteración física, mientras que el archivo de un modelo no se degrada — es la distribución de los datos de producción la que se aleja de la del entrenamiento (capítulo 082).

3.3 Un mismo algoritmo, dos conjuntos de datos, dos modelos

El código siguiente aplica un algoritmo único a dos conjuntos de datos que describen el mismo fenómeno — el precio de una vivienda según su superficie, su número de habitaciones y su antigüedad — en dos mercados inmobiliarios distintos.

Cada conjunto comprende 800 transacciones descritas por tres variables explicativas.

python
import pandas as pd
from sklearn.linear_model import LinearRegression

VARIABLES = ["surface_m2", "nb_pieces", "age_bien"]
lyon, nantes = pd.read_csv("marche_lyon.csv"), pd.read_csv("marche_nantes.csv")
X_lyon,   y_lyon   = lyon[VARIABLES],   lyon["prix"]
X_nantes, y_nantes = nantes[VARIABLES], nantes["prix"]

modele_lyon   = LinearRegression().fit(X_lyon,   y_lyon)
modele_nantes = LinearRegression().fit(X_nantes, y_nantes)
print("Misma clase de algoritmo :", type(modele_lyon) is type(modele_nantes))

for nom, m in [("LYON", modele_lyon), ("NANTES", modele_nantes)]:
    print(f"{nom:7s} constante = {m.intercept_:>10,.1f} | " +
          " | ".join(f"{v} = {c:,.1f}" for v, c in zip(X_lyon.columns, m.coef_)))

bien = pd.DataFrame([{"surface_m2": 85, "nb_pieces": 4, "age_bien": 12}])
print("Predicción Lyon   :", round(float(modele_lyon.predict(bien)[0]), 1))
print("Predicción Nantes :", round(float(modele_nantes.predict(bien)[0]), 1))
Misma clase de algoritmo : True
LYON    constante =   43,617.1 | surface_m2 = 3,201.6 | nb_pieces = 8,090.7 | age_bien = -878.3
NANTES  constante =   30,521.4 | surface_m2 = 1,904.5 | nb_pieces = 4,658.9 | age_bien = -1,473.9
Predicción Lyon   : 337575.3
Predicción Nantes : 193349.8

Interpretación. Una sola clase de algoritmo ha sido instanciada, sin modificar ningún hiperparámetro. Los dos objetos comparten el mismo tipo y la misma estructura — una ecuación afín con tres variables — y difieren únicamente por los valores de sus cuatro parámetros, procedentes íntegramente de los datos. La diferencia es de naturaleza de negocio: el modelo lionés valora el metro cuadrado en unos 3 200 unidades monetarias, el nantés en unos 1 900, y la depreciación ligada a la antigüedad es cerca de 1,7 veces más fuerte en el segundo mercado. Interrogados sobre el mismo inmueble, responden 337 575 y 193 350: ninguno se equivoca, codifican dos mercados diferentes.

Consecuencia directa: «utilizamos una regresión lineal» no identifica un sistema de predicción, sino que nombra el sesgo inductivo retenido. El sistema está identificado por el par (modelo, conjunto de entrenamiento), fechado.

3.4 Lo que efectivamente se despliega

El modelo en sentido estricto — estructura y parámetros del estimador final — no basta para producir una predicción en producción. Una observación bruta debe sufrir exactamente las mismas transformaciones que los datos de entrenamiento: imputación con los mismos valores de reemplazo, codificación con las mismas modalidades de referencia, escalado con las mismas medias y desviaciones típicas. Estas transformaciones comportan a su vez parámetros ajustados sobre el entrenamiento: forman parte de lo que se aprende y deben serializarse con el estimador.

DEFINICIÓN — Serialización de un modelo

Definición rigurosa. Conversión del estado completo de un objeto en memoria — estructura y valores de parámetros — en una secuencia de bytes persistente, que permite su reconstitución posterior en un proceso distinto con un comportamiento funcionalmente idéntico.

Traducción al lenguaje corriente. Guardar el modelo en un archivo de manera que pueda recargarse más tarde, en otro lugar, sin tener que reentrenarlo. Los formatos usuales son joblib y pickle (ecosistema Python, dependientes de las versiones), ONNX (interoperable entre lenguajes y motores de ejecución), PMML (estándar XML, familias de modelos limitadas) y los formatos nativos de biblioteca, como Booster.save_model para XGBoost y LightGBM.

Punto de vigilancia. Un archivo joblib o pickle reconstruye objetos Python arbitrarios en la lectura: cargarlo sin dominar su procedencia equivale a ejecutar código no verificado. Por otra parte, la deserialización bajo una versión de biblioteca diferente no está garantizada: la versión debe registrarse en los metadatos y verificarse en la carga.

python
import os, joblib, sklearn, numpy as np
from sklearn.compose import ColumnTransformer
from sklearn.ensemble import RandomForestClassifier
from sklearn.impute import SimpleImputer
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import OneHotEncoder, StandardScaler

num = ["anciennete_mois", "facture_mensuelle", "nb_appels_support"]
cat = ["type_forfait"]

pipeline = Pipeline([
    ("preparation", ColumnTransformer([
        ("num", Pipeline([("imputation", SimpleImputer(strategy="median")),
                          ("mise_a_echelle", StandardScaler())]), num),
        ("cat", OneHotEncoder(handle_unknown="ignore"), cat)])),
    ("modele", RandomForestClassifier(n_estimators=200, max_depth=8,
                                      random_state=42))]).fit(df, y)

artefact = {"pipeline": pipeline, "version_sklearn": sklearn.__version__,
            "colonnes_attendues": num + cat, "seuil_decision": 0.42,
            "date_entrainement": "2026-08-22"}
joblib.dump(artefact, "modele_attrition_v3.joblib", compress=3)
print("Tamaño :", round(os.path.getsize("modele_attrition_v3.joblib")/1024, 1), "KB")

recharge   = joblib.load("modele_attrition_v3.joblib")
p_memoire  = pipeline.predict_proba(df.head(5))[:, 1]
p_recharge = recharge["pipeline"].predict_proba(df.head(5))[:, 1]
print("Probabilidades recargadas :", np.round(p_recharge, 4))
print("Identidad estricta :", np.array_equal(p_memoire, p_recharge))
print("Versión y umbral :", recharge["version_sklearn"], recharge["seuil_decision"])
Tamaño : 1242.5 KB
Probabilidades recargadas : [0.0678 0.0711 0.0735 0.2408 0.0108]
Identidad estricta : True
Versión y umbral : 1.8.0 0.42

Interpretación. El archivo pesa 1,2 MB mientras que el conjunto de entrenamiento solo comprende algunos miles de filas: ese volumen es el de los 200 árboles, es decir, de los parámetros aprendidos, y depende de la estructura retenida, no del volumen de datos. La recarga restituye probabilidades estrictamente idénticas: un modelo es determinista, y toda variación observada en producción sin reentrenamiento señala una diferencia en las entradas o el entorno de ejecución, nunca en el modelo. Por último, el artefacto no se reduce al pipeline: el umbral de decisión (capítulo 062) es una decisión de negocio exterior a los parámetros, y la versión de la biblioteca así como la lista ordenada de las columnas condicionan la validez de la carga.


4. El entrenamiento como procedimiento de selección

4.1 Definición

DEFINICIÓN — Entrenamiento (training, aprendizaje, ajuste, fit)

Definición rigurosa. Ejecución del algoritmo A sobre un conjunto de datos D con hiperparámetros λ, consistente en seleccionar en H la hipótesis ĥ que optimiza un criterio explícito evaluado sobre D, eventualmente acompañado de un término de regularización:

ĥ = argmin sobre h ∈ H de [ (1/n) · Σᵢ L(h(xᵢ), yᵢ) + Ω(h) ]

donde L designa la función de coste y Ω un término que penaliza la complejidad de la hipótesis. Este marco es el de la minimización del riesgo empírico (Vapnik). La cantidad minimizada se mide sobre la muestra de entrenamiento, no sobre la población: esa diferencia es el origen del sobreajuste (capítulo 031).

Traducción al lenguaje corriente. La fase de estudio: el algoritmo recorre los ejemplos corregidos, ajusta sus parámetros para equivocarse lo menos posible sobre esos ejemplos, y se detiene cuando el criterio ya no mejora significativamente.

Lo que el entrenamiento no hace. No modifica los hiperparámetros, que permanecen tal como se proporcionaron; no acumula las llamadas sucesivas, pues un segundo fit sobrescribe íntegramente el estado anterior salvo que se recurra a partial_fit o warm_start; no evalúa el modelo producido, pues la evaluación exige datos no vistos.

Punto de vigilancia. El criterio optimizado durante el entrenamiento (la función de coste) y el criterio de evaluación de negocio (la métrica) son distintos y coinciden raramente (capítulo 030).

4.2 Las tres componentes de un procedimiento de entrenamiento

Modificar una de estas tres componentes produce un modelo diferente, a conjunto de datos constante.

4.3 Formas de búsqueda y reproducibilidad

AlgoritmoEstrategia de búsqueda en HDeterminismo a datos constantes
Regresión lineal (mínimos cuadrados)Solución analítica o descomposición matricial
Regresión logísticaOptimización numérica convexa iterativaSí, con solver y tolerancia fijados
Árbol de decisiónBúsqueda voraz, corte óptimo local por nodoSí si no hay sorteo aleatorio de variables
Bosque aleatorioÁrboles construidos sobre muestras y subespacios sorteados al azarNo, salvo semilla fijada
Gradient boostingAdición secuencial de aprendices que corrigen los residuosNo, salvo semilla fijada
k vecinos más cercanosNinguna búsqueda: memorización del conjunto de entrenamiento
Perceptrón multicapaDescenso de gradiente estocástico por retropropagaciónNo, salvo semilla fijada y ejecución determinista impuesta

Punto de vigilancia: para los algoritmos marcados «No», dos entrenamientos sucesivos sobre el mismo conjunto con los mismos hiperparámetros producen dos modelos diferentes. La fijación de una semilla (random_state) condiciona la reproducibilidad del entregable y debe figurar en los metadatos.


5. La predicción y la inferencia

5.1 Definición

DEFINICIÓN — Predicción (prediction, scoring)

Definición rigurosa. Evaluación de la función ĥ en un punto x del espacio de las variables explicativas, produciendo un valor ŷ = ĥ(x) del espacio de salida. La observación x no pertenece necesariamente al conjunto de entrenamiento; el interés operativo reside precisamente en el caso en que no pertenece a él.

Traducción al lenguaje corriente. Dar una respuesta para un caso nuevo, aplicando la regla aprendida. La convención distingue y, valor real observado, y ŷ, valor producido por el modelo; su diferencia es el residuo (capítulo 066).

Punto de vigilancia. El término no comporta ninguna connotación temporal. Un modelo que diagnostica una patología sobre datos presentes produce una predicción en sentido técnico, aunque ningún futuro esté en juego.

5.2 El modelo como función de entrada a salida

Tres propiedades caracterizan esta función. Determinismo: dos llamadas con la misma entrada producen la misma salida, pues el modelo no comporta ningún elemento aleatorio en la predicción aunque su entrenamiento lo tuviera. Ausencia de estado: una predicción no modifica el modelo, y la adaptación a datos nuevos exige un reentrenamiento, operación distinta. Cierre sobre su esquema de entrada: el modelo solo acepta entradas conformes al esquema registrado en el entrenamiento — mismas variables, mismo orden, mismos tipos, mismas modalidades categóricas conocidas, y transformaciones aplicadas con los parámetros aprendidos sobre el entrenamiento, no recalculados (capítulo 028).

Punto de vigilancia: el modo de fallo más costoso no es el error de ejecución, que es visible, sino la predicción producida sin error a partir de una entrada mal transformada. Un pipeline único serializado, en lugar de una sucesión de etapas reproducidas manualmente en producción, elimina esta clase de fallo por construcción (capítulos 076 a 079).

5.3 Las formas de salida

LlamadaSalida producidaFormaDisponibilidad
predict(X)Clase predicha o valor numéricoVector de longitud nTodos los estimadores supervisados
predict_proba(X)Probabilidades estimadas por claseMatriz n × K, filas de suma 1Clasificadores con salida probabilística
decision_function(X)Puntuación no acotada, no calibradaVector de longitud nModelos de margen, SVM y modelos lineales
transform(X)Representación transformada de las entradasMatriz n × p′Transformadores, no estimadores finales

Punto de vigilancia: predict aplica por defecto un umbral de 0,5 sobre la probabilidad estimada. Ese umbral es una convención de implementación, no un óptimo; su revisión es una palanca mayor (capítulos 062 y 029).

5.4 Inferencia en el sentido del Machine Learning y en el sentido estadístico

DEFINICIÓN — Inferencia: dos acepciones distintas

Acepción 1 — inferencia en el sentido del Machine Learning (inference, serving). Operación consistente en evaluar un modelo entrenado sobre datos nuevos para producir predicciones. Sinónimo de predicción, el término se opone al entrenamiento y domina el vocabulario de la ingeniería de producción: inference server, inference latency, batch inference.

Acepción 2 — inferencia en el sentido estadístico (statistical inference). Enfoque consistente en estimar las características de una población a partir de una muestra y en cuantificar la incertidumbre asociada: estimación puntual, intervalo de confianza, test de hipótesis, significatividad. Tradición de Fisher, Neyman y Pearson.

Origen de la ambigüedad. Las dos comunidades emplean la misma palabra para operaciones cuyos objetos se oponen: una observación individual por un lado, un parámetro de población por el otro. La distinción la desarrollan Breiman (2001, Statistical Modeling: The Two Cultures) y Shmueli (2010, To Explain or to Predict?).

Punto de vigilancia. Un modelo muy eficaz en predicción no proporciona ninguna garantía inferencial: un coeficiente alto no establece ni la significatividad del efecto, ni su dirección causal (capítulo 016).

CriterioInferencia en el sentido MLInferencia en el sentido estadístico
Objeto buscadoUna observación individualUn parámetro de población
Pregunta planteada¿Qué valor para este caso preciso?¿Cuál es el valor de θ en la población, y con qué incertidumbre?
Salida producidaUna predicción ŷUna estimación, un intervalo de confianza, una decisión de test
Criterio de calidadError de generalización sobre datos no vistosPropiedades del estimador: sesgo, convergencia, cobertura
Hipótesis movilizadasObservaciones i.i.d., estabilidad de la distribuciónModelo generativo especificado, condiciones de regularidad
Contexto de empleoIngeniería, producción, MLOpsEstadística, epidemiología, econometría

Recomendación de formulación: emplear «producir una predicción» o «servir el modelo» para la primera acepción, y nombrar explícitamente «inferencia estadística» la segunda.

6. El ciclo completo, del conjunto de datos al modelo serializado

EtapaEntrada consumidaArtefacto producidoCapítulo
EncuadreUna pregunta de negocioTarea T y métrica P explicitadas012
Constitución del conjunto de datosFuentes operativasConjunto de datos etiquetado X, y005 a 007
SeparaciónConjunto completoSubconjuntos entrenamiento, validación, test026, 027
Preparación ajustadaXtrainX_{\mathrm{train}}Transformadores ajustados022, 023
Elección del algoritmoNaturaleza del problema y restriccionesEspacio H y sesgo inductivo retenidos049
Selección de los hiperparámetrosEntrenamiento y validaciónConfiguración λ retenida034, 035
Entrenamiento finalXtrainX_{\mathrm{train}}, ytrainy_{\mathrm{train}}Modelo ĥ029
EvaluaciónXtestX_{\mathrm{test}}, ytesty_{\mathrm{test}}Medidas de rendimiento en generalización052 a 075
SerializaciónPipeline completo y metadatosArchivo de artefacto versionado081
ServicioObservaciones de producciónPredicciones081
SupervisiónFlujo de producciónAlertas de deriva, decisión de reentrenamiento082

Lectura del ciclo. Aparecen dos bucles de naturaleza diferente. El bucle corto, entre selección de los hiperparámetros y entrenamiento, explora varios espacios de hipótesis durante el desarrollo. El bucle largo, de la supervisión hacia el conjunto de datos, se desencadena por la degradación del rendimiento en producción: reejecuta el mismo algoritmo sobre datos actualizados para producir un nuevo modelo, versionado de forma distinta. Reentrenar no consiste nunca, por tanto, en modificar el algoritmo, sino en producir un nuevo artefacto.


7. Errores de razonamiento frecuentes

ERROR — Decir «hemos desplegado un Random Forest»

Lo que se despliega es un artefacto — estructura y valores de parámetros — procedente de la ejecución del algoritmo Random Forest sobre un conjunto de datos determinado, en una fecha determinada. El algoritmo reside en la biblioteca instalada.

Formulación correcta: «Hemos desplegado el modelo attrition_v3, obtenido por entrenamiento de un bosque aleatorio sobre los datos de enero a junio.»

ERROR — Atribuir el aprendizaje al algoritmo

El algoritmo ejecuta un procedimiento de búsqueda y no conserva nada al término de su ejecución; el conocimiento inducido reside en los parámetros del modelo producido.

Formulación correcta: «El algoritmo ha seleccionado, en el espacio de hipótesis, un modelo cuyos coeficientes indican una asociación negativa entre antigüedad y cancelación.»

ERROR — Confundir reentrenar y reprogramar

Reentrenar consiste en reejecutar el mismo algoritmo, con los mismos hiperparámetros, sobre datos actualizados: ninguna línea de código se modifica. La confusión lleva a subestimar el coste real del ciclo de mantenimiento.

Formulación correcta: «El reentrenamiento mensual produce una nueva versión del modelo sin modificación del código de entrenamiento.»

ERROR — Serializar el estimador sin su pipeline de preparación

Las transformaciones de preparación comportan parámetros aprendidos sobre los datos de entrenamiento: medianas de imputación, modalidades de codificación, medias y desviaciones típicas. Un estimador serializado solo, alimentado por transformaciones reimplementadas manualmente, produce predicciones falsas sin error visible.

Formulación correcta: «El artefacto serializado es el pipeline completo, del dato bruto a la predicción, acompañado de sus metadatos.»

ERROR — Emplear «inferencia» sin precisar la acepción

El término designa, según la comunidad, la producción de una predicción sobre una observación o la estimación de un parámetro de población acompañada de una medida de incertidumbre: ni el mismo objeto, ni los mismos criterios de validez.

Formulación correcta: «El servidor de inferencia produce predicciones. Las conclusiones relativas a la población pertenecerían a una inferencia estadística, que este dispositivo no proporciona.»


8. Síntesis

LOS DOS OBJETOS
    ALGORITMO DE APRENDIZAJE — un procedimiento.  A : (D, λ) → ĥ ∈ H
        Existe antes de los datos, no contiene ningún conocimiento,
        versionado como una dependencia de software.
    MODELO — un artefacto.  Estructura fijada por A y λ,
        parámetros ajustados sobre D. Solo existe tras el entrenamiento,
        depende íntegramente de D, versionado como un entregable fechado.

LAS TRES COMPONENTES DE UN ALGORITMO DE APRENDIZAJE
    1. Un espacio de hipótesis H     qué reglas son candidatas
    2. Un criterio de optimización   cómo medir su calidad sobre D
    3. Una estrategia de búsqueda    cómo recorrer H

SESGO INDUCTIVO (Mitchell, 1980)
    Las preferencias no deducidas de los datos que permiten elegir
    una generalización entre las compatibles con D. Sin sesgo,
    ninguna generalización es posible. No Free Lunch (Wolpert, 1996):
    ningún sesgo es universalmente superior; elegir un algoritmo
    es apostar sobre la forma del fenómeno.

LAS DOS OPERACIONES
    ENTRENAMIENTO  D, λ → ĥ         selección en H
    PREDICCIÓN     x    → ŷ = ĥ(x)  evaluación de una función

EL MODELO COMO FUNCIÓN
    ENTRADA (variables) → [ MODELO ] → SALIDA (predicción)
    determinista · sin estado · cerrado sobre su esquema de entrada

ANALOGÍA CULINARIA
    receta → algoritmo            ingredientes → conjunto de entrenamiento
    horno  → hiperparámetros      cocción      → entrenamiento
    pastel → modelo               porción servida → predicción
    pastel envasado y entregado   → artefacto serializado desplegado

DOS SENTIDOS DE LA PALABRA INFERENCIA
    Sentido ML          producir una predicción para una observación
    Sentido estadístico estimar un parámetro de población con
                        cuantificación de la incertidumbre

LO QUE EFECTIVAMENTE SE DESPLIEGA
    No el estimador solo, sino el pipeline completo (imputación,
    codificación, escalado, estimador) y sus metadatos:
    versión de biblioteca, esquema de entrada, umbral de decisión,
    semilla aleatoria, fecha, perímetro de validez.

EL TEST DE VOCABULARIO
    «El procedimiento» sustituye al término → el algoritmo.
    «El archivo entrenado» sustituye         → el modelo.

Enunciado de síntesis

El algoritmo de aprendizaje es un procedimiento que, a partir de un conjunto de datos y de hiperparámetros, selecciona en un espacio de hipótesis la regla que optimiza un criterio; el modelo es esa regla una vez seleccionada, artefacto compuesto de una estructura y de parámetros ajustados, dependiente íntegramente de los datos que lo produjeron; el entrenamiento es la operación de selección, la predicción es la evaluación de la función obtenida sobre una observación nueva, y lo que se versiona, serializa y despliega en producción no es nunca el algoritmo sino el modelo acompañado de su pipeline de preparación y de sus metadatos.


Quiz asociados

  • 008.1-quiz-algorithme-apprentissage.md
  • 008.2-quiz-modele-artefact.md
  • 008.3-quiz-distinction-production.md
  • 008.4-quiz-entrainement.md
  • 008.5-quiz-prediction-inference.md
  • 008.6-quiz-cycle-complet.md

Capítulo siguiente: 009-parametres-hyperparametres.md