Los cuatro enunciados siguientes se encuentran corrientemente en informes de proyecto. Tres son incorrectos.
| Enunciado | Estatus | Motivo |
|---|---|---|
| «Hemos entrenado un Random Forest sobre 40 000 observaciones.» | Aceptable | Elipsis admitida: entrenar con el algoritmo Random Forest |
| «El algoritmo predice una probabilidad de cancelación de 0,72.» | Incorrecto | Un algoritmo no predice; el modelo produce la predicción |
| «Hemos desplegado un XGBoost en producción.» | Incorrecto | Lo que se despliega es un modelo procedente de XGBoost, no la biblioteca |
| «El algoritmo ha aprendido que la antigüedad reduce el riesgo.» | Incorrecto | El algoritmo ejecuta un procedimiento; la información aprendida reside en los parámetros del modelo |
La diferencia no es puramente léxica: lo que se versiona, lo que es reproducible, lo que debe reejecutarse cuando los datos evolucionan y lo que se transmite a explotación no son los mismos objetos según se hable del algoritmo o del modelo (apartado 3).
Definición rigurosa. Sucesión finita y no ambigua de operaciones elementales que permite, a partir de entradas pertenecientes a un dominio especificado, producir una salida en un número finito de etapas. La caracterización clásica retiene cinco propiedades (Knuth, The Art of Computer Programming, 1968): finitud, definición no ambigua de cada etapa, entradas especificadas, salidas especificadas, efectividad de las operaciones.
Traducción al lenguaje corriente. Un método escrito de una vez por todas, que describe lo que hay que hacer y en qué orden, independientemente de los valores sobre los que se ejecutará.
Punto de vigilancia. Un algoritmo es una descripción de procedimiento: no tiene estado, no contiene ningún conocimiento sobre un dominio particular y no cambia cuando los datos cambian.
Definición rigurosa. Caso particular del anterior: procedimiento que, aplicado a un conjunto de datos D = {(x₁, y₁), …, (xₙ, yₙ)} y a una configuración de hiperparámetros λ, selecciona un elemento ĥ de un espacio de hipótesis H según un criterio explícito evaluado sobre D. Formalmente, A : (D, λ) ⟼ ĥ ∈ H.
Traducción al lenguaje corriente. El método que, a partir de una tabla de ejemplos ya etiquetados, fabrica la regla de decisión. Describe cómo buscar, no lo que se encontrará. Tres elementos deben nombrarse para que quede especificado: el espacio de hipótesis recorrido (apartado 1.3), el criterio evaluado sobre los datos, y la estrategia de búsqueda (apartado 4.2).
Punto de vigilancia. El algoritmo es idéntico para todos los proyectos que
lo emplean: RandomForestClassifier es el mismo para todos los usuarios de una
versión dada de scikit-learn. Lo que difiere de un proyecto a otro es el modelo
producido, nunca el algoritmo.
Definición rigurosa. Conjunto H de todas las funciones candidatas
h : X → Y que el algoritmo es estructuralmente capaz de producir, designando X
el espacio de las variables explicativas e Y el de la variable objetivo. H está
determinado conjuntamente por la familia de funciones retenida y por los
hiperparámetros que restringen su forma: fijar max_depth=3 no modifica
el algoritmo, pero restringe H a los árboles de profundidad máxima 3.
Traducción al lenguaje corriente. El conjunto de todas las reglas que el método tiene derecho a fabricar: nunca producirá una regla ausente de ese conjunto, sea cual sea la cantidad de datos proporcionada. Para una regresión lineal con dos variables, H es el conjunto de las funciones h(x) = β₀ + β₁x₁ + β₂x₂, de cardinal infinito pero parametrizado por tres reales; ningún conjunto de datos permitirá producir en él una función escalonada o periódica.
Punto de vigilancia. Un modelo de bajo rendimiento lo es por dos razones distintas: la función correcta no pertenece a H (error de aproximación, ligado a la elección del algoritmo), o pertenece a él sin haber sido encontrada (error de estimación, ligado a los datos y a la optimización) — capítulo 032.
Definición rigurosa (Mitchell, 1980). Conjunto de las hipótesis suplementarias, no deducibles de los datos de entrenamiento, que un algoritmo moviliza para preferir ciertas generalizaciones a otras entre las compatibles con los datos observados. Se manifiesta bajo dos formas: la restricción del espacio de hipótesis y la preferencia dentro de H, por ejemplo por la hipótesis más simple a igual rendimiento.
Traducción al lenguaje corriente. Un conjunto de ejemplos nunca determina una sola regla: una infinidad de reglas pasan por los mismos puntos. El sesgo inductivo es el conjunto de preferencias integradas en el método, que deciden entre esas reglas.
Resultado asociado (Wolpert, 1996 — No Free Lunch). Promediado sobre el conjunto de todos los problemas posibles, ningún algoritmo es superior a otro: su rendimiento sobre un problema dado proviene de la adecuación entre su sesgo inductivo y la estructura real del fenómeno. Elegir un algoritmo equivale por tanto a apostar sobre esa estructura (capítulo 049).
Punto de vigilancia. Un aprendizaje sin sesgo inductivo es imposible: un algoritmo desprovisto de toda preferencia no podría afirmar nada sobre una observación ausente del conjunto de entrenamiento.
| Algoritmo | Espacio de hipótesis H | Forma de una hipótesis | Sesgo inductivo principal |
|---|---|---|---|
| Regresión lineal | Funciones afines de X | Suma ponderada de las variables | Linealidad y aditividad de los efectos |
| Regresión logística | Logísticas de funciones afines | Sigmoide de una combinación lineal | Frontera de decisión lineal |
| Árbol de decisión (CART) | Particiones de X por cortes ortogonales a los ejes | Sucesión de tests de umbral, constante por hoja | Cortes paralelos a los ejes, preferencia por los árboles cortos |
| k vecinos más cercanos | Funciones constantes por vecindad | Voto o media local | Continuidad local: dos observaciones próximas tienen objetivos próximos |
| Naive Bayes | Distribuciones condicionales factorizadas | Producto de verosimilitudes por variable | Independencia condicional de las variables dada la clase |
| Perceptrón multicapa | Composiciones de aplicaciones afines y de no linealidades | Grafo de cálculo por capas | Composicionalidad y regularidad de las funciones representables |
Lectura: cada fila describe una apuesta diferente sobre la estructura del fenómeno. Un efecto de umbral marcado será mal servido por una regresión lineal y bien servido por un árbol; un fenómeno aditivo y suave, lo contrario.
Definición rigurosa. Elemento ĥ ∈ H seleccionado por el algoritmo A al término de su ejecución sobre un conjunto de datos D con hiperparámetros λ. El modelo está enteramente especificado por dos componentes: una estructura — la forma funcional, fijada por A y λ — y un conjunto de valores de parámetros ajustado a partir de D.
Definición operativa. Artefacto de software que implementa una función determinista de las variables explicativas hacia el espacio de salida, cuyo comportamiento depende íntegramente del conjunto de datos sobre el que fue ajustado, y que puede ser serializado, versionado, transportado y evaluado independientemente del procedimiento que lo produjo.
Traducción al lenguaje corriente. El resultado del entrenamiento: una regla de decisión congelada, en memoria o en archivo, que responde a una pregunta precisa para una observación dada.
Punto de vigilancia. El modelo no es el archivo: este no es más que un
soporte de serialización, al igual que una partitura no es la música. Un
mismo modelo se exporta en joblib, en ONNX o en PMML sin cambiar de naturaleza.
| Familia de modelos | Estructura fijada por el algoritmo y λ | Parámetros ajustados sobre los datos | Orden de magnitud |
|---|---|---|---|
| Regresión lineal con p variables | Una ecuación afín | p coeficientes y una constante | p + 1 |
| Regresión logística con p variables | Una ecuación afín compuesta con una logística | p coeficientes y una constante | p + 1 |
| Árbol de decisión | Un árbol binario de profundidad limitada | Variable y umbral de cada nodo, valor de cada hoja | 10¹ a 10³ |
| Bosque aleatorio de 200 árboles | 200 árboles agregados por voto o media | Todos los parámetros de los 200 árboles | 10⁴ a 10⁷ |
| k vecinos más cercanos | Una métrica y un entero k | Ninguno en sentido estricto: el conjunto de entrenamiento se memoriza | n × p valores almacenados |
| Perceptrón multicapa | Número de capas, anchuras, activaciones | Pesos y sesgos de todas las conexiones | 10³ a 10¹¹ |
Punto de vigilancia — los k vecinos más cercanos. Este algoritmo no produce parámetros en el sentido usual: conserva las observaciones de entrenamiento y difiere todo cálculo al momento de la predicción (modelo perezoso, lazy learner). La definición del modelo como artefacto sigue siendo válida: la estructura es la regla de voto sobre los k vecinos, el contenido ajustado es el conjunto memorizado (capítulo 040).
La frontera entre lo que regula el humano y lo que se aprende es objeto del capítulo 009; el principio aquí es que los hiperparámetros definen H y que los parámetros designan el elemento retenido en H.
En scikit-learn, los atributos cuyo nombre termina en un carácter de subrayado solo existen después del entrenamiento: su presencia es el criterio operativo que distingue un algoritmo instanciado de un modelo.
from sklearn.linear_model import LinearRegression
def appris(objet):
return [a for a in dir(objet) if a.endswith("_") and not a.startswith("_")]
estimateur = LinearRegression()
print("Antes de fit — hiperparámetros :", estimateur.get_params())
print("Antes de fit — atributos aprendidos :", appris(estimateur))
estimateur.fit(X, y)
print("Después de fit — atributos aprendidos :", appris(estimateur))Antes de fit — hiperparámetros : {'copy_X': True, 'fit_intercept': True,
'n_jobs': None, 'positive': False, 'tol': 1e-06}
Antes de fit — atributos aprendidos : []
Después de fit — atributos aprendidos : ['coef_', 'feature_names_in_', 'intercept_',
'n_features_in_', 'rank_', 'singular_']Interpretación: antes de la llamada, el objeto materializa el algoritmo y el espacio
de hipótesis, estando sus hiperparámetros informados y su conocimiento nulo. Después,
coef_ e intercept_ llevan la información inducida de los datos, y
n_features_in_ así como feature_names_in_ registran el esquema de entrada esperado
(apartado 5.2). El mismo objeto desempeña sucesivamente dos roles: scikit-learn denomina
estimator al objeto tanto antes como después del fit.
| Criterio | Algoritmo de aprendizaje | Modelo |
|---|---|---|
| Naturaleza | Un procedimiento | Un artefacto |
| Momento de existencia | Antes de todo dato | Después del entrenamiento |
| Dependencia de los datos | Nula | Total |
| Contenido | Instrucciones | Una estructura y valores de parámetros |
| Determinado por | Una elección de diseño humana | Los datos de entrenamiento |
| Soporte material | Código, una biblioteca instalada | Un objeto en memoria, un archivo serializado |
| Unicidad | Un algoritmo, numerosos modelos | Un modelo para un entrenamiento fechado |
| Lo que se versiona | Una dependencia de software (scikit-learn==1.8.0) | Un entregable identificado (modele_attrition_v3.joblib) |
| Lo que se despliega | No, salvo para reentrenar | Sí |
| Envejecimiento | Por obsolescencia de la biblioteca | Por deriva de la distribución de los datos (capítulo 082) |
Una receta es un texto: no se come, no caduca, permanece idéntica sea cual sea el número de veces que se ejecute y se fotocopia sin pérdida. El pastel es un objeto: resulta de la ejecución de la receta sobre ingredientes precisos, en un horno regulado de cierta manera, un día dado. Dos pasteles procedentes de la misma receta difieren si los ingredientes difieren; el pastel se transporta, se fecha, caduca.
| Elemento culinario | Correspondiente en aprendizaje supervisado | Justificación |
|---|---|---|
| La receta escrita | El algoritmo de aprendizaje | Procedimiento reproducible, independiente de toda ejecución |
| Los ingredientes | El conjunto de datos de entrenamiento | Materia prima consumida por el procedimiento |
| El ajuste del horno y el tiempo de cocción | Los hiperparámetros | Fijados antes de la ejecución, por un humano, no deducidos de la materia |
| El acto de cocción | El entrenamiento | Ejecución del procedimiento sobre la materia prima |
| El pastel obtenido | El modelo | Resultado único, fechado, dependiente íntegramente de los ingredientes |
| Una porción servida a un invitado | Una predicción | Uso del resultado sobre un caso particular |
| Enviar la receta a un invitado hambriento | Desplegar el algoritmo en lugar del modelo | El invitado debería comprar los ingredientes y cocinar él mismo |
| El pastel envasado y entregado | El modelo serializado y desplegado | Lo que efectivamente se transmite al consumidor |
| Rehacer una hornada con ingredientes frescos | El reentrenamiento | Misma receta, nueva materia, nuevo resultado |
Límites de la analogía. El pastel es un objeto pasivo, mientras que el modelo es una función de entrada a salida (apartado 5.2); una porción consumida ya no está disponible, mientras que un modelo produce un número ilimitado de predicciones sin agotarse; por último, el pastel caduca por alteración física, mientras que el archivo de un modelo no se degrada — es la distribución de los datos de producción la que se aleja de la del entrenamiento (capítulo 082).
El código siguiente aplica un algoritmo único a dos conjuntos de datos que describen el mismo fenómeno — el precio de una vivienda según su superficie, su número de habitaciones y su antigüedad — en dos mercados inmobiliarios distintos.
Cada conjunto comprende 800 transacciones descritas por tres variables explicativas.
import pandas as pd
from sklearn.linear_model import LinearRegression
VARIABLES = ["surface_m2", "nb_pieces", "age_bien"]
lyon, nantes = pd.read_csv("marche_lyon.csv"), pd.read_csv("marche_nantes.csv")
X_lyon, y_lyon = lyon[VARIABLES], lyon["prix"]
X_nantes, y_nantes = nantes[VARIABLES], nantes["prix"]
modele_lyon = LinearRegression().fit(X_lyon, y_lyon)
modele_nantes = LinearRegression().fit(X_nantes, y_nantes)
print("Misma clase de algoritmo :", type(modele_lyon) is type(modele_nantes))
for nom, m in [("LYON", modele_lyon), ("NANTES", modele_nantes)]:
print(f"{nom:7s} constante = {m.intercept_:>10,.1f} | " +
" | ".join(f"{v} = {c:,.1f}" for v, c in zip(X_lyon.columns, m.coef_)))
bien = pd.DataFrame([{"surface_m2": 85, "nb_pieces": 4, "age_bien": 12}])
print("Predicción Lyon :", round(float(modele_lyon.predict(bien)[0]), 1))
print("Predicción Nantes :", round(float(modele_nantes.predict(bien)[0]), 1))Misma clase de algoritmo : True
LYON constante = 43,617.1 | surface_m2 = 3,201.6 | nb_pieces = 8,090.7 | age_bien = -878.3
NANTES constante = 30,521.4 | surface_m2 = 1,904.5 | nb_pieces = 4,658.9 | age_bien = -1,473.9
Predicción Lyon : 337575.3
Predicción Nantes : 193349.8Interpretación. Una sola clase de algoritmo ha sido instanciada, sin modificar ningún hiperparámetro. Los dos objetos comparten el mismo tipo y la misma estructura — una ecuación afín con tres variables — y difieren únicamente por los valores de sus cuatro parámetros, procedentes íntegramente de los datos. La diferencia es de naturaleza de negocio: el modelo lionés valora el metro cuadrado en unos 3 200 unidades monetarias, el nantés en unos 1 900, y la depreciación ligada a la antigüedad es cerca de 1,7 veces más fuerte en el segundo mercado. Interrogados sobre el mismo inmueble, responden 337 575 y 193 350: ninguno se equivoca, codifican dos mercados diferentes.
Consecuencia directa: «utilizamos una regresión lineal» no identifica un sistema de predicción, sino que nombra el sesgo inductivo retenido. El sistema está identificado por el par (modelo, conjunto de entrenamiento), fechado.
El modelo en sentido estricto — estructura y parámetros del estimador final — no basta para producir una predicción en producción. Una observación bruta debe sufrir exactamente las mismas transformaciones que los datos de entrenamiento: imputación con los mismos valores de reemplazo, codificación con las mismas modalidades de referencia, escalado con las mismas medias y desviaciones típicas. Estas transformaciones comportan a su vez parámetros ajustados sobre el entrenamiento: forman parte de lo que se aprende y deben serializarse con el estimador.
Definición rigurosa. Conversión del estado completo de un objeto en memoria — estructura y valores de parámetros — en una secuencia de bytes persistente, que permite su reconstitución posterior en un proceso distinto con un comportamiento funcionalmente idéntico.
Traducción al lenguaje corriente. Guardar el modelo en un archivo de manera
que pueda recargarse más tarde, en otro lugar, sin tener que reentrenarlo. Los formatos
usuales son joblib y pickle (ecosistema Python, dependientes de las versiones), ONNX
(interoperable entre lenguajes y motores de ejecución), PMML (estándar XML, familias
de modelos limitadas) y los formatos nativos de biblioteca, como Booster.save_model
para XGBoost y LightGBM.
Punto de vigilancia. Un archivo joblib o pickle reconstruye objetos Python
arbitrarios en la lectura: cargarlo sin dominar su procedencia equivale a
ejecutar código no verificado. Por otra parte, la deserialización bajo una versión de
biblioteca diferente no está garantizada: la versión debe registrarse en
los metadatos y verificarse en la carga.
import os, joblib, sklearn, numpy as np
from sklearn.compose import ColumnTransformer
from sklearn.ensemble import RandomForestClassifier
from sklearn.impute import SimpleImputer
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import OneHotEncoder, StandardScaler
num = ["anciennete_mois", "facture_mensuelle", "nb_appels_support"]
cat = ["type_forfait"]
pipeline = Pipeline([
("preparation", ColumnTransformer([
("num", Pipeline([("imputation", SimpleImputer(strategy="median")),
("mise_a_echelle", StandardScaler())]), num),
("cat", OneHotEncoder(handle_unknown="ignore"), cat)])),
("modele", RandomForestClassifier(n_estimators=200, max_depth=8,
random_state=42))]).fit(df, y)
artefact = {"pipeline": pipeline, "version_sklearn": sklearn.__version__,
"colonnes_attendues": num + cat, "seuil_decision": 0.42,
"date_entrainement": "2026-08-22"}
joblib.dump(artefact, "modele_attrition_v3.joblib", compress=3)
print("Tamaño :", round(os.path.getsize("modele_attrition_v3.joblib")/1024, 1), "KB")
recharge = joblib.load("modele_attrition_v3.joblib")
p_memoire = pipeline.predict_proba(df.head(5))[:, 1]
p_recharge = recharge["pipeline"].predict_proba(df.head(5))[:, 1]
print("Probabilidades recargadas :", np.round(p_recharge, 4))
print("Identidad estricta :", np.array_equal(p_memoire, p_recharge))
print("Versión y umbral :", recharge["version_sklearn"], recharge["seuil_decision"])Tamaño : 1242.5 KB
Probabilidades recargadas : [0.0678 0.0711 0.0735 0.2408 0.0108]
Identidad estricta : True
Versión y umbral : 1.8.0 0.42Interpretación. El archivo pesa 1,2 MB mientras que el conjunto de entrenamiento solo comprende algunos miles de filas: ese volumen es el de los 200 árboles, es decir, de los parámetros aprendidos, y depende de la estructura retenida, no del volumen de datos. La recarga restituye probabilidades estrictamente idénticas: un modelo es determinista, y toda variación observada en producción sin reentrenamiento señala una diferencia en las entradas o el entorno de ejecución, nunca en el modelo. Por último, el artefacto no se reduce al pipeline: el umbral de decisión (capítulo 062) es una decisión de negocio exterior a los parámetros, y la versión de la biblioteca así como la lista ordenada de las columnas condicionan la validez de la carga.
Definición rigurosa. Ejecución del algoritmo A sobre un conjunto de datos D con hiperparámetros λ, consistente en seleccionar en H la hipótesis ĥ que optimiza un criterio explícito evaluado sobre D, eventualmente acompañado de un término de regularización:
ĥ = argmin sobre h ∈ H de [ (1/n) · Σᵢ L(h(xᵢ), yᵢ) + Ω(h) ]
donde L designa la función de coste y Ω un término que penaliza la complejidad de la hipótesis. Este marco es el de la minimización del riesgo empírico (Vapnik). La cantidad minimizada se mide sobre la muestra de entrenamiento, no sobre la población: esa diferencia es el origen del sobreajuste (capítulo 031).
Traducción al lenguaje corriente. La fase de estudio: el algoritmo recorre los ejemplos corregidos, ajusta sus parámetros para equivocarse lo menos posible sobre esos ejemplos, y se detiene cuando el criterio ya no mejora significativamente.
Lo que el entrenamiento no hace. No modifica los hiperparámetros, que
permanecen tal como se proporcionaron; no acumula las llamadas sucesivas, pues un segundo fit
sobrescribe íntegramente el estado anterior salvo que se recurra a partial_fit o
warm_start; no evalúa el modelo producido, pues la evaluación exige datos
no vistos.
Punto de vigilancia. El criterio optimizado durante el entrenamiento (la función de coste) y el criterio de evaluación de negocio (la métrica) son distintos y coinciden raramente (capítulo 030).
Modificar una de estas tres componentes produce un modelo diferente, a conjunto de datos constante.
| Algoritmo | Estrategia de búsqueda en H | Determinismo a datos constantes |
|---|---|---|
| Regresión lineal (mínimos cuadrados) | Solución analítica o descomposición matricial | Sí |
| Regresión logística | Optimización numérica convexa iterativa | Sí, con solver y tolerancia fijados |
| Árbol de decisión | Búsqueda voraz, corte óptimo local por nodo | Sí si no hay sorteo aleatorio de variables |
| Bosque aleatorio | Árboles construidos sobre muestras y subespacios sorteados al azar | No, salvo semilla fijada |
| Gradient boosting | Adición secuencial de aprendices que corrigen los residuos | No, salvo semilla fijada |
| k vecinos más cercanos | Ninguna búsqueda: memorización del conjunto de entrenamiento | Sí |
| Perceptrón multicapa | Descenso de gradiente estocástico por retropropagación | No, salvo semilla fijada y ejecución determinista impuesta |
Punto de vigilancia: para los algoritmos marcados «No», dos entrenamientos
sucesivos sobre el mismo conjunto con los mismos hiperparámetros producen dos modelos
diferentes. La fijación de una semilla (random_state) condiciona la reproducibilidad
del entregable y debe figurar en los metadatos.
Definición rigurosa. Evaluación de la función ĥ en un punto x del espacio de las variables explicativas, produciendo un valor ŷ = ĥ(x) del espacio de salida. La observación x no pertenece necesariamente al conjunto de entrenamiento; el interés operativo reside precisamente en el caso en que no pertenece a él.
Traducción al lenguaje corriente. Dar una respuesta para un caso nuevo, aplicando la regla aprendida. La convención distingue y, valor real observado, y ŷ, valor producido por el modelo; su diferencia es el residuo (capítulo 066).
Punto de vigilancia. El término no comporta ninguna connotación temporal. Un modelo que diagnostica una patología sobre datos presentes produce una predicción en sentido técnico, aunque ningún futuro esté en juego.
Tres propiedades caracterizan esta función. Determinismo: dos llamadas con la misma entrada producen la misma salida, pues el modelo no comporta ningún elemento aleatorio en la predicción aunque su entrenamiento lo tuviera. Ausencia de estado: una predicción no modifica el modelo, y la adaptación a datos nuevos exige un reentrenamiento, operación distinta. Cierre sobre su esquema de entrada: el modelo solo acepta entradas conformes al esquema registrado en el entrenamiento — mismas variables, mismo orden, mismos tipos, mismas modalidades categóricas conocidas, y transformaciones aplicadas con los parámetros aprendidos sobre el entrenamiento, no recalculados (capítulo 028).
Punto de vigilancia: el modo de fallo más costoso no es el error de ejecución, que es visible, sino la predicción producida sin error a partir de una entrada mal transformada. Un pipeline único serializado, en lugar de una sucesión de etapas reproducidas manualmente en producción, elimina esta clase de fallo por construcción (capítulos 076 a 079).
| Llamada | Salida producida | Forma | Disponibilidad |
|---|---|---|---|
predict(X) | Clase predicha o valor numérico | Vector de longitud n | Todos los estimadores supervisados |
predict_proba(X) | Probabilidades estimadas por clase | Matriz n × K, filas de suma 1 | Clasificadores con salida probabilística |
decision_function(X) | Puntuación no acotada, no calibrada | Vector de longitud n | Modelos de margen, SVM y modelos lineales |
transform(X) | Representación transformada de las entradas | Matriz n × p′ | Transformadores, no estimadores finales |
Punto de vigilancia: predict aplica por defecto un umbral de 0,5 sobre la
probabilidad estimada. Ese umbral es una convención de implementación, no un óptimo;
su revisión es una palanca mayor (capítulos 062 y 029).
Acepción 1 — inferencia en el sentido del Machine Learning (inference, serving). Operación consistente en evaluar un modelo entrenado sobre datos nuevos para producir predicciones. Sinónimo de predicción, el término se opone al entrenamiento y domina el vocabulario de la ingeniería de producción: inference server, inference latency, batch inference.
Acepción 2 — inferencia en el sentido estadístico (statistical inference). Enfoque consistente en estimar las características de una población a partir de una muestra y en cuantificar la incertidumbre asociada: estimación puntual, intervalo de confianza, test de hipótesis, significatividad. Tradición de Fisher, Neyman y Pearson.
Origen de la ambigüedad. Las dos comunidades emplean la misma palabra para operaciones cuyos objetos se oponen: una observación individual por un lado, un parámetro de población por el otro. La distinción la desarrollan Breiman (2001, Statistical Modeling: The Two Cultures) y Shmueli (2010, To Explain or to Predict?).
Punto de vigilancia. Un modelo muy eficaz en predicción no proporciona ninguna garantía inferencial: un coeficiente alto no establece ni la significatividad del efecto, ni su dirección causal (capítulo 016).
| Criterio | Inferencia en el sentido ML | Inferencia en el sentido estadístico |
|---|---|---|
| Objeto buscado | Una observación individual | Un parámetro de población |
| Pregunta planteada | ¿Qué valor para este caso preciso? | ¿Cuál es el valor de θ en la población, y con qué incertidumbre? |
| Salida producida | Una predicción ŷ | Una estimación, un intervalo de confianza, una decisión de test |
| Criterio de calidad | Error de generalización sobre datos no vistos | Propiedades del estimador: sesgo, convergencia, cobertura |
| Hipótesis movilizadas | Observaciones i.i.d., estabilidad de la distribución | Modelo generativo especificado, condiciones de regularidad |
| Contexto de empleo | Ingeniería, producción, MLOps | Estadística, epidemiología, econometría |
Recomendación de formulación: emplear «producir una predicción» o «servir el modelo» para la primera acepción, y nombrar explícitamente «inferencia estadística» la segunda.
| Etapa | Entrada consumida | Artefacto producido | Capítulo |
|---|---|---|---|
| Encuadre | Una pregunta de negocio | Tarea T y métrica P explicitadas | 012 |
| Constitución del conjunto de datos | Fuentes operativas | Conjunto de datos etiquetado X, y | 005 a 007 |
| Separación | Conjunto completo | Subconjuntos entrenamiento, validación, test | 026, 027 |
| Preparación ajustada | Transformadores ajustados | 022, 023 | |
| Elección del algoritmo | Naturaleza del problema y restricciones | Espacio H y sesgo inductivo retenidos | 049 |
| Selección de los hiperparámetros | Entrenamiento y validación | Configuración λ retenida | 034, 035 |
| Entrenamiento final | , | Modelo ĥ | 029 |
| Evaluación | , | Medidas de rendimiento en generalización | 052 a 075 |
| Serialización | Pipeline completo y metadatos | Archivo de artefacto versionado | 081 |
| Servicio | Observaciones de producción | Predicciones | 081 |
| Supervisión | Flujo de producción | Alertas de deriva, decisión de reentrenamiento | 082 |
Lectura del ciclo. Aparecen dos bucles de naturaleza diferente. El bucle corto, entre selección de los hiperparámetros y entrenamiento, explora varios espacios de hipótesis durante el desarrollo. El bucle largo, de la supervisión hacia el conjunto de datos, se desencadena por la degradación del rendimiento en producción: reejecuta el mismo algoritmo sobre datos actualizados para producir un nuevo modelo, versionado de forma distinta. Reentrenar no consiste nunca, por tanto, en modificar el algoritmo, sino en producir un nuevo artefacto.
Lo que se despliega es un artefacto — estructura y valores de parámetros — procedente de la ejecución del algoritmo Random Forest sobre un conjunto de datos determinado, en una fecha determinada. El algoritmo reside en la biblioteca instalada.
Formulación correcta: «Hemos desplegado el modelo attrition_v3, obtenido
por entrenamiento de un bosque aleatorio sobre los datos de enero a junio.»
El algoritmo ejecuta un procedimiento de búsqueda y no conserva nada al término de su ejecución; el conocimiento inducido reside en los parámetros del modelo producido.
Formulación correcta: «El algoritmo ha seleccionado, en el espacio de hipótesis, un modelo cuyos coeficientes indican una asociación negativa entre antigüedad y cancelación.»
Reentrenar consiste en reejecutar el mismo algoritmo, con los mismos hiperparámetros, sobre datos actualizados: ninguna línea de código se modifica. La confusión lleva a subestimar el coste real del ciclo de mantenimiento.
Formulación correcta: «El reentrenamiento mensual produce una nueva versión del modelo sin modificación del código de entrenamiento.»
Las transformaciones de preparación comportan parámetros aprendidos sobre los datos de entrenamiento: medianas de imputación, modalidades de codificación, medias y desviaciones típicas. Un estimador serializado solo, alimentado por transformaciones reimplementadas manualmente, produce predicciones falsas sin error visible.
Formulación correcta: «El artefacto serializado es el pipeline completo, del dato bruto a la predicción, acompañado de sus metadatos.»
El término designa, según la comunidad, la producción de una predicción sobre una observación o la estimación de un parámetro de población acompañada de una medida de incertidumbre: ni el mismo objeto, ni los mismos criterios de validez.
Formulación correcta: «El servidor de inferencia produce predicciones. Las conclusiones relativas a la población pertenecerían a una inferencia estadística, que este dispositivo no proporciona.»
LOS DOS OBJETOS
ALGORITMO DE APRENDIZAJE — un procedimiento. A : (D, λ) → ĥ ∈ H
Existe antes de los datos, no contiene ningún conocimiento,
versionado como una dependencia de software.
MODELO — un artefacto. Estructura fijada por A y λ,
parámetros ajustados sobre D. Solo existe tras el entrenamiento,
depende íntegramente de D, versionado como un entregable fechado.
LAS TRES COMPONENTES DE UN ALGORITMO DE APRENDIZAJE
1. Un espacio de hipótesis H qué reglas son candidatas
2. Un criterio de optimización cómo medir su calidad sobre D
3. Una estrategia de búsqueda cómo recorrer H
SESGO INDUCTIVO (Mitchell, 1980)
Las preferencias no deducidas de los datos que permiten elegir
una generalización entre las compatibles con D. Sin sesgo,
ninguna generalización es posible. No Free Lunch (Wolpert, 1996):
ningún sesgo es universalmente superior; elegir un algoritmo
es apostar sobre la forma del fenómeno.
LAS DOS OPERACIONES
ENTRENAMIENTO D, λ → ĥ selección en H
PREDICCIÓN x → ŷ = ĥ(x) evaluación de una función
EL MODELO COMO FUNCIÓN
ENTRADA (variables) → [ MODELO ] → SALIDA (predicción)
determinista · sin estado · cerrado sobre su esquema de entrada
ANALOGÍA CULINARIA
receta → algoritmo ingredientes → conjunto de entrenamiento
horno → hiperparámetros cocción → entrenamiento
pastel → modelo porción servida → predicción
pastel envasado y entregado → artefacto serializado desplegado
DOS SENTIDOS DE LA PALABRA INFERENCIA
Sentido ML producir una predicción para una observación
Sentido estadístico estimar un parámetro de población con
cuantificación de la incertidumbre
LO QUE EFECTIVAMENTE SE DESPLIEGA
No el estimador solo, sino el pipeline completo (imputación,
codificación, escalado, estimador) y sus metadatos:
versión de biblioteca, esquema de entrada, umbral de decisión,
semilla aleatoria, fecha, perímetro de validez.
EL TEST DE VOCABULARIO
«El procedimiento» sustituye al término → el algoritmo.
«El archivo entrenado» sustituye → el modelo.Enunciado de síntesis
El algoritmo de aprendizaje es un procedimiento que, a partir de un conjunto de datos y de hiperparámetros, selecciona en un espacio de hipótesis la regla que optimiza un criterio; el modelo es esa regla una vez seleccionada, artefacto compuesto de una estructura y de parámetros ajustados, dependiente íntegramente de los datos que lo produjeron; el entrenamiento es la operación de selección, la predicción es la evaluación de la función obtenida sobre una observación nueva, y lo que se versiona, serializa y despliega en producción no es nunca el algoritmo sino el modelo acompañado de su pipeline de preparación y de sus metadatos.
Quiz asociados
008.1-quiz-algorithme-apprentissage.md008.2-quiz-modele-artefact.md008.3-quiz-distinction-production.md008.4-quiz-entrainement.md008.5-quiz-prediction-inference.md008.6-quiz-cycle-complet.mdCapítulo siguiente: 009-parametres-hyperparametres.md