Programación determinista y aprendizaje inductivo

33 min
Bloque 0 — Situar el aprendizaje supervisado
Objetivo
dominar la inversión de paradigma que fundamenta el Machine Learning, saber decidir si un problema pertenece a un enfoque determinista o a un enfoque inductivo, y saber justificar esa decisión por el coste de los errores y por la distribución de roles entre humano y máquina.
Duración estimada
35 minutos
Requisitos previos
capítulo 001
Quiz asociados
002.1-quiz-renversement-paradigme.md a 002.7-quiz-roles-humain-machine.md

1. La inversión de paradigma

El capítulo 001 estableció que el Machine Learning es un enfoque de la inteligencia artificial basado en la inducción. Este capítulo establece lo que esa fórmula implica en el diseño de un sistema.

1.1 Los dos esquemas

Los dos paradigmas movilizan los mismos tres objetos —reglas, datos, respuestas— y solo cambian su posición en la cadena de producción.

ParadigmaEntradas proporcionadasSalida producidaAutor de las reglas
Programación deterministaReglas + DatosRespuestasUn diseñador humano
Aprendizaje inductivoDatos + RespuestasReglasEl algoritmo, a partir de las observaciones

El punto discriminante: en el primer paradigma, la regla es una entrada del sistema; en el segundo, es su salida.

1.2 Qué es una regla de decisión

DEFINICIÓN — Regla de decisión

Definición rigurosa

Aplicación determinista de un espacio de descripciones X hacia un espacio de decisiones Y, que asocia a toda descripción x de X una decisión única de Y: formalmente, una función h : X → Y. En clasificación, Y es un conjunto finito de modalidades; en regresión, un intervalo de números reales.

Traducción al lenguaje corriente

Un procedimiento que, para toda situación descrita, devuelve una decisión y solo una.

Punto esencial

Esta definición no presupone nada sobre el origen de la regla. Una cláusula SI ... ENTONCES ..., un baremo reglamentario, un árbol aprendido con 200 000 expedientes y una red neuronal son todos reglas de decisión en el sentido de esta definición; solo difieren en la forma en que se obtuvo h.

Punto de vigilancia

Un modelo no es menos regla que una cláusula escrita a mano: es una regla cuyo enunciado nadie ha redactado. Esta propiedad fundamenta a la vez su potencia y su dificultad de auditoría.

1.3 Deducción e inducción

Los dos paradigmas pertenecen a dos modos de inferencia distintos, identificados por la lógica mucho antes que la informática.

DEFINICIÓN — Deducción e inducción

Deducción

Modo de inferencia por el cual una conclusión se deriva de premisas según reglas de transformación que preservan la verdad. Si las premisas son verdaderas y la derivación es válida, la conclusión es necesariamente verdadera. Ilustración: «Todo envío que contiene un adjunto ejecutable se bloquea. Este envío contiene uno. Por tanto, se bloquea.»

Inducción

Modo de inferencia por el cual una proposición general se forma a partir de un conjunto finito de observaciones particulares. La conclusión excede el contenido de las premisas: no está garantizada, solo es más o menos probable a la vista de las observaciones. Ilustración: «De 40 000 correos observados, los que presentaban ciertas combinaciones de términos fueron señalados como no deseados en el 96 % de los casos. Por tanto, un nuevo envío que presente esas combinaciones es probablemente no deseado.»

El problema de la inducción

La inducción no proporciona ninguna garantía lógica. La teoría estadística del aprendizaje (Vapnik y Chervonenkis, años 1970) no elimina esta objeción: la acota mediante garantías probabilísticas condicionadas a hipótesis explícitas, la principal de las cuales es que los datos futuros provienen de la misma distribución que los datos de aprendizaje.

Consecuencia operativa

Un sistema determinista es falso cuando su regla es falsa. Un sistema inductivo es falso una parte del tiempo por construcción, incluso cuando todo se ha realizado correctamente.

CriterioDeducciónInducción
Sentido de la inferenciaDe lo general a lo particularDe lo particular a lo general
Estatus de la conclusiónNecesaria si las premisas son verdaderasProbable, revisable
Contenido de la conclusiónContenido en las premisasExcede las premisas
Efecto de una observación nuevaNinguno sobre la reglaPuede revisar la regla
Paradigma correspondienteProgramación deterministaMachine Learning
Modo de falloRegla mal especificadaGeneralización insuficiente

1.4 La función objetivo desconocida

DEFINICIÓN — Función objetivo f e hipótesis f sombrero

Definición rigurosa

Se postula la existencia de una función objetivo f : X → Y, desconocida, que relaciona el espacio de las descripciones X con el espacio de los valores a predecir Y; solo es accesible a través de una muestra finita de pares observados (x₁, y₁), ..., (xₙ, yₙ). El algoritmo selecciona, dentro de un conjunto de hipótesis H fijado por la elección de la familia de modelos, una hipótesis f̂ («f sombrero») que minimiza una medida de error sobre la muestra, con la esperanza de que f̂ se aproxime a f en todo el dominio.

Traducción al lenguaje corriente

Existe una relación real entre lo que se observa y lo que se quiere predecir. Nadie conoce su enunciado; se construye una imitación a partir de los ejemplos disponibles.

Las tres brechas entre f̂ y f

  • H puede no contener ninguna función cercana a f — error de aproximación, ligado a la elección del modelo.
  • La muestra es finita y ruidosa — error de estimación, ligado a los datos.
  • La relación puede variar en el tiempo — deriva, tratada en el capítulo 082.

Punto de vigilancia

La existencia de f es una hipótesis de trabajo, no un hecho establecido. Cuando el objetivo depende de factores ausentes de las descripciones x, ninguna función de X hacia Y es exacta, sea cual sea el algoritmo. Este punto se desarrolla en el apartado 5.


2. Estudio de caso: la deriva de un sistema basado en reglas

El caso siguiente reconstruye una trayectoria típica del filtrado de correos electrónicos entre mediados de los años 1990 y mediados de los años 2000. Los órdenes de magnitud son representativos.

2.1 Cronología

Mes 1 — tres reglas bastan.

SI el asunto contiene "viagra"         ENTONCES spam
SI el asunto contiene "lotería"        ENTONCES spam
SI el cuerpo contiene "haga clic aquí" ENTONCES spam

Tres reglas escritas en media jornada interceptan el 82 % de los envíos no deseados, con un coste de mantenimiento nulo.

Mes 3 — la ofuscación. Los emisores modifican la ortografía de los términos filtrados: V1AGRA, V-I-A-G-R-A, VÍAGRA, \/IAGRA, Vi@gra, o la misma grafía en caracteres cirílicos homoglifos. La tasa de interceptación cae al 51 % en tres semanas; el equipo añade una regla por grafía observada y el corpus pasa de 3 a 47 reglas.

Mes 6 — los falsos positivos. Las reglas acumuladas bloquean envíos legítimos: la correspondencia de una farmacia asociada, un boletín informativo médico seguido por 4 000 clientes, las campañas del marketing interno que contienen «haga clic aquí». Tres incidentes llegan a la dirección en un mes. El equipo ya no se atreve a eliminar reglas, pues cada una intercepta spam real: añade excepciones, listas de remitentes autorizados y exenciones por dominio. El corpus pasa a 210 reglas, de las cuales 60 son reglas de excepción a otras reglas.

Mes 12 — los nuevos vectores. El texto pasa a imagen, luego a archivo adjunto, luego se fragmenta con caracteres invisibles; cada vector exige una familia de reglas distinta: 610 reglas.

Mes 24 — la ingobernabilidad.

IndicadorMes 1Mes 6Mes 12Mes 24
Número de reglas32106101 800
Tasa de interceptación82 %79 %77 %76 %
Tasa de falsos positivos0,1 %0,9 %1,6 %2,3 %
Personas asignadas al mantenimiento0123
Plazo de reacción ante una campaña nueva1 día3 días7 días11 días
Proporción de reglas cuyo autor es identificable100 %70 %35 %12 %

Ninguna persona del equipo conoce el conjunto de las 1 800 reglas y toda modificación produce regresiones imprevisibles en otras partes del corpus. El rendimiento ha bajado a pesar de un esfuerzo de mantenimiento multiplicado por tres.

2.2 Los tres mecanismos de degradación

El fracaso no es imputable a la incompetencia del equipo. Es estructural.

MecanismoEfecto sobre el corpus de reglasMagnitud en juego
Explosión combinatoriaEl número de casos a cubrir crece más rápido que la capacidad de escrituraNúmero de variantes de un patrón
Acoplamiento entre reglasToda regla nueva modifica el comportamiento de las reglas existentesNúmero de pares de reglas
Obsolescencia adversarialLas reglas caducan a un ritmo impuesto por un tercero hostilBrecha entre ciclo de ataque y ciclo de corrección

Mecanismo 1 — la explosión combinatoria. Un único término de seis caracteres admite un número de grafías equivalentes que crece multiplicativamente: cuatro sustituciones plausibles para la vocal i, cuatro para la a, dos para la g dan ya varias decenas de formas, y la inserción opcional de un separador entre cada una de las cinco posiciones internas multiplica ese número por 2⁵ = 32. El orden de magnitud supera las 10⁴ formas para una sola palabra. La escritura manual progresa linealmente cuando el espacio a cubrir crece exponencialmente: ningún esfuerzo de mantenimiento cierra esa brecha.

Mecanismo 2 — el acoplamiento entre reglas. Un corpus de n reglas presenta n(n−1)/2 pares susceptibles de interactuar.

Número de reglas3472106101 800
Número de pares31 08121 945185 7451 619 100

Verificar que una regla nueva no entra en conflicto con ninguna otra supone examinar 1 800 interacciones en cada adición. Al no ser realizable manualmente, esta verificación no se efectúa: las regresiones se descubren en producción, por los usuarios.

Mecanismo 3 — la obsolescencia frente a un adversario adaptativo.

DEFINICIÓN — Adversario adaptativo

Definición rigurosa

Agente cuya función objetivo incluye la elusión del sistema de decisión, y que dispone de una señal de observación sobre las decisiones de ese sistema que le permite ajustar su comportamiento.

Traducción al lenguaje corriente

Un actor que tiene interés en engañar al sistema, que ve lo que pasa y lo que se bloquea, y adapta sus envíos en consecuencia.

La propiedad crítica: la asimetría de los ciclos

El emisor prueba una variante y observa el resultado en pocas horas, con un coste casi nulo; el equipo debe constatar la caída, diagnosticar el vector, redactar la regla, verificar su inocuidad y desplegarla, es decir, varios días. Mientras el atacante itere más rápido que el defensor, el rendimiento tiende hacia el de un sistema que ya solo filtra las campañas obsoletas.

Punto de vigilancia

Esta propiedad no es exclusiva de los sistemas basados en reglas: un modelo confrontado a un adversario adaptativo también se degrada. La diferencia reside en el coste unitario de la actualización — reentrenar es una operación instrumentada y repetible, reescribir 1 800 reglas no lo es.

2.3 La reformulación inductiva

En lugar de especificar los patrones característicos del spam, se constituye un corpus de correos cuya naturaleza es conocida y el algoritmo identifica las regularidades discriminantes.

DimensiónSistema basado en reglasSistema inductivo
Reacción ante una grafía nuevaEscritura de una regla dedicadaAbsorbida si el corpus se actualiza
Esfuerzo de adaptaciónProporcional al número de variantesConstante: reentrenar
Fuente de la señalEl analista que observaLos reportes de los usuarios
Efecto del volumen de tráficoCarga de mantenimiento crecienteRecurso adicional para el modelo
Legibilidad de la decisiónAlta: la regla activada tiene nombreReducida: ponderación de numerosos indicios

Punto de vigilancia: la reformulación inductiva no elimina el trabajo, lo desplaza hacia el mantenimiento de un corpus etiquetado, de una cadena de reentrenamiento y de una supervisión del rendimiento. La ganancia reside en que ese trabajo es instrumentable y repetible, no en su desaparición.


3. Criterios de elección entre enfoque determinista y enfoque inductivo

3.1 Árbol de decisión

El orden de las preguntas no es indiferente: la primera nunca es «qué algoritmo emplear» sino «¿la regla es conocida?». El Machine Learning solo es pertinente cuando la respuesta es negativa.

3.2 Las seis condiciones de aplicabilidad

CondiciónJustificaciónIlustración
La regla no es formalizableLos criterios de decisión no son verbalizables, ni siquiera por los expertos que los aplicanReconocimiento de un rostro, apreciación de un riesgo compuesto
Los factores e interacciones son numerososLa escritura manual diverge y el acoplamiento entre reglas se vuelve ingobernableScoring de crédito con 60 variables
El entorno evolucionaLas reglas escritas caducan; el reentrenamiento absorbe la evolución a coste constanteDetección de fraude, filtrado de correos
La personalización debe ser masivaUna regla por individuo es imposible de escribir y mantenerRecomendación sobre varios millones de cuentas
Una respuesta aproximada es aceptableEl modelo produce una estimación acompañada de una incertidumbre, nunca una certezaEstimación de precios, previsión de demanda
Existe un histórico etiquetado suficienteLa inducción requiere observaciones cuyo valor objetivo es conocidoTransacciones con resultado constatado

Estas seis condiciones son conjuntas: un problema que satisface cinco y falla en la sexta —típicamente la ausencia de histórico etiquetado— no pertenece al Machine Learning en su estado actual.

3.3 Las cinco contraindicaciones

ContraindicaciónRazónAlternativa
La regla exacta es conocida, estable y verificableEl modelo sustituiría una respuesta exacta por una aproximación, sin contrapartidaImplementar la fórmula
La exactitud es una obligación legal o contractualUna aproximación estadística es jurídicamente inadmisible sobre un importe debidoRegla explícita, auditada, versionada
El volumen de observaciones es insuficienteLa inducción sobre una muestra demasiado pequeña produce una regla no generalizableExperiencia de negocio, recolección previa
El error es catastrófico e irrecuperableNingún modelo alcanza el 100 %: la fracción residual de errores es estructuralSupervisión humana sistemática
No existe ningún histórico, al ser el proceso nuevoNo hay nada que inducirPrototipado, reglas provisionales, recolección instrumentada

3.4 Las tres situaciones en que el determinista gana

DEFINICIÓN — Auditabilidad de una decisión automatizada

Definición rigurosa

Propiedad de un sistema de decisión que permite reconstruir, para toda decisión producida, la cadena de justificación que condujo a ella y el estado exacto del sistema en esa fecha, de forma reproducible por un tercero. Exige que la regla aplicada sea enunciable, que la versión vigente se conserve y que el resultado sea reproducible de forma idéntica.

Punto de vigilancia

Un modelo estadístico satisface la reproducibilidad pero hace difícil el enunciado de la regla: los métodos de explicación a posteriori producen una justificación aproximada de la decisión, no su enunciado. Cuando la obligación recae sobre la motivación individual, esa aproximación puede ser insuficiente.

Situación 1 — la regla es conocida, exacta y estable. Cálculo de un impuesto sobre ventas, conversión a un tipo publicado, vencimiento de un préstamo a tipo fijo, control de un identificador mediante clave. Un modelo entrenado para reproducir estas operaciones alcanzaría el 99,7 % de exactitud donde la implementación directa alcanza el 100 %: la sustitución es una regresión pura.

Situación 2 — no hay ningún histórico disponible. Un proceso creado la semana anterior no dispone de ninguna observación cuyo valor objetivo sea conocido. La cuestión no es elegir un algoritmo sino instrumentar el proceso para que las observaciones se recojan y etiqueten.

Situación 3 — la auditabilidad es una obligación. Cuando una decisión debe motivarse individualmente ante el interesado o un regulador, la capacidad de enunciar la regla aplicada se convierte en una restricción de diseño al mismo nivel que el rendimiento. Un modelo sigue siendo pertinente entonces como apoyo a la decisión, siendo la decisión impugnable producida por una regla explícita o por un operador.


4. El coste de los errores como criterio de decisión

Este apartado es el más importante del capítulo: distingue una comprensión técnica de una comprensión operativa.

4.1 El postulado de base

Ningún modelo de Machine Learning alcanza el 100 % de exactitud sobre datos nuevos.

Este enunciado se deriva de la naturaleza inductiva de la inferencia: la regla se extrapola de una muestra finita hacia un dominio que la supera. Una exactitud del 100 % anunciada sobre datos nuevos señala, en la práctica, una fuga de datos, tratada en el capítulo 028, o una evaluación realizada sobre los datos de aprendizaje. La pregunta pertinente nunca es, por tanto, «¿el modelo se equivoca?», sino:

¿Quién trata los errores, a qué coste y en qué plazo?

4.2 El cálculo que hay que plantear sistemáticamente

Un modelo que alcanza el 95 % de exactitud se presenta generalmente como un buen modelo. Referido al volumen tratado:

Volumen diario de decisiones    : 100 000
Exactitud del modelo            : 95 %
Decisiones correctas            :  95 000
Decisiones erróneas             :   5 000  por día
Hipótesis de tratamientoCarga inducidaConclusión
Ningún tratamiento, error sin consecuenciaNulaModelo desplegable tal cual
Tratamiento por el usuario final, 30 segundos42 horas de atención por día, difusasAceptable si el error es visible y corregible
Revisión humana interna, 4 minutos por caso333 horas por día, alrededor de 42 puestos a tiempo completoEl dispositivo de recuperación cuesta más que el modelo
Error no detectable por el usuarioCarga nula, riesgo no acotadoConfiguración más peligrosa

La última línea es la más importante: un error costoso pero visible es un problema de dimensionamiento, un error silencioso es un problema de diseño.

4.3 Guía de lectura por contexto

ContextoNaturaleza del errorGravedadReversibilidadML apropiado
Recomendación de contenidoSugerencia no pertinenteBajaInmediata: el usuario ignora la sugerencia, sin reservas
Filtrado de correosFalso positivo: envío legítimo puesto en cuarentenaMediaBuena si la cuarentena es consultable, a condición de una cuarentena accesible
Mantenimiento predictivoAlerta injustificada o avería no anticipadaMedia a altaParcial: coste de intervención o coste de parada, con umbral asimétrico
Concesión de créditoRechazo injustificado a un solicitante solventeAltaBaja: perjuicio sufrido, litigio posible, bajo restricción de explicabilidad y de recurso
Moderación automáticaEliminación de un contenido lícitoAltaCondicionada a la existencia de una vía de recurso, con reexamen humano garantizado
Diagnóstico médicoFalso negativo: patología no detectadaMuy altaBaja a nulaNo en decisión autónoma: apoyo a la decisión
Cálculo de nómina o de impuestosImporte erróneoAltaCorrección posible, pero incumplimiento de una obligación de exactitudNo: la regla exacta existe

Deben dominarse tres lecturas.

Primera lectura: la gravedad depende del contexto de uso, no de la tasa de error. El mismo modelo al 95 % es excelente en recomendación e inaceptable en cálculo de nómina.

Segunda lectura: la reversibilidad es el criterio operativo decisivo. Un error grave pero recuperable se gestiona por diseño —umbral prudente, cola de verificación, vía de recurso—; un error irreversible no se gestiona así.

Tercera lectura: los dos tipos de error de un clasificador no tienen el mismo coste. Esta asimetría es un parámetro de diseño, ajustable mediante el umbral de decisión.

ANALOGÍA — El control de calidad al final de la cadena

Una cadena de producción no busca el defecto cero a cualquier precio: dimensiona una tasa de defectos aceptable, y luego diseña el dispositivo de detección y de recuperación correspondiente. Esa tasa no depende de la máquina, sino del coste unitario de un defecto que sale, del coste del control y del volumen producido. Un responsable que exige cero defectos sin dimensionar el control no obtiene cero defectos: obtiene defectos no detectados.

La tasa de error aceptable de un modelo es igualmente una decisión de ingeniería, nunca una propiedad del algoritmo.


5. Los límites estructurales del Machine Learning

Los cuatro límites siguientes no son defectos de implementación: se derivan de la naturaleza inductiva del enfoque y no los elimina ningún algoritmo, ninguna arquitectura ni ningún volumen de datos.

LÍMITE 1 — El modelo no crea información ausente de los datos

Enunciado

Un algoritmo de aprendizaje extrae regularidades presentes en las descripciones proporcionadas. No puede fundamentar una decisión en un factor que no aparece en ninguna variable, ni directamente ni por correlación.

Ilustración

Un modelo de estimación inmobiliaria alimentado por la superficie y el número de habitaciones no puede valorar ni la vista, ni la orientación, ni el estado del tejado, que sin embargo determinan una parte sustancial del precio. El modelo no señala esta insuficiencia: produce una estimación cuyo error residual se atribuirá al «ruido» cuando en realidad refleja una información faltante.

Consecuencia práctica

El techo de rendimiento lo fija el contenido informacional de las variables, no la elección del algoritmo. Este límite explica una decepción frecuente: pasar de una regresión a un método de ensamble sofisticado solo aporta unos pocos puntos cuando la información necesaria está ausente del conjunto de datos.

LÍMITE 2 — El modelo no establece causalidad

Enunciado

Un modelo predictivo identifica asociaciones estadísticas entre variables explicativas y variable objetivo. Una asociación no es una relación de causa a efecto: un modelo eficaz puede apoyarse en asociaciones cuya interpretación causal es falsa, o incluso invertida.

El caso documentado asma y neumonía

Un estudio de los años 1990 sobre pacientes ingresados por neumonía buscaba predecir el riesgo de fallecimiento con el fin de orientar a los pacientes de bajo riesgo hacia una atención ambulatoria. El modelo aprendió una regla exacta sobre los datos y peligrosa en la práctica:

Los pacientes con neumonía que tienen antecedentes de asma presentan un riesgo de fallecimiento más bajo.

La asociación es real en los datos. Su explicación: esos pacientes eran sistemáticamente ingresados en cuidados intensivos debido a su antecedente, allí recibían una atención inmediata y agresiva, y por tanto sobrevivían más. La regla inducida era una consecuencia del protocolo de atención, no una propiedad clínica; aplicada tal cual, habría orientado hacia el domicilio precisamente a los pacientes que el protocolo existente protegía. El modelo no era defectuoso —reproducía fielmente los datos— y solo una relectura por parte de clínicos permitió detectar la anomalía.

Este caso lo relatan en particular Cooper y sus coautores (1997), y luego lo retoman y analizan Caruana y sus coautores (2015) en sus trabajos sobre los modelos inteligibles en salud.

Formulación a recordar

Un modelo predice lo que ocurre en las condiciones en que se produjeron los datos. No predice lo que ocurriría si se interviniera sobre esas condiciones. Toda decisión de intervención basada en un modelo puramente predictivo sale del dominio de validez de ese modelo.

LÍMITE 3 — El modelo supone la estacionariedad de la relación

Enunciado

El marco estadístico del aprendizaje supervisado supone que los datos de explotación provienen de la misma distribución que los datos de aprendizaje. Cuando esta hipótesis deja de verificarse, las garantías de rendimiento caen.

Dos formas de ruptura

  • Deriva de los datos (data drift): la distribución de las variables explicativas cambia, mientras la relación entre variables y objetivo sigue siendo válida. Ejemplo: la clientela rejuvenece, los perfiles observados difieren de los del corpus de aprendizaje.
  • Deriva del concepto (concept drift): la relación misma cambia. Ejemplo: un comportamiento de compra que señalaba fidelidad se convierte, tras un cambio de oferta, en una señal de abandono inminente.

Consecuencia práctica

Causas habituales: cambio de comportamiento de los clientes, modificación del producto o del proceso de negocio, evolución regulatoria, adaptación de un adversario, modificación de un sensor, choque externo. Un modelo en producción no tiene, por tanto, un rendimiento constante: posee una duración de validez, que debe supervisarse y no suponerse. Una puesta en producción sin dispositivo de supervisión es una decisión de explotación incompleta. La deriva, su detección y las estrategias de reentrenamiento se tratan en el capítulo 082.

LÍMITE 4 — Garbage In, Garbage Out, agravado por el fallo silencioso

Enunciado

La calidad de la regla inducida está acotada por la calidad y la representatividad de las observaciones proporcionadas. Datos erróneos, sesgados o mal etiquetados producen una regla errónea, sesgada o mal calibrada.

El agravante propio del Machine Learning

Un programa determinista alimentado con datos inválidos falla de forma visible: excepción, valor aberrante, rechazo de control. Un algoritmo de aprendizaje, en cambio, no falla: converge, produce un modelo, y ese modelo produce predicciones de apariencia normal. El fallo es silencioso.

Defecto de los datosEfecto sobre el modeloManifestación
Etiquetas parcialmente erróneasLa regla inducida reproduce el error de etiquetadoRendimiento aparente correcto, decisiones falsas
Población no representativaLa regla solo vale para un subgrupoBrecha de rendimiento entre segmentos
Variable no disponible en el momento de la decisiónRendimiento excelente en test, colapso en producciónFuga de datos, capítulo 028
Clases fuertemente desequilibradasEl modelo privilegia la clase mayoritariaExactitud alta, detección nula en la clase rara, capítulo 050

Punto de vigilancia

La ausencia de error de ejecución nunca constituye una prueba de validez para un sistema inductivo. La validación exige un examen de los datos, un análisis de los errores por segmento y una confrontación de las regularidades aprendidas con el conocimiento de negocio.


6. Estudio de caso con cifras: la estimación inmobiliaria

El objetivo es estimar el precio de venta de una casa, conduciendo los dos enfoques en paralelo sobre los mismos inmuebles.

6.1 Versión determinista

Un experto del sector propone una fórmula basada en su experiencia:

precio = superficie_m2 x 3 500 + numero_de_habitaciones x 10 000
InmuebleSuperficieHabitacionesPrecio calculadoPrecio realErrorError relativo
A90 m²3345 000 $352 000 $−7 000 $2,0 %
B120 m²4460 000 $448 000 $+12 000 $2,7 %
C75 m²2282 500 $291 000 $−8 500 $2,9 %
D140 m²4530 000 $690 000 $−160 000 $23,2 %

En los tres primeros inmuebles la fórmula es aceptable; en el cuarto, falla por 160 000 dólares. Una desviación de este orden descalifica la herramienta: ningún profesional basa una negociación en una estimación cuyo error posible alcanza la cuarta parte del valor.

6.2 Diagnóstico del inmueble D

FactorSituación del inmueble DEfecto sobre el precio
BarrioZona escolar demandada, estación de transporte a 300 metrosFuerte, multiplicativo
RenovaciónCocina y baño renovados 18 meses antes de la ventaAditivo, sustancial
GarajeGaraje doble, raro en la zonaAditivo, moderado

La corrección parece simple: añadir los términos faltantes.

precio = superficie_m2 x A + numero_de_habitaciones x B + garaje x C
       + renovacion_reciente x D + indice_de_barrio x E + F

La estructura es plausible. El problema está en otra parte:

¿Cuáles son los valores de A, B, C, D, E y F?

Nadie los conoce. No figuran en ningún referencial y varían según la ciudad, el segmento y el período. Un experto puede proponer un orden de magnitud para A; no puede arbitrar entre 34 000 y 41 000 dólares para el valor de una renovación, ni cuantificar el índice de barrio en una escala coherente con los demás términos. A ello se suman las interacciones —el valor de una renovación depende del barrio—, las no linealidades y la inestabilidad: los coeficientes estarán caducados en dieciocho meses.

Conclusión: la estructura del problema es identificable por un experto; sus parámetros no lo son. Es exactamente la configuración que requiere un enfoque inductivo.

6.3 Versión inductiva

Se reúnen las ventas cerradas, descritas por las mismas variables, con el precio constatado.

SuperficieHabitacionesGarajeRenovadaÍndice barrioPrecio constatado
90 m²3003352 000 $
120 m²4103448 000 $
75 m²2003291 000 $
140 m²4117690 000 $
105 m²3105468 000 $
160 m²5116712 000 $
82 m²2014371 000 $

El conjunto real comprende varios miles de filas de esta forma, y el procedimiento de aprendizaje cabe en tres instrucciones:

python
X = donnees[["surface", "chambres", "garage", "renovee", "indice_quartier"]]
y = donnees["prix"]

model.fit(X, y)

La llamada model.fit(X, y) es la operación de inducción: el algoritmo busca los coeficientes que minimizan la desviación entre precios calculados y precios constatados sobre el conjunto de las ventas.

TérminoCoeficiente estimadoLectura de negocio
Superficie3 120 $ por m²Valor marginal del metro cuadrado
Habitaciones6 400 $ por habitaciónEfecto propio, controlada la superficie
Garaje14 900 $Prima por un garaje
Renovación reciente38 200 $Prima por una renovación reciente
Índice de barrio21 500 $ por puntoEfecto de la zona
Constante18 700 $Ordenada en el origen

Ninguno de estos valores fue proporcionado: fueron inducidos de las ventas observadas. El coeficiente de superficie difiere de la intuición del experto —3 120 en lugar de 3 500— porque la estimación inicial absorbía implícitamente efectos que ahora captan los demás términos.

Predicción sobre un inmueble nunca visto:

Inmueble E: 110 m², 3 habitaciones, garaje, no renovada, índice de barrio 4

110 x 3 120 = 343 200
  3 x 6 400 =  19 200
     garaje =  14 900
 renovación =       0
 4 x 21 500 =  86 000
  constante =  18 700
-----------------------
 Estimación = 482 000 $

En uso profesional, esta estimación puntual va acompañada de un intervalo y de un error medio establecidos durante la evaluación.

6.4 Comparación de las dos cadenas

CriterioEnfoque deterministaEnfoque inductivo
Origen de los coeficientesPostulados por un experto, no verificablesEstimados a partir de las ventas constatadas
Consideración de un factor nuevoReescritura de la fórmula, arbitraje manual del coeficienteAdición de una columna y reentrenamiento
Adaptación a un mercado diferenteRevisión completa de la experiencia expertaReentrenamiento con los datos locales
Medida de la calidadDesviación constatada a posteriori, sin protocoloError medido sobre ventas no utilizadas para el aprendizaje
Auditabilidad de la decisiónAlta: la fórmula es enunciableMedia a baja según la familia de modelos

Lectura de la tabla: el enfoque inductivo gana en cuatro criterios y pierde en la auditabilidad. Este compromiso es representativo y se resuelve por el contexto de uso: una estimación indicativa destinada a un agente inmobiliario tolera una auditabilidad media; un valor de tasación impugnable ante un tribunal no la tolera.


7. La distribución de roles entre humano y máquina

El vocabulario de la prensa —«el algoritmo decide», «la máquina aprende sola»— alimenta la idea de una automatización integral de la cadena de decisión. El examen del ciclo real de un proyecto la contradice.

7.1 Quién decide qué

Etapa del cicloContenido de la decisiónDecisor
1. Formular el problema de negocioDeterminar qué pregunta merece plantearseHumano
2. Decidir sobre la oportunidad del MLConfrontar el problema con las condiciones del apartado 3Humano
3. Definir la variable objetivoElegir qué se predice y cómo se mideHumano
4. Elegir y recoger los datosDeterminar fuentes, período, poblaciónHumano
5. Definir la medida de rendimiento y el umbralFijar qué constituye un éxito, arbitrar entre tipos de errorHumano
6. Preparar los datos y construir las variablesLimpiar, codificar, agregar, derivarHumano, con herramientas
7. Elegir la familia de algoritmosArbitrar rendimiento, interpretabilidad, coste, restriccionesHumano
8. Ajustar los parámetros del modeloEstimar los coeficientes que minimizan el error sobre la muestraMáquina
9. Evaluar e interpretar los resultadosAnalizar los errores, confrontar con el negocio, detectar las anomalíasHumano
10. Decidir la puesta en producciónDecidir sobre el despliegue y sus salvaguardasHumano
11. Supervisar y arbitrar el reentrenamientoDetectar la deriva, decidir retomar el cicloHumano

De once etapas, la máquina cubre una, enteramente condicionada por las decisiones humanas que la preceden: los datos de la etapa 4, el objetivo de la etapa 3, la medida de error de la etapa 5 y la familia de modelos de la etapa 7 determinan íntegramente lo que la etapa 8 puede producir.

7.2 El ciclo y sus zonas de decisión

Los bloques en tono oscuro pertenecen a la decisión humana. El bloque en tono claro es la única etapa ejecutada por la máquina.

ANALOGÍA — El instrumento de medida y el experimentador

Un espectrómetro produce medidas que ningún operador podría obtener a ojo: es irremplazable en ese segmento de la cadena. No elige la pregunta de investigación, no toma la muestra, no define el protocolo, no interpreta los resultados y no decide publicar. Un algoritmo de aprendizaje ocupa exactamente la misma posición.

DEFINICIÓN — Grado de autonomía de un sistema de decisión

Definición rigurosa

Posición de un sistema automatizado en la escala que va de la simple producción de información a la decisión ejecutada sin intervención humana, caracterizada por el rol asignado al operador en el bucle de decisión.

Los tres regímenes habituales

RégimenRol del humanoContexto de empleo
Apoyo a la decisiónEl humano decide, el modelo informaError grave, decisión motivada, experiencia experta indispensable
Humano en el bucle por excepciónEl modelo decide, el humano arbitra los casos inciertoVolumen alto, errores recuperables, incertidumbre identificable
Automatización completaEl modelo decide solo, el humano supervisa los agregadosError de baja gravedad, volumen masivo, reversibilidad inmediata

Punto de vigilancia

El régimen de autonomía es una decisión de diseño, independiente del rendimiento del modelo. Un modelo muy eficaz puede desplegarse como apoyo a la decisión porque el contexto lo exige; un modelo mediocre puede automatizarse plenamente porque allí el error no tiene consecuencias.


8. Errores de razonamiento frecuentes

ERROR — Presentar el Machine Learning como superior a la programación clásica

Síntoma: formular la elección como una modernización, u oponer un método «superado» a un método «actual».

Razón: los dos enfoques responden a dos configuraciones distintas. El Machine Learning no aporta nada cuando la regla es conocida, exacta y estable; introduce allí una aproximación sin contrapartida.

Formulación correcta: «La programación determinista y el aprendizaje inductivo tratan dos configuraciones diferentes. El criterio de elección es la disponibilidad de una regla exacta y estable, no la antigüedad del método.»

ERROR — Creer que el modelo descubre las reglas sin intervención humana

Síntoma: describir el proyecto como «se le dan los datos al algoritmo y lo encuentra todo solo».

Razón: el algoritmo solo ejecuta una etapa de once. La elección del objetivo, de los datos, de la medida de rendimiento y de la familia de modelos es humana, y condiciona íntegramente el resultado obtenido.

Formulación correcta: «El algoritmo estima los parámetros. El encuadre del problema, la elección de los datos, la definición de la medida de rendimiento y la validación siguen siendo decisiones humanas.»

ERROR — Tratar una asociación aprendida como una relación causal

Síntoma: decidir intervenir sobre una variable porque el modelo le atribuye un peso importante — «el modelo muestra que los antecedentes de asma reducen el riesgo, así que esos pacientes pueden volver a casa».

Razón: un modelo predictivo restituye las regularidades del proceso que generó los datos, protocolos y políticas incluidos. No dice nada sobre lo que se produciría si se modificara ese proceso.

Formulación correcta: «El modelo establece una asociación válida en las condiciones de producción de los datos. Toda decisión de intervención sobre una variable exige un análisis causal distinto, con un protocolo adecuado.»

ERROR — Considerar una tasa de exactitud alta como prueba de adecuación

Síntoma: concluir el despliegue sobre la única base de una cifra global, sin examinar el volumen ni la naturaleza de los errores restantes.

Razón: el 95 % de exactitud sobre 100 000 decisiones diarias representa 5 000 errores por día. La pertinencia del despliegue depende de su gravedad, de su detectabilidad, de su reversibilidad y del coste de su tratamiento.

Formulación correcta: «La tasa de exactitud no basta. Hay que establecer el volumen de errores esperado, la gravedad de cada tipo de error, quién los detecta y a qué coste se recuperan.»

ERROR — Suponer que un modelo desplegado conserva su rendimiento

Síntoma: entregar un modelo sin dispositivo de supervisión, considerando el proyecto terminado en la puesta en producción.

Razón: las garantías del aprendizaje suponen que los datos de explotación siguen la misma distribución que los datos de aprendizaje. Esta hipótesis deja de verificarse en cuanto los usuarios, el producto, la regulación o un adversario evolucionan.

Formulación correcta: «Un modelo posee una duración de validez. La puesta en producción incluye la supervisión del rendimiento y un procedimiento de reentrenamiento.» El tema se trata en el capítulo 082.


9. Síntesis

LA INVERSIÓN
    Programación determinista : Reglas + Datos      -> Respuestas
    Aprendizaje inductivo     : Datos + Respuestas  -> REGLAS
    La regla es una ENTRADA en el primer caso, una SALIDA en el segundo.

MODO DE INFERENCIA
    Determinista : deducción, conclusión necesaria
    Inductivo    : inducción, conclusión probable y revisable

MARCO FORMAL
    f    función objetivo, desconocida, nunca observada
    f^   hipótesis retenida por el algoritmo, aproximación de f
    Brechas : aproximación (modelo), estimación (datos), deriva (tiempo)

CRITERIO DE ELECCIÓN, EN ORDEN
    1. ¿La regla exacta es conocida y estable?        -> determinista
    2. ¿Existe un histórico etiquetado suficiente?    -> si no, recoger
    3. ¿Una respuesta aproximada es aceptable?        -> si no, determinista
    4. ¿El coste de los errores es controlable?       -> si no, apoyo a la decisión
    5. En caso contrario                              -> enfoque inductivo

EL CÁLCULO QUE HAY QUE PLANTEAR SISTEMÁTICAMENTE
    95 % de exactitud sobre 100 000 decisiones = 5 000 errores por día
    Pregunta : ¿quién los trata, a qué coste, en qué plazo?
    Caso más peligroso : el error no detectable.

LOS CUATRO LÍMITES ESTRUCTURALES
    1. No se crea ninguna información si está ausente de los datos
    2. Asociación aprendida no es causalidad establecida
    3. La estacionariedad de la relación es una hipótesis, no un hecho
    4. Datos defectuosos -> modelo defectuoso, sin ninguna señal de error

DISTRIBUCIÓN DE ROLES
    11 etapas en el ciclo. La máquina cubre 1 :
    el ajuste de los parámetros. Las otras 10 son decisiones humanas.

Enunciado de síntesis

La programación determinista y el aprendizaje inductivo se distinguen por la posición de la regla de decisión: especificada como entrada en el primer caso, inducida como salida en el segundo. El enfoque inductivo solo es pertinente cuando la regla exacta es inaccesible, existe un histórico etiquetado, una respuesta aproximada es aceptable y el coste de los errores residuales está controlado; la máquina solo se hace cargo allí de una etapa, el ajuste de los parámetros, perteneciendo todas las demás a la decisión humana.


Quiz y preguntas de entrevista: 002.1-quiz-renversement-paradigme.md a 002.7-quiz-roles-humain-machine.md

Capítulo siguiente: 003-trois-familles-apprentissage.md