El capítulo 001 estableció que el Machine Learning es un enfoque de la inteligencia artificial basado en la inducción. Este capítulo establece lo que esa fórmula implica en el diseño de un sistema.
Los dos paradigmas movilizan los mismos tres objetos —reglas, datos, respuestas— y solo cambian su posición en la cadena de producción.
| Paradigma | Entradas proporcionadas | Salida producida | Autor de las reglas |
|---|---|---|---|
| Programación determinista | Reglas + Datos | Respuestas | Un diseñador humano |
| Aprendizaje inductivo | Datos + Respuestas | Reglas | El algoritmo, a partir de las observaciones |
El punto discriminante: en el primer paradigma, la regla es una entrada del sistema; en el segundo, es su salida.
Definición rigurosa
Aplicación determinista de un espacio de descripciones X hacia un espacio de decisiones Y, que asocia a toda descripción x de X una decisión única de Y: formalmente, una función h : X → Y. En clasificación, Y es un conjunto finito de modalidades; en regresión, un intervalo de números reales.
Traducción al lenguaje corriente
Un procedimiento que, para toda situación descrita, devuelve una decisión y solo una.
Punto esencial
Esta definición no presupone nada sobre el origen de la regla. Una cláusula
SI ... ENTONCES ..., un baremo reglamentario, un árbol aprendido con 200 000 expedientes
y una red neuronal son todos reglas de decisión en el sentido de esta
definición; solo difieren en la forma en que se obtuvo h.
Punto de vigilancia
Un modelo no es menos regla que una cláusula escrita a mano: es una regla cuyo enunciado nadie ha redactado. Esta propiedad fundamenta a la vez su potencia y su dificultad de auditoría.
Los dos paradigmas pertenecen a dos modos de inferencia distintos, identificados por la lógica mucho antes que la informática.
Deducción
Modo de inferencia por el cual una conclusión se deriva de premisas según reglas de transformación que preservan la verdad. Si las premisas son verdaderas y la derivación es válida, la conclusión es necesariamente verdadera. Ilustración: «Todo envío que contiene un adjunto ejecutable se bloquea. Este envío contiene uno. Por tanto, se bloquea.»
Inducción
Modo de inferencia por el cual una proposición general se forma a partir de un conjunto finito de observaciones particulares. La conclusión excede el contenido de las premisas: no está garantizada, solo es más o menos probable a la vista de las observaciones. Ilustración: «De 40 000 correos observados, los que presentaban ciertas combinaciones de términos fueron señalados como no deseados en el 96 % de los casos. Por tanto, un nuevo envío que presente esas combinaciones es probablemente no deseado.»
El problema de la inducción
La inducción no proporciona ninguna garantía lógica. La teoría estadística del aprendizaje (Vapnik y Chervonenkis, años 1970) no elimina esta objeción: la acota mediante garantías probabilísticas condicionadas a hipótesis explícitas, la principal de las cuales es que los datos futuros provienen de la misma distribución que los datos de aprendizaje.
Consecuencia operativa
Un sistema determinista es falso cuando su regla es falsa. Un sistema inductivo es falso una parte del tiempo por construcción, incluso cuando todo se ha realizado correctamente.
| Criterio | Deducción | Inducción |
|---|---|---|
| Sentido de la inferencia | De lo general a lo particular | De lo particular a lo general |
| Estatus de la conclusión | Necesaria si las premisas son verdaderas | Probable, revisable |
| Contenido de la conclusión | Contenido en las premisas | Excede las premisas |
| Efecto de una observación nueva | Ninguno sobre la regla | Puede revisar la regla |
| Paradigma correspondiente | Programación determinista | Machine Learning |
| Modo de fallo | Regla mal especificada | Generalización insuficiente |
Definición rigurosa
Se postula la existencia de una función objetivo f : X → Y, desconocida, que relaciona el espacio de las descripciones X con el espacio de los valores a predecir Y; solo es accesible a través de una muestra finita de pares observados (x₁, y₁), ..., (xₙ, yₙ). El algoritmo selecciona, dentro de un conjunto de hipótesis H fijado por la elección de la familia de modelos, una hipótesis f̂ («f sombrero») que minimiza una medida de error sobre la muestra, con la esperanza de que f̂ se aproxime a f en todo el dominio.
Traducción al lenguaje corriente
Existe una relación real entre lo que se observa y lo que se quiere predecir. Nadie conoce su enunciado; se construye una imitación a partir de los ejemplos disponibles.
Las tres brechas entre f̂ y f
Punto de vigilancia
La existencia de f es una hipótesis de trabajo, no un hecho establecido. Cuando el objetivo depende de factores ausentes de las descripciones x, ninguna función de X hacia Y es exacta, sea cual sea el algoritmo. Este punto se desarrolla en el apartado 5.
El caso siguiente reconstruye una trayectoria típica del filtrado de correos electrónicos entre mediados de los años 1990 y mediados de los años 2000. Los órdenes de magnitud son representativos.
Mes 1 — tres reglas bastan.
SI el asunto contiene "viagra" ENTONCES spam
SI el asunto contiene "lotería" ENTONCES spam
SI el cuerpo contiene "haga clic aquí" ENTONCES spamTres reglas escritas en media jornada interceptan el 82 % de los envíos no deseados, con un coste de mantenimiento nulo.
Mes 3 — la ofuscación. Los emisores modifican la ortografía de los términos
filtrados: V1AGRA, V-I-A-G-R-A, VÍAGRA, \/IAGRA, Vi@gra, o la misma
grafía en caracteres cirílicos homoglifos. La tasa de interceptación cae al
51 % en tres semanas; el equipo añade una regla por grafía observada y el
corpus pasa de 3 a 47 reglas.
Mes 6 — los falsos positivos. Las reglas acumuladas bloquean envíos legítimos: la correspondencia de una farmacia asociada, un boletín informativo médico seguido por 4 000 clientes, las campañas del marketing interno que contienen «haga clic aquí». Tres incidentes llegan a la dirección en un mes. El equipo ya no se atreve a eliminar reglas, pues cada una intercepta spam real: añade excepciones, listas de remitentes autorizados y exenciones por dominio. El corpus pasa a 210 reglas, de las cuales 60 son reglas de excepción a otras reglas.
Mes 12 — los nuevos vectores. El texto pasa a imagen, luego a archivo adjunto, luego se fragmenta con caracteres invisibles; cada vector exige una familia de reglas distinta: 610 reglas.
Mes 24 — la ingobernabilidad.
| Indicador | Mes 1 | Mes 6 | Mes 12 | Mes 24 |
|---|---|---|---|---|
| Número de reglas | 3 | 210 | 610 | 1 800 |
| Tasa de interceptación | 82 % | 79 % | 77 % | 76 % |
| Tasa de falsos positivos | 0,1 % | 0,9 % | 1,6 % | 2,3 % |
| Personas asignadas al mantenimiento | 0 | 1 | 2 | 3 |
| Plazo de reacción ante una campaña nueva | 1 día | 3 días | 7 días | 11 días |
| Proporción de reglas cuyo autor es identificable | 100 % | 70 % | 35 % | 12 % |
Ninguna persona del equipo conoce el conjunto de las 1 800 reglas y toda modificación produce regresiones imprevisibles en otras partes del corpus. El rendimiento ha bajado a pesar de un esfuerzo de mantenimiento multiplicado por tres.
El fracaso no es imputable a la incompetencia del equipo. Es estructural.
| Mecanismo | Efecto sobre el corpus de reglas | Magnitud en juego |
|---|---|---|
| Explosión combinatoria | El número de casos a cubrir crece más rápido que la capacidad de escritura | Número de variantes de un patrón |
| Acoplamiento entre reglas | Toda regla nueva modifica el comportamiento de las reglas existentes | Número de pares de reglas |
| Obsolescencia adversarial | Las reglas caducan a un ritmo impuesto por un tercero hostil | Brecha entre ciclo de ataque y ciclo de corrección |
Mecanismo 1 — la explosión combinatoria. Un único término de seis caracteres
admite un número de grafías equivalentes que crece multiplicativamente: cuatro
sustituciones plausibles para la vocal i, cuatro para la a, dos para la
g dan ya varias decenas de formas, y la inserción opcional de un
separador entre cada una de las cinco posiciones internas multiplica ese número por
2⁵ = 32. El orden de magnitud supera las 10⁴ formas para una sola palabra. La escritura
manual progresa linealmente cuando el espacio a cubrir crece
exponencialmente: ningún esfuerzo de mantenimiento cierra esa brecha.
Mecanismo 2 — el acoplamiento entre reglas. Un corpus de n reglas presenta n(n−1)/2 pares susceptibles de interactuar.
| Número de reglas | 3 | 47 | 210 | 610 | 1 800 |
|---|---|---|---|---|---|
| Número de pares | 3 | 1 081 | 21 945 | 185 745 | 1 619 100 |
Verificar que una regla nueva no entra en conflicto con ninguna otra supone examinar 1 800 interacciones en cada adición. Al no ser realizable manualmente, esta verificación no se efectúa: las regresiones se descubren en producción, por los usuarios.
Mecanismo 3 — la obsolescencia frente a un adversario adaptativo.
Definición rigurosa
Agente cuya función objetivo incluye la elusión del sistema de decisión, y que dispone de una señal de observación sobre las decisiones de ese sistema que le permite ajustar su comportamiento.
Traducción al lenguaje corriente
Un actor que tiene interés en engañar al sistema, que ve lo que pasa y lo que se bloquea, y adapta sus envíos en consecuencia.
La propiedad crítica: la asimetría de los ciclos
El emisor prueba una variante y observa el resultado en pocas horas, con un coste casi nulo; el equipo debe constatar la caída, diagnosticar el vector, redactar la regla, verificar su inocuidad y desplegarla, es decir, varios días. Mientras el atacante itere más rápido que el defensor, el rendimiento tiende hacia el de un sistema que ya solo filtra las campañas obsoletas.
Punto de vigilancia
Esta propiedad no es exclusiva de los sistemas basados en reglas: un modelo confrontado a un adversario adaptativo también se degrada. La diferencia reside en el coste unitario de la actualización — reentrenar es una operación instrumentada y repetible, reescribir 1 800 reglas no lo es.
En lugar de especificar los patrones característicos del spam, se constituye un corpus de correos cuya naturaleza es conocida y el algoritmo identifica las regularidades discriminantes.
| Dimensión | Sistema basado en reglas | Sistema inductivo |
|---|---|---|
| Reacción ante una grafía nueva | Escritura de una regla dedicada | Absorbida si el corpus se actualiza |
| Esfuerzo de adaptación | Proporcional al número de variantes | Constante: reentrenar |
| Fuente de la señal | El analista que observa | Los reportes de los usuarios |
| Efecto del volumen de tráfico | Carga de mantenimiento creciente | Recurso adicional para el modelo |
| Legibilidad de la decisión | Alta: la regla activada tiene nombre | Reducida: ponderación de numerosos indicios |
Punto de vigilancia: la reformulación inductiva no elimina el trabajo, lo desplaza hacia el mantenimiento de un corpus etiquetado, de una cadena de reentrenamiento y de una supervisión del rendimiento. La ganancia reside en que ese trabajo es instrumentable y repetible, no en su desaparición.
El orden de las preguntas no es indiferente: la primera nunca es «qué algoritmo emplear» sino «¿la regla es conocida?». El Machine Learning solo es pertinente cuando la respuesta es negativa.
| Condición | Justificación | Ilustración |
|---|---|---|
| La regla no es formalizable | Los criterios de decisión no son verbalizables, ni siquiera por los expertos que los aplican | Reconocimiento de un rostro, apreciación de un riesgo compuesto |
| Los factores e interacciones son numerosos | La escritura manual diverge y el acoplamiento entre reglas se vuelve ingobernable | Scoring de crédito con 60 variables |
| El entorno evoluciona | Las reglas escritas caducan; el reentrenamiento absorbe la evolución a coste constante | Detección de fraude, filtrado de correos |
| La personalización debe ser masiva | Una regla por individuo es imposible de escribir y mantener | Recomendación sobre varios millones de cuentas |
| Una respuesta aproximada es aceptable | El modelo produce una estimación acompañada de una incertidumbre, nunca una certeza | Estimación de precios, previsión de demanda |
| Existe un histórico etiquetado suficiente | La inducción requiere observaciones cuyo valor objetivo es conocido | Transacciones con resultado constatado |
Estas seis condiciones son conjuntas: un problema que satisface cinco y falla en la sexta —típicamente la ausencia de histórico etiquetado— no pertenece al Machine Learning en su estado actual.
| Contraindicación | Razón | Alternativa |
|---|---|---|
| La regla exacta es conocida, estable y verificable | El modelo sustituiría una respuesta exacta por una aproximación, sin contrapartida | Implementar la fórmula |
| La exactitud es una obligación legal o contractual | Una aproximación estadística es jurídicamente inadmisible sobre un importe debido | Regla explícita, auditada, versionada |
| El volumen de observaciones es insuficiente | La inducción sobre una muestra demasiado pequeña produce una regla no generalizable | Experiencia de negocio, recolección previa |
| El error es catastrófico e irrecuperable | Ningún modelo alcanza el 100 %: la fracción residual de errores es estructural | Supervisión humana sistemática |
| No existe ningún histórico, al ser el proceso nuevo | No hay nada que inducir | Prototipado, reglas provisionales, recolección instrumentada |
Definición rigurosa
Propiedad de un sistema de decisión que permite reconstruir, para toda decisión producida, la cadena de justificación que condujo a ella y el estado exacto del sistema en esa fecha, de forma reproducible por un tercero. Exige que la regla aplicada sea enunciable, que la versión vigente se conserve y que el resultado sea reproducible de forma idéntica.
Punto de vigilancia
Un modelo estadístico satisface la reproducibilidad pero hace difícil el enunciado de la regla: los métodos de explicación a posteriori producen una justificación aproximada de la decisión, no su enunciado. Cuando la obligación recae sobre la motivación individual, esa aproximación puede ser insuficiente.
Situación 1 — la regla es conocida, exacta y estable. Cálculo de un impuesto sobre ventas, conversión a un tipo publicado, vencimiento de un préstamo a tipo fijo, control de un identificador mediante clave. Un modelo entrenado para reproducir estas operaciones alcanzaría el 99,7 % de exactitud donde la implementación directa alcanza el 100 %: la sustitución es una regresión pura.
Situación 2 — no hay ningún histórico disponible. Un proceso creado la semana anterior no dispone de ninguna observación cuyo valor objetivo sea conocido. La cuestión no es elegir un algoritmo sino instrumentar el proceso para que las observaciones se recojan y etiqueten.
Situación 3 — la auditabilidad es una obligación. Cuando una decisión debe motivarse individualmente ante el interesado o un regulador, la capacidad de enunciar la regla aplicada se convierte en una restricción de diseño al mismo nivel que el rendimiento. Un modelo sigue siendo pertinente entonces como apoyo a la decisión, siendo la decisión impugnable producida por una regla explícita o por un operador.
Este apartado es el más importante del capítulo: distingue una comprensión técnica de una comprensión operativa.
Ningún modelo de Machine Learning alcanza el 100 % de exactitud sobre datos nuevos.
Este enunciado se deriva de la naturaleza inductiva de la inferencia: la regla se extrapola de una muestra finita hacia un dominio que la supera. Una exactitud del 100 % anunciada sobre datos nuevos señala, en la práctica, una fuga de datos, tratada en el capítulo 028, o una evaluación realizada sobre los datos de aprendizaje. La pregunta pertinente nunca es, por tanto, «¿el modelo se equivoca?», sino:
¿Quién trata los errores, a qué coste y en qué plazo?
Un modelo que alcanza el 95 % de exactitud se presenta generalmente como un buen modelo. Referido al volumen tratado:
Volumen diario de decisiones : 100 000
Exactitud del modelo : 95 %
Decisiones correctas : 95 000
Decisiones erróneas : 5 000 por día| Hipótesis de tratamiento | Carga inducida | Conclusión |
|---|---|---|
| Ningún tratamiento, error sin consecuencia | Nula | Modelo desplegable tal cual |
| Tratamiento por el usuario final, 30 segundos | 42 horas de atención por día, difusas | Aceptable si el error es visible y corregible |
| Revisión humana interna, 4 minutos por caso | 333 horas por día, alrededor de 42 puestos a tiempo completo | El dispositivo de recuperación cuesta más que el modelo |
| Error no detectable por el usuario | Carga nula, riesgo no acotado | Configuración más peligrosa |
La última línea es la más importante: un error costoso pero visible es un problema de dimensionamiento, un error silencioso es un problema de diseño.
| Contexto | Naturaleza del error | Gravedad | Reversibilidad | ML apropiado |
|---|---|---|---|---|
| Recomendación de contenido | Sugerencia no pertinente | Baja | Inmediata: el usuario ignora la sugerencia | Sí, sin reservas |
| Filtrado de correos | Falso positivo: envío legítimo puesto en cuarentena | Media | Buena si la cuarentena es consultable | Sí, a condición de una cuarentena accesible |
| Mantenimiento predictivo | Alerta injustificada o avería no anticipada | Media a alta | Parcial: coste de intervención o coste de parada | Sí, con umbral asimétrico |
| Concesión de crédito | Rechazo injustificado a un solicitante solvente | Alta | Baja: perjuicio sufrido, litigio posible | Sí, bajo restricción de explicabilidad y de recurso |
| Moderación automática | Eliminación de un contenido lícito | Alta | Condicionada a la existencia de una vía de recurso | Sí, con reexamen humano garantizado |
| Diagnóstico médico | Falso negativo: patología no detectada | Muy alta | Baja a nula | No en decisión autónoma: apoyo a la decisión |
| Cálculo de nómina o de impuestos | Importe erróneo | Alta | Corrección posible, pero incumplimiento de una obligación de exactitud | No: la regla exacta existe |
Deben dominarse tres lecturas.
Primera lectura: la gravedad depende del contexto de uso, no de la tasa de error. El mismo modelo al 95 % es excelente en recomendación e inaceptable en cálculo de nómina.
Segunda lectura: la reversibilidad es el criterio operativo decisivo. Un error grave pero recuperable se gestiona por diseño —umbral prudente, cola de verificación, vía de recurso—; un error irreversible no se gestiona así.
Tercera lectura: los dos tipos de error de un clasificador no tienen el mismo coste. Esta asimetría es un parámetro de diseño, ajustable mediante el umbral de decisión.
Una cadena de producción no busca el defecto cero a cualquier precio: dimensiona una tasa de defectos aceptable, y luego diseña el dispositivo de detección y de recuperación correspondiente. Esa tasa no depende de la máquina, sino del coste unitario de un defecto que sale, del coste del control y del volumen producido. Un responsable que exige cero defectos sin dimensionar el control no obtiene cero defectos: obtiene defectos no detectados.
La tasa de error aceptable de un modelo es igualmente una decisión de ingeniería, nunca una propiedad del algoritmo.
Los cuatro límites siguientes no son defectos de implementación: se derivan de la naturaleza inductiva del enfoque y no los elimina ningún algoritmo, ninguna arquitectura ni ningún volumen de datos.
Enunciado
Un algoritmo de aprendizaje extrae regularidades presentes en las descripciones proporcionadas. No puede fundamentar una decisión en un factor que no aparece en ninguna variable, ni directamente ni por correlación.
Ilustración
Un modelo de estimación inmobiliaria alimentado por la superficie y el número de habitaciones no puede valorar ni la vista, ni la orientación, ni el estado del tejado, que sin embargo determinan una parte sustancial del precio. El modelo no señala esta insuficiencia: produce una estimación cuyo error residual se atribuirá al «ruido» cuando en realidad refleja una información faltante.
Consecuencia práctica
El techo de rendimiento lo fija el contenido informacional de las variables, no la elección del algoritmo. Este límite explica una decepción frecuente: pasar de una regresión a un método de ensamble sofisticado solo aporta unos pocos puntos cuando la información necesaria está ausente del conjunto de datos.
Enunciado
Un modelo predictivo identifica asociaciones estadísticas entre variables explicativas y variable objetivo. Una asociación no es una relación de causa a efecto: un modelo eficaz puede apoyarse en asociaciones cuya interpretación causal es falsa, o incluso invertida.
El caso documentado asma y neumonía
Un estudio de los años 1990 sobre pacientes ingresados por neumonía buscaba predecir el riesgo de fallecimiento con el fin de orientar a los pacientes de bajo riesgo hacia una atención ambulatoria. El modelo aprendió una regla exacta sobre los datos y peligrosa en la práctica:
Los pacientes con neumonía que tienen antecedentes de asma presentan un riesgo de fallecimiento más bajo.
La asociación es real en los datos. Su explicación: esos pacientes eran sistemáticamente ingresados en cuidados intensivos debido a su antecedente, allí recibían una atención inmediata y agresiva, y por tanto sobrevivían más. La regla inducida era una consecuencia del protocolo de atención, no una propiedad clínica; aplicada tal cual, habría orientado hacia el domicilio precisamente a los pacientes que el protocolo existente protegía. El modelo no era defectuoso —reproducía fielmente los datos— y solo una relectura por parte de clínicos permitió detectar la anomalía.
Este caso lo relatan en particular Cooper y sus coautores (1997), y luego lo retoman y analizan Caruana y sus coautores (2015) en sus trabajos sobre los modelos inteligibles en salud.
Formulación a recordar
Un modelo predice lo que ocurre en las condiciones en que se produjeron los datos. No predice lo que ocurriría si se interviniera sobre esas condiciones. Toda decisión de intervención basada en un modelo puramente predictivo sale del dominio de validez de ese modelo.
Enunciado
El marco estadístico del aprendizaje supervisado supone que los datos de explotación provienen de la misma distribución que los datos de aprendizaje. Cuando esta hipótesis deja de verificarse, las garantías de rendimiento caen.
Dos formas de ruptura
Consecuencia práctica
Causas habituales: cambio de comportamiento de los clientes, modificación del producto o del proceso de negocio, evolución regulatoria, adaptación de un adversario, modificación de un sensor, choque externo. Un modelo en producción no tiene, por tanto, un rendimiento constante: posee una duración de validez, que debe supervisarse y no suponerse. Una puesta en producción sin dispositivo de supervisión es una decisión de explotación incompleta. La deriva, su detección y las estrategias de reentrenamiento se tratan en el capítulo 082.
Enunciado
La calidad de la regla inducida está acotada por la calidad y la representatividad de las observaciones proporcionadas. Datos erróneos, sesgados o mal etiquetados producen una regla errónea, sesgada o mal calibrada.
El agravante propio del Machine Learning
Un programa determinista alimentado con datos inválidos falla de forma visible: excepción, valor aberrante, rechazo de control. Un algoritmo de aprendizaje, en cambio, no falla: converge, produce un modelo, y ese modelo produce predicciones de apariencia normal. El fallo es silencioso.
| Defecto de los datos | Efecto sobre el modelo | Manifestación |
|---|---|---|
| Etiquetas parcialmente erróneas | La regla inducida reproduce el error de etiquetado | Rendimiento aparente correcto, decisiones falsas |
| Población no representativa | La regla solo vale para un subgrupo | Brecha de rendimiento entre segmentos |
| Variable no disponible en el momento de la decisión | Rendimiento excelente en test, colapso en producción | Fuga de datos, capítulo 028 |
| Clases fuertemente desequilibradas | El modelo privilegia la clase mayoritaria | Exactitud alta, detección nula en la clase rara, capítulo 050 |
Punto de vigilancia
La ausencia de error de ejecución nunca constituye una prueba de validez para un sistema inductivo. La validación exige un examen de los datos, un análisis de los errores por segmento y una confrontación de las regularidades aprendidas con el conocimiento de negocio.
El objetivo es estimar el precio de venta de una casa, conduciendo los dos enfoques en paralelo sobre los mismos inmuebles.
Un experto del sector propone una fórmula basada en su experiencia:
precio = superficie_m2 x 3 500 + numero_de_habitaciones x 10 000| Inmueble | Superficie | Habitaciones | Precio calculado | Precio real | Error | Error relativo |
|---|---|---|---|---|---|---|
| A | 90 m² | 3 | 345 000 $ | 352 000 $ | −7 000 $ | 2,0 % |
| B | 120 m² | 4 | 460 000 $ | 448 000 $ | +12 000 $ | 2,7 % |
| C | 75 m² | 2 | 282 500 $ | 291 000 $ | −8 500 $ | 2,9 % |
| D | 140 m² | 4 | 530 000 $ | 690 000 $ | −160 000 $ | 23,2 % |
En los tres primeros inmuebles la fórmula es aceptable; en el cuarto, falla por 160 000 dólares. Una desviación de este orden descalifica la herramienta: ningún profesional basa una negociación en una estimación cuyo error posible alcanza la cuarta parte del valor.
| Factor | Situación del inmueble D | Efecto sobre el precio |
|---|---|---|
| Barrio | Zona escolar demandada, estación de transporte a 300 metros | Fuerte, multiplicativo |
| Renovación | Cocina y baño renovados 18 meses antes de la venta | Aditivo, sustancial |
| Garaje | Garaje doble, raro en la zona | Aditivo, moderado |
La corrección parece simple: añadir los términos faltantes.
precio = superficie_m2 x A + numero_de_habitaciones x B + garaje x C
+ renovacion_reciente x D + indice_de_barrio x E + FLa estructura es plausible. El problema está en otra parte:
¿Cuáles son los valores de A, B, C, D, E y F?
Nadie los conoce. No figuran en ningún referencial y varían según la ciudad, el segmento y el período. Un experto puede proponer un orden de magnitud para A; no puede arbitrar entre 34 000 y 41 000 dólares para el valor de una renovación, ni cuantificar el índice de barrio en una escala coherente con los demás términos. A ello se suman las interacciones —el valor de una renovación depende del barrio—, las no linealidades y la inestabilidad: los coeficientes estarán caducados en dieciocho meses.
Conclusión: la estructura del problema es identificable por un experto; sus parámetros no lo son. Es exactamente la configuración que requiere un enfoque inductivo.
Se reúnen las ventas cerradas, descritas por las mismas variables, con el precio constatado.
| Superficie | Habitaciones | Garaje | Renovada | Índice barrio | Precio constatado |
|---|---|---|---|---|---|
| 90 m² | 3 | 0 | 0 | 3 | 352 000 $ |
| 120 m² | 4 | 1 | 0 | 3 | 448 000 $ |
| 75 m² | 2 | 0 | 0 | 3 | 291 000 $ |
| 140 m² | 4 | 1 | 1 | 7 | 690 000 $ |
| 105 m² | 3 | 1 | 0 | 5 | 468 000 $ |
| 160 m² | 5 | 1 | 1 | 6 | 712 000 $ |
| 82 m² | 2 | 0 | 1 | 4 | 371 000 $ |
El conjunto real comprende varios miles de filas de esta forma, y el procedimiento de aprendizaje cabe en tres instrucciones:
X = donnees[["surface", "chambres", "garage", "renovee", "indice_quartier"]]
y = donnees["prix"]
model.fit(X, y)La llamada model.fit(X, y) es la operación de inducción: el algoritmo busca
los coeficientes que minimizan la desviación entre precios calculados y precios constatados sobre
el conjunto de las ventas.
| Término | Coeficiente estimado | Lectura de negocio |
|---|---|---|
| Superficie | 3 120 $ por m² | Valor marginal del metro cuadrado |
| Habitaciones | 6 400 $ por habitación | Efecto propio, controlada la superficie |
| Garaje | 14 900 $ | Prima por un garaje |
| Renovación reciente | 38 200 $ | Prima por una renovación reciente |
| Índice de barrio | 21 500 $ por punto | Efecto de la zona |
| Constante | 18 700 $ | Ordenada en el origen |
Ninguno de estos valores fue proporcionado: fueron inducidos de las ventas observadas. El coeficiente de superficie difiere de la intuición del experto —3 120 en lugar de 3 500— porque la estimación inicial absorbía implícitamente efectos que ahora captan los demás términos.
Predicción sobre un inmueble nunca visto:
Inmueble E: 110 m², 3 habitaciones, garaje, no renovada, índice de barrio 4
110 x 3 120 = 343 200
3 x 6 400 = 19 200
garaje = 14 900
renovación = 0
4 x 21 500 = 86 000
constante = 18 700
-----------------------
Estimación = 482 000 $En uso profesional, esta estimación puntual va acompañada de un intervalo y de un error medio establecidos durante la evaluación.
| Criterio | Enfoque determinista | Enfoque inductivo |
|---|---|---|
| Origen de los coeficientes | Postulados por un experto, no verificables | Estimados a partir de las ventas constatadas |
| Consideración de un factor nuevo | Reescritura de la fórmula, arbitraje manual del coeficiente | Adición de una columna y reentrenamiento |
| Adaptación a un mercado diferente | Revisión completa de la experiencia experta | Reentrenamiento con los datos locales |
| Medida de la calidad | Desviación constatada a posteriori, sin protocolo | Error medido sobre ventas no utilizadas para el aprendizaje |
| Auditabilidad de la decisión | Alta: la fórmula es enunciable | Media a baja según la familia de modelos |
Lectura de la tabla: el enfoque inductivo gana en cuatro criterios y pierde en la auditabilidad. Este compromiso es representativo y se resuelve por el contexto de uso: una estimación indicativa destinada a un agente inmobiliario tolera una auditabilidad media; un valor de tasación impugnable ante un tribunal no la tolera.
El vocabulario de la prensa —«el algoritmo decide», «la máquina aprende sola»— alimenta la idea de una automatización integral de la cadena de decisión. El examen del ciclo real de un proyecto la contradice.
| Etapa del ciclo | Contenido de la decisión | Decisor |
|---|---|---|
| 1. Formular el problema de negocio | Determinar qué pregunta merece plantearse | Humano |
| 2. Decidir sobre la oportunidad del ML | Confrontar el problema con las condiciones del apartado 3 | Humano |
| 3. Definir la variable objetivo | Elegir qué se predice y cómo se mide | Humano |
| 4. Elegir y recoger los datos | Determinar fuentes, período, población | Humano |
| 5. Definir la medida de rendimiento y el umbral | Fijar qué constituye un éxito, arbitrar entre tipos de error | Humano |
| 6. Preparar los datos y construir las variables | Limpiar, codificar, agregar, derivar | Humano, con herramientas |
| 7. Elegir la familia de algoritmos | Arbitrar rendimiento, interpretabilidad, coste, restricciones | Humano |
| 8. Ajustar los parámetros del modelo | Estimar los coeficientes que minimizan el error sobre la muestra | Máquina |
| 9. Evaluar e interpretar los resultados | Analizar los errores, confrontar con el negocio, detectar las anomalías | Humano |
| 10. Decidir la puesta en producción | Decidir sobre el despliegue y sus salvaguardas | Humano |
| 11. Supervisar y arbitrar el reentrenamiento | Detectar la deriva, decidir retomar el ciclo | Humano |
De once etapas, la máquina cubre una, enteramente condicionada por las decisiones humanas que la preceden: los datos de la etapa 4, el objetivo de la etapa 3, la medida de error de la etapa 5 y la familia de modelos de la etapa 7 determinan íntegramente lo que la etapa 8 puede producir.
Los bloques en tono oscuro pertenecen a la decisión humana. El bloque en tono claro es la única etapa ejecutada por la máquina.
Un espectrómetro produce medidas que ningún operador podría obtener a ojo: es irremplazable en ese segmento de la cadena. No elige la pregunta de investigación, no toma la muestra, no define el protocolo, no interpreta los resultados y no decide publicar. Un algoritmo de aprendizaje ocupa exactamente la misma posición.
Definición rigurosa
Posición de un sistema automatizado en la escala que va de la simple producción de información a la decisión ejecutada sin intervención humana, caracterizada por el rol asignado al operador en el bucle de decisión.
Los tres regímenes habituales
| Régimen | Rol del humano | Contexto de empleo |
|---|---|---|
| Apoyo a la decisión | El humano decide, el modelo informa | Error grave, decisión motivada, experiencia experta indispensable |
| Humano en el bucle por excepción | El modelo decide, el humano arbitra los casos incierto | Volumen alto, errores recuperables, incertidumbre identificable |
| Automatización completa | El modelo decide solo, el humano supervisa los agregados | Error de baja gravedad, volumen masivo, reversibilidad inmediata |
Punto de vigilancia
El régimen de autonomía es una decisión de diseño, independiente del rendimiento del modelo. Un modelo muy eficaz puede desplegarse como apoyo a la decisión porque el contexto lo exige; un modelo mediocre puede automatizarse plenamente porque allí el error no tiene consecuencias.
Síntoma: formular la elección como una modernización, u oponer un método «superado» a un método «actual».
Razón: los dos enfoques responden a dos configuraciones distintas. El Machine Learning no aporta nada cuando la regla es conocida, exacta y estable; introduce allí una aproximación sin contrapartida.
Formulación correcta: «La programación determinista y el aprendizaje inductivo tratan dos configuraciones diferentes. El criterio de elección es la disponibilidad de una regla exacta y estable, no la antigüedad del método.»
Síntoma: describir el proyecto como «se le dan los datos al algoritmo y lo encuentra todo solo».
Razón: el algoritmo solo ejecuta una etapa de once. La elección del objetivo, de los datos, de la medida de rendimiento y de la familia de modelos es humana, y condiciona íntegramente el resultado obtenido.
Formulación correcta: «El algoritmo estima los parámetros. El encuadre del problema, la elección de los datos, la definición de la medida de rendimiento y la validación siguen siendo decisiones humanas.»
Síntoma: decidir intervenir sobre una variable porque el modelo le atribuye un peso importante — «el modelo muestra que los antecedentes de asma reducen el riesgo, así que esos pacientes pueden volver a casa».
Razón: un modelo predictivo restituye las regularidades del proceso que generó los datos, protocolos y políticas incluidos. No dice nada sobre lo que se produciría si se modificara ese proceso.
Formulación correcta: «El modelo establece una asociación válida en las condiciones de producción de los datos. Toda decisión de intervención sobre una variable exige un análisis causal distinto, con un protocolo adecuado.»
Síntoma: concluir el despliegue sobre la única base de una cifra global, sin examinar el volumen ni la naturaleza de los errores restantes.
Razón: el 95 % de exactitud sobre 100 000 decisiones diarias representa 5 000 errores por día. La pertinencia del despliegue depende de su gravedad, de su detectabilidad, de su reversibilidad y del coste de su tratamiento.
Formulación correcta: «La tasa de exactitud no basta. Hay que establecer el volumen de errores esperado, la gravedad de cada tipo de error, quién los detecta y a qué coste se recuperan.»
Síntoma: entregar un modelo sin dispositivo de supervisión, considerando el proyecto terminado en la puesta en producción.
Razón: las garantías del aprendizaje suponen que los datos de explotación siguen la misma distribución que los datos de aprendizaje. Esta hipótesis deja de verificarse en cuanto los usuarios, el producto, la regulación o un adversario evolucionan.
Formulación correcta: «Un modelo posee una duración de validez. La puesta en producción incluye la supervisión del rendimiento y un procedimiento de reentrenamiento.» El tema se trata en el capítulo 082.
LA INVERSIÓN
Programación determinista : Reglas + Datos -> Respuestas
Aprendizaje inductivo : Datos + Respuestas -> REGLAS
La regla es una ENTRADA en el primer caso, una SALIDA en el segundo.
MODO DE INFERENCIA
Determinista : deducción, conclusión necesaria
Inductivo : inducción, conclusión probable y revisable
MARCO FORMAL
f función objetivo, desconocida, nunca observada
f^ hipótesis retenida por el algoritmo, aproximación de f
Brechas : aproximación (modelo), estimación (datos), deriva (tiempo)
CRITERIO DE ELECCIÓN, EN ORDEN
1. ¿La regla exacta es conocida y estable? -> determinista
2. ¿Existe un histórico etiquetado suficiente? -> si no, recoger
3. ¿Una respuesta aproximada es aceptable? -> si no, determinista
4. ¿El coste de los errores es controlable? -> si no, apoyo a la decisión
5. En caso contrario -> enfoque inductivo
EL CÁLCULO QUE HAY QUE PLANTEAR SISTEMÁTICAMENTE
95 % de exactitud sobre 100 000 decisiones = 5 000 errores por día
Pregunta : ¿quién los trata, a qué coste, en qué plazo?
Caso más peligroso : el error no detectable.
LOS CUATRO LÍMITES ESTRUCTURALES
1. No se crea ninguna información si está ausente de los datos
2. Asociación aprendida no es causalidad establecida
3. La estacionariedad de la relación es una hipótesis, no un hecho
4. Datos defectuosos -> modelo defectuoso, sin ninguna señal de error
DISTRIBUCIÓN DE ROLES
11 etapas en el ciclo. La máquina cubre 1 :
el ajuste de los parámetros. Las otras 10 son decisiones humanas.Enunciado de síntesis
La programación determinista y el aprendizaje inductivo se distinguen por la posición de la regla de decisión: especificada como entrada en el primer caso, inducida como salida en el segundo. El enfoque inductivo solo es pertinente cuando la regla exacta es inaccesible, existe un histórico etiquetado, una respuesta aproximada es aceptable y el coste de los errores residuales está controlado; la máquina solo se hace cargo allí de una etapa, el ajuste de los parámetros, perteneciendo todas las demás a la decisión humana.
Quiz y preguntas de entrevista: 002.1-quiz-renversement-paradigme.md a
002.7-quiz-roles-humain-machine.md
Capítulo siguiente: 003-trois-familles-apprentissage.md