Programação determinística e aprendizado indutivo

32 min
Bloco 0 — Situar o aprendizado supervisionado
Objetivo
dominar a inversão de paradigma que fundamenta o Machine Learning, saber decidir se um problema pertence a uma abordagem determinística ou a uma abordagem indutiva, e saber justificar essa decisão pelo custo dos erros e pela divisão de papéis entre humano e máquina.
Duração estimada
35 minutos
Pré-requisitos
capítulo 001
Quizzes associados
002.1-quiz-renversement-paradigme.md a 002.7-quiz-roles-humain-machine.md

1. A inversão de paradigma

O capítulo 001 estabeleceu que o Machine Learning é uma abordagem da inteligência artificial baseada na indução. Este capítulo estabelece o que essa fórmula implica na concepção de um sistema.

1.1 Os dois esquemas

Os dois paradigmas mobilizam os mesmos três objetos — regras, dados, respostas — e só mudam sua posição na cadeia de produção.

ParadigmaEntradas fornecidasSaída produzidaAutor das regras
Programação determinísticaRegras + DadosRespostasUm projetista humano
Aprendizado indutivoDados + RespostasRegrasO algoritmo, a partir das observações

O ponto discriminante: no primeiro paradigma, a regra é uma entrada do sistema; no segundo, ela é a saída.

1.2 O que é uma regra de decisão

DEFINIÇÃO — Regra de decisão

Definição rigorosa

Aplicação determinística de um espaço de descrições X para um espaço de decisões Y, associando a toda descrição x de X uma decisão única de Y: formalmente, uma função h : X → Y. Em classificação, Y é um conjunto finito de modalidades; em regressão, um intervalo de números reais.

Tradução em linguagem corrente

Um procedimento que, para toda situação descrita, devolve uma decisão e apenas uma.

Ponto essencial

Esta definição não pressupõe nada sobre a origem da regra. Uma cláusula SE ... ENTÃO ..., uma tabela regulamentar, uma árvore aprendida com 200 000 dossiês e uma rede neural são todas regras de decisão no sentido desta definição; elas diferem apenas pela forma como h foi obtida.

Ponto de atenção

Um modelo não é menos uma regra do que uma cláusula escrita à mão: é uma regra cujo enunciado ninguém redigiu. Essa propriedade fundamenta ao mesmo tempo sua potência e sua dificuldade de auditoria.

1.3 Dedução e indução

Os dois paradigmas pertencem a dois modos de inferência distintos, identificados pela lógica muito antes da computação.

DEFINIÇÃO — Dedução e indução

Dedução

Modo de inferência pelo qual uma conclusão é derivada de premissas segundo regras de transformação que preservam a verdade. Se as premissas são verdadeiras e a derivação é válida, a conclusão é necessariamente verdadeira. Ilustração: "Todo envio contendo um anexo executável é bloqueado. Este envio contém um. Logo, ele é bloqueado."

Indução

Modo de inferência pelo qual uma proposição geral é formada a partir de um conjunto finito de observações particulares. A conclusão excede o conteúdo das premissas: ela não é garantida, apenas mais ou menos provável à luz das observações. Ilustração: "Em 40 000 e-mails observados, aqueles que apresentavam certas combinações de termos foram sinalizados como indesejados em 96 % dos casos. Logo, um novo envio que apresente essas combinações é provavelmente indesejado."

O problema da indução

A indução não fornece nenhuma garantia lógica. A teoria estatística do aprendizado (Vapnik e Chervonenkis, anos 1970) não elimina essa objeção: ela a limita por garantias probabilísticas condicionadas a hipóteses explícitas, cuja principal é que os dados futuros provêm da mesma distribuição que os dados de treinamento.

Consequência operacional

Um sistema determinístico está errado quando sua regra está errada. Um sistema indutivo está errado parte do tempo por construção, inclusive quando tudo foi corretamente realizado.

CritérioDeduçãoIndução
Sentido da inferênciaDo geral ao particularDo particular ao geral
Status da conclusãoNecessária se as premissas são verdadeirasProvável, revisável
Conteúdo da conclusãoContido nas premissasExcede as premissas
Efeito de uma observação novaNenhum sobre a regraPode revisar a regra
Paradigma correspondenteProgramação determinísticaMachine Learning
Modo de falhaRegra mal especificadaGeneralização insuficiente

1.4 A função-alvo desconhecida

DEFINIÇÃO — Função-alvo f e hipótese f chapéu

Definição rigorosa

Postula-se a existência de uma função-alvo f : X → Y, desconhecida, ligando o espaço das descrições X ao espaço dos valores a prever Y; ela só é acessível por meio de uma amostra finita de pares observados (x₁, y₁), ..., (xₙ, yₙ). O algoritmo seleciona, em um conjunto de hipóteses H fixado pela escolha da família de modelos, uma hipótese f̂ ("f chapéu") que minimiza uma medida de erro na amostra, na esperança de que f̂ se aproxime de f em todo o domínio.

Tradução em linguagem corrente

Existe uma relação real entre o que se observa e o que se quer prever. Ninguém conhece seu enunciado; constrói-se uma imitação dela a partir dos exemplos disponíveis.

As três lacunas entre f̂ e f

  • H pode não conter nenhuma função próxima de f — erro de aproximação, ligado à escolha do modelo.
  • A amostra é finita e ruidosa — erro de estimação, ligado aos dados.
  • A relação pode variar no tempo — deriva (drift), tratada no capítulo 082.

Ponto de atenção

A existência de f é uma hipótese de trabalho, não um fato estabelecido. Quando o alvo depende de fatores ausentes das descrições x, nenhuma função de X para Y é exata, qualquer que seja o algoritmo. Este ponto é desenvolvido na seção 5.


2. Estudo de caso: a deriva de um sistema baseado em regras

O caso a seguir reconstitui uma trajetória típica da filtragem de e-mails entre meados dos anos 1990 e meados dos anos 2000. As ordens de grandeza são representativas.

2.1 Cronologia

Mês 1 — três regras bastam.

SE o assunto contém "viagra"        ENTÃO spam
SE o assunto contém "loteria"       ENTÃO spam
SE o corpo contém "clique aqui"     ENTÃO spam

Três regras escritas em meio dia interceptam 82 % dos envios indesejados, com custo de manutenção nulo.

Mês 3 — a ofuscação. Os emissores modificam a grafia dos termos filtrados: V1AGRA, V-I-A-G-R-A, VÍAGRA, \/IAGRA, Vi@gra, ou a mesma grafia em caracteres cirílicos homóglifos. A taxa de interceptação cai para 51 % em três semanas; a equipe adiciona uma regra por grafia observada e o corpus passa de 3 para 47 regras.

Mês 6 — os falsos positivos. As regras acumuladas bloqueiam envios legítimos: a correspondência de uma farmácia parceira, um boletim informativo médico acompanhado por 4 000 clientes, as campanhas do marketing interno que contêm "clique aqui". Três incidentes chegam à diretoria em um mês. A equipe não ousa mais remover regras, cada uma interceptando spam real: ela adiciona exceções, listas de remetentes autorizados e derrogações por domínio. O corpus passa a 210 regras, das quais 60 são regras de exceção a outras regras.

Mês 12 — os novos vetores. O texto passa a imagem, depois a anexo, depois é fragmentado por caracteres invisíveis; cada vetor exige uma família de regras distinta: 610 regras.

Mês 24 — a ingovernabilidade.

IndicadorMês 1Mês 6Mês 12Mês 24
Número de regras32106101 800
Taxa de interceptação82 %79 %77 %76 %
Taxa de falsos positivos0,1 %0,9 %1,6 %2,3 %
Pessoas alocadas à manutenção0123
Tempo de reação a uma campanha nova1 dia3 dias7 dias11 dias
Parcela das regras cujo autor é identificável100 %70 %35 %12 %

Nenhuma pessoa da equipe conhece o conjunto das 1 800 regras e toda modificação produz regressões imprevisíveis em outro ponto do corpus. O desempenho caiu apesar de um esforço de manutenção multiplicado por três.

2.2 Os três mecanismos de degradação

O fracasso não é imputável à incompetência da equipe. Ele é estrutural.

MecanismoEfeito sobre o corpus de regrasGrandeza em jogo
Explosão combinatóriaO número de casos a cobrir cresce mais rápido que a capacidade de escritaNúmero de variantes de um padrão
Acoplamento entre regrasToda regra nova modifica o comportamento das regras existentesNúmero de pares de regras
Obsolescência adversarialAs regras ficam obsoletas em um ritmo imposto por um terceiro hostilDiferença entre ciclo de ataque e ciclo de correção

Mecanismo 1 — a explosão combinatória. Um único termo de seis caracteres admite um número de grafias equivalentes que cresce multiplicativamente: quatro substituições plausíveis para a vogal i, quatro para o a, duas para o g já dão várias dezenas de formas, e a inserção facultativa de um separador entre cada uma das cinco posições internas multiplica esse número por 2⁵ = 32. A ordem de grandeza ultrapassa 10⁴ formas para uma única palavra. A escrita manual progride linearmente enquanto o espaço a cobrir cresce exponencialmente: nenhum esforço de manutenção fecha essa lacuna.

Mecanismo 2 — o acoplamento entre regras. Um corpus de n regras apresenta n(n−1)/2 pares suscetíveis de interagir.

Número de regras3472106101 800
Número de pares31 08121 945185 7451 619 100

Verificar que uma regra nova não entra em conflito com nenhuma outra supõe examinar 1 800 interações a cada adição. Como essa verificação não é realizável manualmente, ela não é efetuada: as regressões são descobertas em produção, pelos usuários.

Mecanismo 3 — a obsolescência diante de um adversário adaptativo.

DEFINIÇÃO — Adversário adaptativo

Definição rigorosa

Agente cuja função-objetivo inclui contornar o sistema de decisão, e que dispõe de um sinal de observação sobre as decisões desse sistema que lhe permite ajustar seu comportamento.

Tradução em linguagem corrente

Um ator que tem interesse em enganar o sistema, que vê o que passa e o que é bloqueado, e adapta seus envios em consequência.

A propriedade crítica: a assimetria dos ciclos

O emissor testa uma variante e observa o resultado em algumas horas, a um custo quase nulo; a equipe precisa constatar a queda, diagnosticar o vetor, redigir a regra, verificar sua inocuidade e implantá-la, ou seja, vários dias. Enquanto o atacante iterar mais rápido que o defensor, o desempenho tende ao de um sistema que só filtra campanhas obsoletas.

Ponto de atenção

Essa propriedade não é exclusiva dos sistemas baseados em regras: um modelo confrontado com um adversário adaptativo também se degrada. A diferença está no custo unitário da atualização — retreinar é instrumentado e repetível, reescrever 1 800 regras não é.

2.3 A reformulação indutiva

Em vez de especificar os padrões característicos do spam, constitui-se um corpus de e-mails cuja natureza é conhecida e o algoritmo identifica as regularidades discriminantes.

DimensãoSistema baseado em regrasSistema indutivo
Reação a uma grafia novaEscrita de uma regra dedicadaAbsorvida se o corpus for atualizado
Esforço de adaptaçãoProporcional ao número de variantesConstante: retreinar
Fonte do sinalO analista que observaAs denúncias dos usuários
Efeito do volume de tráfegoCarga de manutenção crescenteRecurso adicional para o modelo
Legibilidade da decisãoElevada: a regra acionada é nomeadaReduzida: ponderação de numerosos indícios

Ponto de atenção: a reformulação indutiva não elimina o trabalho, ela o desloca para a manutenção de um corpus rotulado, de uma cadeia de retreinamento e de um monitoramento do desempenho. O ganho está no fato de esse trabalho ser instrumentável e repetível, não em seu desaparecimento.


3. Critérios de escolha entre abordagem determinística e abordagem indutiva

3.1 Árvore de decisão

A ordem das perguntas não é indiferente: a primeira nunca é "qual algoritmo empregar", mas "a regra é conhecida". O Machine Learning só é pertinente quando a resposta é negativa.

3.2 As seis condições de aplicabilidade

CondiçãoJustificativaIlustração
A regra não é formalizávelOs critérios de decisão não são verbalizáveis, inclusive pelos especialistas que os aplicamReconhecimento de um rosto, avaliação de um risco composto
Os fatores e interações são numerososA escrita manual diverge e o acoplamento entre regras torna-se ingovernávelScoring de crédito com 60 variáveis
O ambiente evoluiAs regras escritas ficam obsoletas; o retreinamento absorve a evolução a custo constanteDetecção de fraude, filtragem de e-mails
A personalização deve ser massivaUma regra por indivíduo é impossível de escrever e manterRecomendação para vários milhões de contas
Uma resposta aproximada é aceitávelO modelo produz uma estimativa acompanhada de uma incerteza, nunca uma certezaEstimativa de preço, previsão de demanda
Existe um histórico rotulado suficienteA indução requer observações cujo valor-alvo é conhecidoTransações com desfecho constatado

Essas seis condições são conjuntas: um problema que satisfaz cinco e falha na sexta — tipicamente a ausência de histórico rotulado — não pertence ao Machine Learning em seu estado atual.

3.3 As cinco contraindicações

ContraindicaçãoRazãoAlternativa
A regra exata é conhecida, estável e verificávelO modelo substituiria uma resposta exata por uma aproximação, sem contrapartidaImplementar a fórmula
A exatidão é uma obrigação legal ou contratualUma aproximação estatística é juridicamente inadmissível sobre um montante devidoRegra explícita, auditada, versionada
O volume de observações é insuficienteA indução sobre uma amostra pequena demais produz uma regra não generalizávelExpertise de negócio, coleta prévia
O erro é catastrófico e irrecuperávelNenhum modelo atinge 100 %: a fração residual de erros é estruturalSupervisão humana sistemática
Não existe nenhum histórico, pois o processo é novoNão há nada a induzirPrototipagem, regras provisórias, coleta instrumentada

3.4 As três situações em que o determinístico vence

DEFINIÇÃO — Auditabilidade de uma decisão automatizada

Definição rigorosa

Propriedade de um sistema de decisão que permite reconstituir, para toda decisão produzida, a cadeia de justificativa que a ela conduziu e o estado exato do sistema naquela data, de forma reprodutível por um terceiro. Ela exige que a regra aplicada seja enunciável, que a versão em vigor seja conservada e que o resultado seja reprodutível de forma idêntica.

Ponto de atenção

Um modelo estatístico satisfaz a reprodutibilidade, mas torna difícil o enunciado da regra: os métodos de explicação a posteriori produzem uma justificativa aproximada da decisão, não seu enunciado. Quando a obrigação recai sobre a motivação individual, essa aproximação pode ser insuficiente.

Situação 1 — a regra é conhecida, exata e estável. Cálculo de um imposto sobre vendas, conversão a uma taxa publicada, vencimento de um empréstimo a taxa fixa, controle de um identificador por dígito verificador. Um modelo treinado para reproduzir essas operações atingiria 99,7 % de exatidão onde a implementação direta atinge 100 %: a substituição é uma regressão pura.

Situação 2 — nenhum histórico está disponível. Um processo criado na semana anterior não dispõe de nenhuma observação cujo valor-alvo seja conhecido. A questão não é escolher um algoritmo, mas instrumentar o processo para que as observações sejam coletadas e rotuladas.

Situação 3 — a auditabilidade é uma obrigação. Quando uma decisão deve ser motivada individualmente perante o interessado ou um regulador, a capacidade de enunciar a regra aplicada torna-se uma restrição de projeto tanto quanto o desempenho. Um modelo permanece então pertinente como apoio à decisão, a decisão oponível sendo produzida por uma regra explícita ou por um operador.


4. O custo dos erros como critério de decisão

Este ponto é o mais importante do capítulo: ele distingue uma compreensão técnica de uma compreensão operacional.

4.1 O postulado de base

Nenhum modelo de Machine Learning atinge 100 % de exatidão em dados novos.

Esse enunciado decorre da natureza indutiva da inferência: a regra é extrapolada de uma amostra finita para um domínio que a ultrapassa. Uma exatidão de 100 % anunciada em dados novos sinaliza, na prática, um vazamento de dados (data leakage), tratado no capítulo 028, ou uma avaliação conduzida nos dados de treinamento. A pergunta pertinente nunca é, portanto, "o modelo erra", mas:

Quem trata os erros, a que custo e em que prazo?

4.2 O cálculo a fazer sistematicamente

Um modelo que atinge 95 % de exatidão é geralmente apresentado como um bom modelo. Relacionado ao volume tratado:

Volume diário de decisões       : 100 000
Exatidão do modelo              : 95 %
Decisões corretas               :  95 000
Decisões erradas                :   5 000  por dia
Hipótese de tratamentoCarga induzidaConclusão
Nenhum tratamento, erro sem consequênciaNulaModelo implantável tal como está
Tratamento pelo usuário final, 30 segundos42 horas de atenção por dia, difusasAceitável se o erro é visível e corrigível
Revisão humana interna, 4 minutos por caso333 horas por dia, cerca de 42 postos em tempo integralO dispositivo de correção custa mais que o modelo
Erro não detectável pelo usuárioCarga nula, risco não limitadoConfiguração mais perigosa

A última linha é a mais importante: um erro custoso mas visível é um problema de dimensionamento; um erro silencioso é um problema de concepção.

4.3 Grade de leitura por contexto

ContextoNatureza do erroGravidadeReversibilidadeML apropriado
Recomendação de conteúdoSugestão não pertinenteBaixaImediata: o usuário ignora a sugestãoSim, sem reservas
Filtragem de e-mailsFalso positivo: envio legítimo colocado em quarentenaMédiaBoa se a quarentena for consultávelSim, desde que a quarentena seja acessível
Manutenção preditivaAlerta injustificado ou pane não antecipadaMédia a elevadaParcial: custo de intervenção ou custo de paradaSim, com limiar assimétrico
Concessão de créditoRecusa injustificada a um solicitante solventeElevadaBaixa: prejuízo sofrido, contencioso possívelSim, sob restrição de explicabilidade e de recurso
Moderação automáticaRemoção de um conteúdo lícitoElevadaCondicionada à existência de uma via de recursoSim, com reexame humano garantido
Diagnóstico médicoFalso negativo: patologia não detectadaMuito elevadaBaixa a nulaNão em decisão autônoma: apoio à decisão
Cálculo de folha de pagamento ou de impostoMontante erradoElevadaCorreção possível, mas violação de uma obrigação de exatidãoNão: a regra exata existe

Três leituras devem ser dominadas.

Primeira leitura: a gravidade depende do contexto de uso, não da taxa de erro. O mesmo modelo a 95 % é excelente em recomendação e inaceitável em cálculo de folha de pagamento.

Segunda leitura: a reversibilidade é o critério operacional decisivo. Um erro grave mas recuperável é gerenciado pela concepção — limiar prudente, fila de verificação, via de recurso; um erro irreversível não se gerencia assim.

Terceira leitura: os dois tipos de erro de um classificador não têm o mesmo custo. Essa assimetria é um parâmetro de projeto, ajustável pelo limiar de decisão.

ANALOGIA — O controle de qualidade no fim da linha

Uma linha de produção não busca o defeito zero a qualquer preço: ela dimensiona uma taxa de defeito aceitável e depois concebe o dispositivo de detecção e de correção correspondente. Essa taxa não depende da máquina, mas do custo unitário de um defeito que sai, do custo do controle e do volume produzido. Um responsável que exige zero defeito sem dimensionar o controle não obtém zero defeito: ele obtém defeitos não detectados.

A taxa de erro aceitável de um modelo é, da mesma forma, uma decisão de engenharia, jamais uma propriedade do algoritmo.


5. Os limites estruturais do Machine Learning

Os quatro limites a seguir não são defeitos de implementação: eles decorrem da natureza indutiva da abordagem e não são superados por nenhum algoritmo, nenhuma arquitetura e nenhum volume de dados.

LIMITE 1 — O modelo não cria informação ausente dos dados

Enunciado

Um algoritmo de aprendizado extrai regularidades presentes nas descrições fornecidas. Ele não pode fundamentar uma decisão em um fator que não aparece em nenhuma variável, nem diretamente nem por correlação.

Ilustração

Um modelo de avaliação imobiliária alimentado pela área e pelo número de quartos não pode valorizar nem a vista, nem a orientação solar, nem o estado do telhado, que no entanto determinam uma parte substancial do preço. O modelo não sinaliza essa insuficiência: ele produz uma estimativa cujo erro residual será atribuído ao "ruído" quando na verdade reflete uma informação faltante.

Consequência prática

O teto de desempenho é fixado pelo conteúdo informacional das variáveis, não pela escolha do algoritmo. Esse limite explica uma decepção frequente: passar de uma regressão para um método de ensemble sofisticado só traz alguns pontos quando a informação necessária está ausente do conjunto de dados.

LIMITE 2 — O modelo não estabelece causalidade

Enunciado

Um modelo preditivo identifica associações estatísticas entre variáveis explicativas e variável-alvo. Uma associação não é uma relação de causa e efeito: um modelo de bom desempenho pode se basear em associações cuja interpretação causal é falsa, ou até invertida.

O caso documentado asma e pneumonia

Um estudo dos anos 1990 sobre pacientes internados por pneumonia visava prever o risco de óbito a fim de orientar os pacientes de baixo risco para um atendimento ambulatorial. O modelo aprendeu uma regra exata nos dados e perigosa na prática:

Os pacientes com pneumonia que têm antecedentes de asma apresentam um risco de óbito mais baixo.

A associação é real nos dados. Sua explicação: esses pacientes eram sistematicamente internados em terapia intensiva por causa de seu antecedente, recebiam ali um atendimento imediato e agressivo, e por isso sobreviviam mais. A regra induzida era uma consequência do protocolo de cuidados, não uma propriedade clínica; aplicada tal como estava, ela teria mandado para casa precisamente os pacientes que o protocolo existente protegia. O modelo não estava defeituoso — ele reproduzia fielmente os dados — e somente uma releitura por clínicos permitiu detectar a anomalia.

Esse caso é relatado notadamente por Cooper e coautores (1997), depois retomado e analisado por Caruana e coautores (2015) em seus trabalhos sobre modelos inteligíveis em saúde.

Formulação a lembrar

Um modelo prevê o que acontece nas condições em que os dados foram produzidos. Ele não prevê o que aconteceria se interviéssemos nessas condições. Toda decisão de intervenção baseada em um modelo puramente preditivo sai do domínio de validade desse modelo.

LIMITE 3 — O modelo supõe a estacionariedade da relação

Enunciado

O arcabouço estatístico do aprendizado supervisionado supõe que os dados de operação provêm da mesma distribuição que os dados de treinamento. Quando essa hipótese deixa de ser verificada, as garantias de desempenho caem.

Duas formas de ruptura

  • Deriva dos dados (data drift): a distribuição das variáveis explicativas muda, a relação entre variáveis e alvo permanecendo válida. Exemplo: a clientela rejuvenesce, os perfis observados diferem dos do corpus de treinamento.
  • Deriva do conceito (concept drift): a própria relação muda. Exemplo: um comportamento de compra que sinalizava fidelidade torna-se, após uma mudança de oferta, um sinal de saída iminente.

Consequência prática

Causas usuais: mudança de comportamento dos clientes, modificação do produto ou do processo de negócio, evolução regulatória, adaptação de um adversário, modificação de um sensor, choque externo. Um modelo em produção não tem, portanto, um desempenho constante: ele possui uma duração de validade, que deve ser monitorada e não presumida. Uma colocação em produção sem dispositivo de monitoramento é uma decisão de operação incompleta. A deriva, sua detecção e as estratégias de retreinamento são tratadas no capítulo 082.

LIMITE 4 — Garbage In, Garbage Out, agravado pela falha silenciosa

Enunciado

A qualidade da regra induzida é limitada pela qualidade e pela representatividade das observações fornecidas. Dados errados, enviesados ou mal rotulados produzem uma regra errada, enviesada ou mal calibrada.

O agravamento próprio do Machine Learning

Um programa determinístico alimentado com dados inválidos falha de forma visível: exceção, valor aberrante, rejeição de controle. Um algoritmo de aprendizado, por sua vez, não falha: ele converge, produz um modelo, e esse modelo produz previsões de aparência normal. A falha é silenciosa.

Defeito dos dadosEfeito sobre o modeloManifestação
Rótulos parcialmente erradosA regra induzida reproduz o erro de rotulagemDesempenho aparente correto, decisões falsas
População não representativaA regra só vale para um subgrupoDiferença de desempenho entre segmentos
Variável indisponível no momento da decisãoDesempenho excelente em teste, colapso em produçãoVazamento de dados, capítulo 028
Classes fortemente desbalanceadasO modelo privilegia a classe majoritáriaExatidão elevada, detecção nula na classe rara, capítulo 050

Ponto de atenção

A ausência de erro de execução nunca constitui uma prova de validade para um sistema indutivo. A validação exige um exame dos dados, uma análise dos erros por segmento e uma confrontação das regularidades aprendidas com o conhecimento de negócio.


6. Estudo de caso com números: a avaliação imobiliária

O objetivo é estimar o preço de venda de uma casa, as duas abordagens sendo conduzidas lado a lado sobre os mesmos imóveis.

6.1 Versão determinística

Um especialista da área propõe uma fórmula baseada em sua experiência:

preco = area_m2 x 3 500 + numero_de_quartos x 10 000
ImóvelÁreaQuartosPreço calculadoPreço realErroErro relativo
A90 m²3345 000 $352 000 $−7 000 $2,0 %
B120 m²4460 000 $448 000 $+12 000 $2,7 %
C75 m²2282 500 $291 000 $−8 500 $2,9 %
D140 m²4530 000 $690 000 $−160 000 $23,2 %

Nos três primeiros imóveis a fórmula é aceitável; no quarto, ela falha em 160 000 dólares. Uma diferença dessa ordem desqualifica a ferramenta: nenhum profissional baseia uma negociação em uma estimativa cujo erro possível atinge um quarto do valor.

6.2 Diagnóstico do imóvel D

FatorSituação do imóvel DEfeito sobre o preço
BairroZona escolar procurada, estação de transporte a 300 metrosForte, multiplicativo
ReformaCozinha e banheiro refeitos 18 meses antes da vendaAditivo, substancial
GaragemGaragem dupla, rara na regiãoAditivo, moderado

A correção parece simples: adicionar os termos faltantes.

preco = area_m2 x A + numero_de_quartos x B + garagem x C
      + reforma_recente x D + indice_de_bairro x E + F

A estrutura é plausível. O problema está em outro lugar:

Quais são os valores de A, B, C, D, E e F?

Ninguém os conhece. Eles não figuram em nenhum referencial e variam conforme a cidade, o segmento e o período. Um especialista pode propor uma ordem de grandeza para A; ele não pode arbitrar entre 34 000 e 41 000 dólares para o valor de uma reforma, nem quantificar o índice de bairro em uma escala coerente com os demais termos. Somam-se a isso as interações — o valor de uma reforma depende do bairro —, as não linearidades e a instabilidade: os coeficientes estarão obsoletos em dezoito meses.

Conclusão: a estrutura do problema é identificável por um especialista; seus parâmetros não são. É exatamente a configuração que pede uma abordagem indutiva.

6.3 Versão indutiva

Reúnem-se as vendas concluídas, descritas pelas mesmas variáveis, com o preço constatado.

ÁreaQuartosGaragemReformadaÍndice de bairroPreço constatado
90 m²3003352 000 $
120 m²4103448 000 $
75 m²2003291 000 $
140 m²4117690 000 $
105 m²3105468 000 $
160 m²5116712 000 $
82 m²2014371 000 $

O conjunto real contém vários milhares de linhas dessa forma, e o procedimento de aprendizado cabe em três instruções:

python
X = donnees[["surface", "chambres", "garage", "renovee", "indice_quartier"]]
y = donnees["prix"]

model.fit(X, y)

A chamada model.fit(X, y) é a operação de indução: o algoritmo busca os coeficientes que minimizam a diferença entre preços calculados e preços constatados no conjunto das vendas.

TermoCoeficiente estimadoLeitura de negócio
Área3 120 $ por m²Valor marginal do metro quadrado
Quartos6 400 $ por quartoEfeito próprio, controlada a área
Garagem14 900 $Prêmio por uma garagem
Reforma recente38 200 $Prêmio por uma reforma recente
Índice de bairro21 500 $ por pontoEfeito da região
Constante18 700 $Intercepto

Nenhum desses valores foi fornecido: eles foram induzidos das vendas observadas. O coeficiente de área difere da intuição do especialista — 3 120 em vez de 3 500 — porque a estimativa inicial absorvia implicitamente efeitos agora captados pelos demais termos.

Previsão para um imóvel nunca visto:

Imóvel E: 110 m², 3 quartos, garagem, não reformada, índice de bairro 4

110 x 3 120 = 343 200
  3 x 6 400 =  19 200
    garagem =  14 900
    reforma =       0
 4 x 21 500 =  86 000
  constante =  18 700
-----------------------
 Estimativa = 482 000 $

Em uso profissional, essa estimativa pontual vem acompanhada de um intervalo e de um erro médio estabelecidos durante a avaliação.

6.4 Comparação das duas cadeias

CritérioAbordagem determinísticaAbordagem indutiva
Origem dos coeficientesPostulados por um especialista, não verificáveisEstimados a partir das vendas constatadas
Consideração de um fator novoReescrita da fórmula, arbitragem manual do coeficienteAdição de uma coluna e retreinamento
Adaptação a um mercado diferenteRetomada completa da expertiseRetreinamento com os dados locais
Medida da qualidadeDiferença constatada a posteriori, sem protocoloErro medido em vendas não utilizadas no treinamento
Auditabilidade da decisãoElevada: a fórmula é enunciávelMédia a baixa conforme a família de modelos

Leitura da tabela: a abordagem indutiva vence em quatro critérios e perde na auditabilidade. Esse compromisso é representativo e é decidido pelo contexto de uso: uma estimativa indicativa destinada a um corretor de imóveis tolera uma auditabilidade média; um valor de perícia oponível perante um tribunal não a tolera.


7. A divisão de papéis entre humano e máquina

O vocabulário da imprensa — "o algoritmo decide", "a máquina aprende sozinha" — alimenta a ideia de uma automatização integral da cadeia de decisão. O exame do ciclo real de um projeto a contradiz.

7.1 Quem decide o quê

Etapa do cicloConteúdo da decisãoDecisor
1. Formular o problema de negócioDeterminar qual pergunta merece ser feitaHumano
2. Decidir sobre a oportunidade do MLConfrontar o problema com as condições da seção 3Humano
3. Definir a variável-alvoEscolher o que é previsto e como é medidoHumano
4. Escolher e coletar os dadosDeterminar fontes, período, populaçãoHumano
5. Definir a medida de desempenho e o limiarFixar o que constitui um sucesso, arbitrar entre tipos de erroHumano
6. Preparar os dados e construir as variáveisLimpar, codificar, agregar, derivarHumano, com ferramentas
7. Escolher a família de algoritmosArbitrar desempenho, interpretabilidade, custo, restriçõesHumano
8. Ajustar os parâmetros do modeloEstimar os coeficientes que minimizam o erro na amostraMáquina
9. Avaliar e interpretar os resultadosAnalisar os erros, confrontar com o negócio, detectar as anomaliasHumano
10. Decidir a colocação em produçãoDecidir sobre a implantação e suas salvaguardasHumano
11. Monitorar e arbitrar o retreinamentoDetectar a deriva, decidir retomar o cicloHumano

Em onze etapas, a máquina cobre uma, inteiramente condicionada pelas decisões humanas que a precedem: os dados da etapa 4, o alvo da etapa 3, a medida de erro da etapa 5 e a família de modelos da etapa 7 determinam integralmente o que a etapa 8 pode produzir.

7.2 O ciclo e suas zonas de decisão

Os blocos em tom escuro pertencem à decisão humana. O bloco em tom claro é a única etapa executada pela máquina.

ANALOGIA — O instrumento de medida e o experimentador

Um espectrômetro produz medidas que nenhum operador saberia obter a olho nu: ele é insubstituível nesse segmento da cadeia. Ele não escolhe a pergunta de pesquisa, não coleta a amostra, não define o protocolo, não interpreta os resultados e não decide publicar. Um algoritmo de aprendizado ocupa exatamente a mesma posição.

DEFINIÇÃO — Grau de autonomia de um sistema de decisão

Definição rigorosa

Posição de um sistema automatizado na escala que vai da simples produção de informação à decisão executada sem intervenção humana, caracterizada pelo papel atribuído ao operador no laço de decisão.

Os três regimes usuais

RegimePapel do humanoContexto de uso
Apoio à decisãoO humano decide, o modelo informaErro grave, decisão motivada, expertise indispensável
Humano no laço por exceçãoO modelo decide, o humano arbitra os casos incertosVolume elevado, erros recuperáveis, incerteza identificável
Automatização completaO modelo decide sozinho, o humano monitora os agregadosErro de baixa gravidade, volume massivo, reversibilidade imediata

Ponto de atenção

O regime de autonomia é uma decisão de projeto, independente do desempenho do modelo. Um modelo de altíssimo desempenho pode ser implantado como apoio à decisão porque o contexto o exige; um modelo medíocre pode ser plenamente automatizado porque o erro ali é sem consequência.


8. Erros de raciocínio frequentes

ERRO — Apresentar o Machine Learning como superior à programação clássica

Sintoma: formular a escolha como uma modernização, ou opor um método "ultrapassado" a um método "atual".

Razão: as duas abordagens respondem a duas configurações distintas. O Machine Learning não traz nada quando a regra é conhecida, exata e estável; ele introduz aí uma aproximação sem contrapartida.

Formulação correta: "A programação determinística e o aprendizado indutivo tratam de duas configurações diferentes. O critério de escolha é a disponibilidade de uma regra exata e estável, não a antiguidade do método."

ERRO — Acreditar que o modelo descobre as regras sem intervenção humana

Sintoma: descrever o projeto como "entregamos os dados ao algoritmo e ele encontra tudo sozinho".

Razão: o algoritmo executa apenas uma etapa em onze. A escolha do alvo, dos dados, da medida de desempenho e da família de modelos é humana, e condiciona integralmente o resultado obtido.

Formulação correta: "O algoritmo estima os parâmetros. O enquadramento do problema, a escolha dos dados, a definição da medida de desempenho e a validação continuam sendo decisões humanas."

ERRO — Tratar uma associação aprendida como uma relação causal

Sintoma: decidir intervir em uma variável porque o modelo lhe atribui um peso importante — "o modelo mostra que os antecedentes de asma reduzem o risco, logo esses pacientes podem voltar para casa".

Razão: um modelo preditivo restitui as regularidades do processo que gerou os dados, protocolos e políticas inclusos. Ele não diz nada sobre o que ocorreria se modificássemos esse processo.

Formulação correta: "O modelo estabelece uma associação válida nas condições de produção dos dados. Toda decisão de intervenção em uma variável exige uma análise causal distinta, com um protocolo adequado."

ERRO — Considerar uma taxa de exatidão elevada como prova de adequação

Sintoma: concluir pela implantação com base apenas em um número global, sem examinar o volume nem a natureza dos erros restantes.

Razão: 95 % de exatidão em 100 000 decisões diárias representa 5 000 erros por dia. A pertinência da implantação depende de sua gravidade, de sua detectabilidade, de sua reversibilidade e do custo de seu tratamento.

Formulação correta: "A taxa de exatidão não basta. É preciso estabelecer o volume de erros esperado, a gravidade de cada tipo de erro, quem os detecta e a que custo eles são corrigidos."

ERRO — Supor que um modelo implantado conserva seu desempenho

Sintoma: entregar um modelo sem dispositivo de monitoramento, considerando o projeto encerrado na colocação em produção.

Razão: as garantias do aprendizado supõem que os dados de operação seguem a mesma distribuição que os dados de treinamento. Essa hipótese deixa de ser verificada assim que os usuários, o produto, a regulamentação ou um adversário evoluem.

Formulação correta: "Um modelo possui uma duração de validade. A colocação em produção inclui o monitoramento do desempenho e um procedimento de retreinamento." O assunto é tratado no capítulo 082.


9. Síntese

A INVERSÃO
    Programação determinística : Regras + Dados     -> Respostas
    Aprendizado indutivo       : Dados + Respostas  -> REGRAS
    A regra é uma ENTRADA no primeiro caso, uma SAÍDA no segundo.

MODO DE INFERÊNCIA
    Determinístico : dedução, conclusão necessária
    Indutivo       : indução, conclusão provável e revisável

ARCABOUÇO FORMAL
    f    função-alvo, desconhecida, jamais observada
    f^   hipótese retida pelo algoritmo, aproximação de f
    Lacunas : aproximação (modelo), estimação (dados), deriva (tempo)

CRITÉRIO DE ESCOLHA, NA ORDEM
    1. A regra exata é conhecida e estável?           -> determinístico
    2. Existe um histórico rotulado suficiente?       -> senão, coletar
    3. Uma resposta aproximada é aceitável?           -> senão, determinístico
    4. O custo dos erros é controlável?               -> senão, apoio à decisão
    5. Senão                                          -> abordagem indutiva

O CÁLCULO A FAZER SISTEMATICAMENTE
    95 % de exatidão em 100 000 decisões = 5 000 erros por dia
    Pergunta : quem os trata, a que custo, em que prazo?
    Caso mais perigoso : o erro não detectável.

OS QUATRO LIMITES ESTRUTURAIS
    1. Nenhuma informação é criada se estiver ausente dos dados
    2. Associação aprendida não é causalidade estabelecida
    3. A estacionariedade da relação é uma hipótese, não um fato
    4. Dados defeituosos -> modelo defeituoso, sem nenhum sinal de erro

DIVISÃO DE PAPÉIS
    11 etapas no ciclo. A máquina cobre 1 :
    o ajuste dos parâmetros. As outras 10 são decisões humanas.

Enunciado de síntese

A programação determinística e o aprendizado indutivo distinguem-se pela posição da regra de decisão: especificada na entrada no primeiro caso, induzida na saída no segundo. A abordagem indutiva só é pertinente quando a regra exata é inacessível, quando existe um histórico rotulado, quando uma resposta aproximada é aceitável e quando o custo dos erros residuais é controlado; a máquina ali se encarrega de apenas uma etapa, o ajuste dos parâmetros, todas as demais pertencendo à decisão humana.


Quiz e perguntas de entrevista: 002.1-quiz-renversement-paradigme.md a 002.7-quiz-roles-humain-machine.md

Próximo capítulo: 003-trois-familles-apprentissage.md