O capítulo 001 estabeleceu que o Machine Learning é uma abordagem da inteligência artificial baseada na indução. Este capítulo estabelece o que essa fórmula implica na concepção de um sistema.
Os dois paradigmas mobilizam os mesmos três objetos — regras, dados, respostas — e só mudam sua posição na cadeia de produção.
| Paradigma | Entradas fornecidas | Saída produzida | Autor das regras |
|---|---|---|---|
| Programação determinística | Regras + Dados | Respostas | Um projetista humano |
| Aprendizado indutivo | Dados + Respostas | Regras | O algoritmo, a partir das observações |
O ponto discriminante: no primeiro paradigma, a regra é uma entrada do sistema; no segundo, ela é a saída.
Definição rigorosa
Aplicação determinística de um espaço de descrições X para um espaço de decisões Y, associando a toda descrição x de X uma decisão única de Y: formalmente, uma função h : X → Y. Em classificação, Y é um conjunto finito de modalidades; em regressão, um intervalo de números reais.
Tradução em linguagem corrente
Um procedimento que, para toda situação descrita, devolve uma decisão e apenas uma.
Ponto essencial
Esta definição não pressupõe nada sobre a origem da regra. Uma cláusula
SE ... ENTÃO ..., uma tabela regulamentar, uma árvore aprendida com 200 000 dossiês
e uma rede neural são todas regras de decisão no sentido desta
definição; elas diferem apenas pela forma como h foi obtida.
Ponto de atenção
Um modelo não é menos uma regra do que uma cláusula escrita à mão: é uma regra cujo enunciado ninguém redigiu. Essa propriedade fundamenta ao mesmo tempo sua potência e sua dificuldade de auditoria.
Os dois paradigmas pertencem a dois modos de inferência distintos, identificados pela lógica muito antes da computação.
Dedução
Modo de inferência pelo qual uma conclusão é derivada de premissas segundo regras de transformação que preservam a verdade. Se as premissas são verdadeiras e a derivação é válida, a conclusão é necessariamente verdadeira. Ilustração: "Todo envio contendo um anexo executável é bloqueado. Este envio contém um. Logo, ele é bloqueado."
Indução
Modo de inferência pelo qual uma proposição geral é formada a partir de um conjunto finito de observações particulares. A conclusão excede o conteúdo das premissas: ela não é garantida, apenas mais ou menos provável à luz das observações. Ilustração: "Em 40 000 e-mails observados, aqueles que apresentavam certas combinações de termos foram sinalizados como indesejados em 96 % dos casos. Logo, um novo envio que apresente essas combinações é provavelmente indesejado."
O problema da indução
A indução não fornece nenhuma garantia lógica. A teoria estatística do aprendizado (Vapnik e Chervonenkis, anos 1970) não elimina essa objeção: ela a limita por garantias probabilísticas condicionadas a hipóteses explícitas, cuja principal é que os dados futuros provêm da mesma distribuição que os dados de treinamento.
Consequência operacional
Um sistema determinístico está errado quando sua regra está errada. Um sistema indutivo está errado parte do tempo por construção, inclusive quando tudo foi corretamente realizado.
| Critério | Dedução | Indução |
|---|---|---|
| Sentido da inferência | Do geral ao particular | Do particular ao geral |
| Status da conclusão | Necessária se as premissas são verdadeiras | Provável, revisável |
| Conteúdo da conclusão | Contido nas premissas | Excede as premissas |
| Efeito de uma observação nova | Nenhum sobre a regra | Pode revisar a regra |
| Paradigma correspondente | Programação determinística | Machine Learning |
| Modo de falha | Regra mal especificada | Generalização insuficiente |
Definição rigorosa
Postula-se a existência de uma função-alvo f : X → Y, desconhecida, ligando o espaço das descrições X ao espaço dos valores a prever Y; ela só é acessível por meio de uma amostra finita de pares observados (x₁, y₁), ..., (xₙ, yₙ). O algoritmo seleciona, em um conjunto de hipóteses H fixado pela escolha da família de modelos, uma hipótese f̂ ("f chapéu") que minimiza uma medida de erro na amostra, na esperança de que f̂ se aproxime de f em todo o domínio.
Tradução em linguagem corrente
Existe uma relação real entre o que se observa e o que se quer prever. Ninguém conhece seu enunciado; constrói-se uma imitação dela a partir dos exemplos disponíveis.
As três lacunas entre f̂ e f
Ponto de atenção
A existência de f é uma hipótese de trabalho, não um fato estabelecido. Quando o alvo depende de fatores ausentes das descrições x, nenhuma função de X para Y é exata, qualquer que seja o algoritmo. Este ponto é desenvolvido na seção 5.
O caso a seguir reconstitui uma trajetória típica da filtragem de e-mails entre meados dos anos 1990 e meados dos anos 2000. As ordens de grandeza são representativas.
Mês 1 — três regras bastam.
SE o assunto contém "viagra" ENTÃO spam
SE o assunto contém "loteria" ENTÃO spam
SE o corpo contém "clique aqui" ENTÃO spamTrês regras escritas em meio dia interceptam 82 % dos envios indesejados, com custo de manutenção nulo.
Mês 3 — a ofuscação. Os emissores modificam a grafia dos termos
filtrados: V1AGRA, V-I-A-G-R-A, VÍAGRA, \/IAGRA, Vi@gra, ou a mesma
grafia em caracteres cirílicos homóglifos. A taxa de interceptação cai para
51 % em três semanas; a equipe adiciona uma regra por grafia observada e o
corpus passa de 3 para 47 regras.
Mês 6 — os falsos positivos. As regras acumuladas bloqueiam envios legítimos: a correspondência de uma farmácia parceira, um boletim informativo médico acompanhado por 4 000 clientes, as campanhas do marketing interno que contêm "clique aqui". Três incidentes chegam à diretoria em um mês. A equipe não ousa mais remover regras, cada uma interceptando spam real: ela adiciona exceções, listas de remetentes autorizados e derrogações por domínio. O corpus passa a 210 regras, das quais 60 são regras de exceção a outras regras.
Mês 12 — os novos vetores. O texto passa a imagem, depois a anexo, depois é fragmentado por caracteres invisíveis; cada vetor exige uma família de regras distinta: 610 regras.
Mês 24 — a ingovernabilidade.
| Indicador | Mês 1 | Mês 6 | Mês 12 | Mês 24 |
|---|---|---|---|---|
| Número de regras | 3 | 210 | 610 | 1 800 |
| Taxa de interceptação | 82 % | 79 % | 77 % | 76 % |
| Taxa de falsos positivos | 0,1 % | 0,9 % | 1,6 % | 2,3 % |
| Pessoas alocadas à manutenção | 0 | 1 | 2 | 3 |
| Tempo de reação a uma campanha nova | 1 dia | 3 dias | 7 dias | 11 dias |
| Parcela das regras cujo autor é identificável | 100 % | 70 % | 35 % | 12 % |
Nenhuma pessoa da equipe conhece o conjunto das 1 800 regras e toda modificação produz regressões imprevisíveis em outro ponto do corpus. O desempenho caiu apesar de um esforço de manutenção multiplicado por três.
O fracasso não é imputável à incompetência da equipe. Ele é estrutural.
| Mecanismo | Efeito sobre o corpus de regras | Grandeza em jogo |
|---|---|---|
| Explosão combinatória | O número de casos a cobrir cresce mais rápido que a capacidade de escrita | Número de variantes de um padrão |
| Acoplamento entre regras | Toda regra nova modifica o comportamento das regras existentes | Número de pares de regras |
| Obsolescência adversarial | As regras ficam obsoletas em um ritmo imposto por um terceiro hostil | Diferença entre ciclo de ataque e ciclo de correção |
Mecanismo 1 — a explosão combinatória. Um único termo de seis caracteres
admite um número de grafias equivalentes que cresce multiplicativamente: quatro
substituições plausíveis para a vogal i, quatro para o a, duas para o
g já dão várias dezenas de formas, e a inserção facultativa de um
separador entre cada uma das cinco posições internas multiplica esse número por
2⁵ = 32. A ordem de grandeza ultrapassa 10⁴ formas para uma única palavra. A escrita
manual progride linearmente enquanto o espaço a cobrir cresce
exponencialmente: nenhum esforço de manutenção fecha essa lacuna.
Mecanismo 2 — o acoplamento entre regras. Um corpus de n regras apresenta n(n−1)/2 pares suscetíveis de interagir.
| Número de regras | 3 | 47 | 210 | 610 | 1 800 |
|---|---|---|---|---|---|
| Número de pares | 3 | 1 081 | 21 945 | 185 745 | 1 619 100 |
Verificar que uma regra nova não entra em conflito com nenhuma outra supõe examinar 1 800 interações a cada adição. Como essa verificação não é realizável manualmente, ela não é efetuada: as regressões são descobertas em produção, pelos usuários.
Mecanismo 3 — a obsolescência diante de um adversário adaptativo.
Definição rigorosa
Agente cuja função-objetivo inclui contornar o sistema de decisão, e que dispõe de um sinal de observação sobre as decisões desse sistema que lhe permite ajustar seu comportamento.
Tradução em linguagem corrente
Um ator que tem interesse em enganar o sistema, que vê o que passa e o que é bloqueado, e adapta seus envios em consequência.
A propriedade crítica: a assimetria dos ciclos
O emissor testa uma variante e observa o resultado em algumas horas, a um custo quase nulo; a equipe precisa constatar a queda, diagnosticar o vetor, redigir a regra, verificar sua inocuidade e implantá-la, ou seja, vários dias. Enquanto o atacante iterar mais rápido que o defensor, o desempenho tende ao de um sistema que só filtra campanhas obsoletas.
Ponto de atenção
Essa propriedade não é exclusiva dos sistemas baseados em regras: um modelo confrontado com um adversário adaptativo também se degrada. A diferença está no custo unitário da atualização — retreinar é instrumentado e repetível, reescrever 1 800 regras não é.
Em vez de especificar os padrões característicos do spam, constitui-se um corpus de e-mails cuja natureza é conhecida e o algoritmo identifica as regularidades discriminantes.
| Dimensão | Sistema baseado em regras | Sistema indutivo |
|---|---|---|
| Reação a uma grafia nova | Escrita de uma regra dedicada | Absorvida se o corpus for atualizado |
| Esforço de adaptação | Proporcional ao número de variantes | Constante: retreinar |
| Fonte do sinal | O analista que observa | As denúncias dos usuários |
| Efeito do volume de tráfego | Carga de manutenção crescente | Recurso adicional para o modelo |
| Legibilidade da decisão | Elevada: a regra acionada é nomeada | Reduzida: ponderação de numerosos indícios |
Ponto de atenção: a reformulação indutiva não elimina o trabalho, ela o desloca para a manutenção de um corpus rotulado, de uma cadeia de retreinamento e de um monitoramento do desempenho. O ganho está no fato de esse trabalho ser instrumentável e repetível, não em seu desaparecimento.
A ordem das perguntas não é indiferente: a primeira nunca é "qual algoritmo empregar", mas "a regra é conhecida". O Machine Learning só é pertinente quando a resposta é negativa.
| Condição | Justificativa | Ilustração |
|---|---|---|
| A regra não é formalizável | Os critérios de decisão não são verbalizáveis, inclusive pelos especialistas que os aplicam | Reconhecimento de um rosto, avaliação de um risco composto |
| Os fatores e interações são numerosos | A escrita manual diverge e o acoplamento entre regras torna-se ingovernável | Scoring de crédito com 60 variáveis |
| O ambiente evolui | As regras escritas ficam obsoletas; o retreinamento absorve a evolução a custo constante | Detecção de fraude, filtragem de e-mails |
| A personalização deve ser massiva | Uma regra por indivíduo é impossível de escrever e manter | Recomendação para vários milhões de contas |
| Uma resposta aproximada é aceitável | O modelo produz uma estimativa acompanhada de uma incerteza, nunca uma certeza | Estimativa de preço, previsão de demanda |
| Existe um histórico rotulado suficiente | A indução requer observações cujo valor-alvo é conhecido | Transações com desfecho constatado |
Essas seis condições são conjuntas: um problema que satisfaz cinco e falha na sexta — tipicamente a ausência de histórico rotulado — não pertence ao Machine Learning em seu estado atual.
| Contraindicação | Razão | Alternativa |
|---|---|---|
| A regra exata é conhecida, estável e verificável | O modelo substituiria uma resposta exata por uma aproximação, sem contrapartida | Implementar a fórmula |
| A exatidão é uma obrigação legal ou contratual | Uma aproximação estatística é juridicamente inadmissível sobre um montante devido | Regra explícita, auditada, versionada |
| O volume de observações é insuficiente | A indução sobre uma amostra pequena demais produz uma regra não generalizável | Expertise de negócio, coleta prévia |
| O erro é catastrófico e irrecuperável | Nenhum modelo atinge 100 %: a fração residual de erros é estrutural | Supervisão humana sistemática |
| Não existe nenhum histórico, pois o processo é novo | Não há nada a induzir | Prototipagem, regras provisórias, coleta instrumentada |
Definição rigorosa
Propriedade de um sistema de decisão que permite reconstituir, para toda decisão produzida, a cadeia de justificativa que a ela conduziu e o estado exato do sistema naquela data, de forma reprodutível por um terceiro. Ela exige que a regra aplicada seja enunciável, que a versão em vigor seja conservada e que o resultado seja reprodutível de forma idêntica.
Ponto de atenção
Um modelo estatístico satisfaz a reprodutibilidade, mas torna difícil o enunciado da regra: os métodos de explicação a posteriori produzem uma justificativa aproximada da decisão, não seu enunciado. Quando a obrigação recai sobre a motivação individual, essa aproximação pode ser insuficiente.
Situação 1 — a regra é conhecida, exata e estável. Cálculo de um imposto sobre vendas, conversão a uma taxa publicada, vencimento de um empréstimo a taxa fixa, controle de um identificador por dígito verificador. Um modelo treinado para reproduzir essas operações atingiria 99,7 % de exatidão onde a implementação direta atinge 100 %: a substituição é uma regressão pura.
Situação 2 — nenhum histórico está disponível. Um processo criado na semana anterior não dispõe de nenhuma observação cujo valor-alvo seja conhecido. A questão não é escolher um algoritmo, mas instrumentar o processo para que as observações sejam coletadas e rotuladas.
Situação 3 — a auditabilidade é uma obrigação. Quando uma decisão deve ser motivada individualmente perante o interessado ou um regulador, a capacidade de enunciar a regra aplicada torna-se uma restrição de projeto tanto quanto o desempenho. Um modelo permanece então pertinente como apoio à decisão, a decisão oponível sendo produzida por uma regra explícita ou por um operador.
Este ponto é o mais importante do capítulo: ele distingue uma compreensão técnica de uma compreensão operacional.
Nenhum modelo de Machine Learning atinge 100 % de exatidão em dados novos.
Esse enunciado decorre da natureza indutiva da inferência: a regra é extrapolada de uma amostra finita para um domínio que a ultrapassa. Uma exatidão de 100 % anunciada em dados novos sinaliza, na prática, um vazamento de dados (data leakage), tratado no capítulo 028, ou uma avaliação conduzida nos dados de treinamento. A pergunta pertinente nunca é, portanto, "o modelo erra", mas:
Quem trata os erros, a que custo e em que prazo?
Um modelo que atinge 95 % de exatidão é geralmente apresentado como um bom modelo. Relacionado ao volume tratado:
Volume diário de decisões : 100 000
Exatidão do modelo : 95 %
Decisões corretas : 95 000
Decisões erradas : 5 000 por dia| Hipótese de tratamento | Carga induzida | Conclusão |
|---|---|---|
| Nenhum tratamento, erro sem consequência | Nula | Modelo implantável tal como está |
| Tratamento pelo usuário final, 30 segundos | 42 horas de atenção por dia, difusas | Aceitável se o erro é visível e corrigível |
| Revisão humana interna, 4 minutos por caso | 333 horas por dia, cerca de 42 postos em tempo integral | O dispositivo de correção custa mais que o modelo |
| Erro não detectável pelo usuário | Carga nula, risco não limitado | Configuração mais perigosa |
A última linha é a mais importante: um erro custoso mas visível é um problema de dimensionamento; um erro silencioso é um problema de concepção.
| Contexto | Natureza do erro | Gravidade | Reversibilidade | ML apropriado |
|---|---|---|---|---|
| Recomendação de conteúdo | Sugestão não pertinente | Baixa | Imediata: o usuário ignora a sugestão | Sim, sem reservas |
| Filtragem de e-mails | Falso positivo: envio legítimo colocado em quarentena | Média | Boa se a quarentena for consultável | Sim, desde que a quarentena seja acessível |
| Manutenção preditiva | Alerta injustificado ou pane não antecipada | Média a elevada | Parcial: custo de intervenção ou custo de parada | Sim, com limiar assimétrico |
| Concessão de crédito | Recusa injustificada a um solicitante solvente | Elevada | Baixa: prejuízo sofrido, contencioso possível | Sim, sob restrição de explicabilidade e de recurso |
| Moderação automática | Remoção de um conteúdo lícito | Elevada | Condicionada à existência de uma via de recurso | Sim, com reexame humano garantido |
| Diagnóstico médico | Falso negativo: patologia não detectada | Muito elevada | Baixa a nula | Não em decisão autônoma: apoio à decisão |
| Cálculo de folha de pagamento ou de imposto | Montante errado | Elevada | Correção possível, mas violação de uma obrigação de exatidão | Não: a regra exata existe |
Três leituras devem ser dominadas.
Primeira leitura: a gravidade depende do contexto de uso, não da taxa de erro. O mesmo modelo a 95 % é excelente em recomendação e inaceitável em cálculo de folha de pagamento.
Segunda leitura: a reversibilidade é o critério operacional decisivo. Um erro grave mas recuperável é gerenciado pela concepção — limiar prudente, fila de verificação, via de recurso; um erro irreversível não se gerencia assim.
Terceira leitura: os dois tipos de erro de um classificador não têm o mesmo custo. Essa assimetria é um parâmetro de projeto, ajustável pelo limiar de decisão.
Uma linha de produção não busca o defeito zero a qualquer preço: ela dimensiona uma taxa de defeito aceitável e depois concebe o dispositivo de detecção e de correção correspondente. Essa taxa não depende da máquina, mas do custo unitário de um defeito que sai, do custo do controle e do volume produzido. Um responsável que exige zero defeito sem dimensionar o controle não obtém zero defeito: ele obtém defeitos não detectados.
A taxa de erro aceitável de um modelo é, da mesma forma, uma decisão de engenharia, jamais uma propriedade do algoritmo.
Os quatro limites a seguir não são defeitos de implementação: eles decorrem da natureza indutiva da abordagem e não são superados por nenhum algoritmo, nenhuma arquitetura e nenhum volume de dados.
Enunciado
Um algoritmo de aprendizado extrai regularidades presentes nas descrições fornecidas. Ele não pode fundamentar uma decisão em um fator que não aparece em nenhuma variável, nem diretamente nem por correlação.
Ilustração
Um modelo de avaliação imobiliária alimentado pela área e pelo número de quartos não pode valorizar nem a vista, nem a orientação solar, nem o estado do telhado, que no entanto determinam uma parte substancial do preço. O modelo não sinaliza essa insuficiência: ele produz uma estimativa cujo erro residual será atribuído ao "ruído" quando na verdade reflete uma informação faltante.
Consequência prática
O teto de desempenho é fixado pelo conteúdo informacional das variáveis, não pela escolha do algoritmo. Esse limite explica uma decepção frequente: passar de uma regressão para um método de ensemble sofisticado só traz alguns pontos quando a informação necessária está ausente do conjunto de dados.
Enunciado
Um modelo preditivo identifica associações estatísticas entre variáveis explicativas e variável-alvo. Uma associação não é uma relação de causa e efeito: um modelo de bom desempenho pode se basear em associações cuja interpretação causal é falsa, ou até invertida.
O caso documentado asma e pneumonia
Um estudo dos anos 1990 sobre pacientes internados por pneumonia visava prever o risco de óbito a fim de orientar os pacientes de baixo risco para um atendimento ambulatorial. O modelo aprendeu uma regra exata nos dados e perigosa na prática:
Os pacientes com pneumonia que têm antecedentes de asma apresentam um risco de óbito mais baixo.
A associação é real nos dados. Sua explicação: esses pacientes eram sistematicamente internados em terapia intensiva por causa de seu antecedente, recebiam ali um atendimento imediato e agressivo, e por isso sobreviviam mais. A regra induzida era uma consequência do protocolo de cuidados, não uma propriedade clínica; aplicada tal como estava, ela teria mandado para casa precisamente os pacientes que o protocolo existente protegia. O modelo não estava defeituoso — ele reproduzia fielmente os dados — e somente uma releitura por clínicos permitiu detectar a anomalia.
Esse caso é relatado notadamente por Cooper e coautores (1997), depois retomado e analisado por Caruana e coautores (2015) em seus trabalhos sobre modelos inteligíveis em saúde.
Formulação a lembrar
Um modelo prevê o que acontece nas condições em que os dados foram produzidos. Ele não prevê o que aconteceria se interviéssemos nessas condições. Toda decisão de intervenção baseada em um modelo puramente preditivo sai do domínio de validade desse modelo.
Enunciado
O arcabouço estatístico do aprendizado supervisionado supõe que os dados de operação provêm da mesma distribuição que os dados de treinamento. Quando essa hipótese deixa de ser verificada, as garantias de desempenho caem.
Duas formas de ruptura
Consequência prática
Causas usuais: mudança de comportamento dos clientes, modificação do produto ou do processo de negócio, evolução regulatória, adaptação de um adversário, modificação de um sensor, choque externo. Um modelo em produção não tem, portanto, um desempenho constante: ele possui uma duração de validade, que deve ser monitorada e não presumida. Uma colocação em produção sem dispositivo de monitoramento é uma decisão de operação incompleta. A deriva, sua detecção e as estratégias de retreinamento são tratadas no capítulo 082.
Enunciado
A qualidade da regra induzida é limitada pela qualidade e pela representatividade das observações fornecidas. Dados errados, enviesados ou mal rotulados produzem uma regra errada, enviesada ou mal calibrada.
O agravamento próprio do Machine Learning
Um programa determinístico alimentado com dados inválidos falha de forma visível: exceção, valor aberrante, rejeição de controle. Um algoritmo de aprendizado, por sua vez, não falha: ele converge, produz um modelo, e esse modelo produz previsões de aparência normal. A falha é silenciosa.
| Defeito dos dados | Efeito sobre o modelo | Manifestação |
|---|---|---|
| Rótulos parcialmente errados | A regra induzida reproduz o erro de rotulagem | Desempenho aparente correto, decisões falsas |
| População não representativa | A regra só vale para um subgrupo | Diferença de desempenho entre segmentos |
| Variável indisponível no momento da decisão | Desempenho excelente em teste, colapso em produção | Vazamento de dados, capítulo 028 |
| Classes fortemente desbalanceadas | O modelo privilegia a classe majoritária | Exatidão elevada, detecção nula na classe rara, capítulo 050 |
Ponto de atenção
A ausência de erro de execução nunca constitui uma prova de validade para um sistema indutivo. A validação exige um exame dos dados, uma análise dos erros por segmento e uma confrontação das regularidades aprendidas com o conhecimento de negócio.
O objetivo é estimar o preço de venda de uma casa, as duas abordagens sendo conduzidas lado a lado sobre os mesmos imóveis.
Um especialista da área propõe uma fórmula baseada em sua experiência:
preco = area_m2 x 3 500 + numero_de_quartos x 10 000| Imóvel | Área | Quartos | Preço calculado | Preço real | Erro | Erro relativo |
|---|---|---|---|---|---|---|
| A | 90 m² | 3 | 345 000 $ | 352 000 $ | −7 000 $ | 2,0 % |
| B | 120 m² | 4 | 460 000 $ | 448 000 $ | +12 000 $ | 2,7 % |
| C | 75 m² | 2 | 282 500 $ | 291 000 $ | −8 500 $ | 2,9 % |
| D | 140 m² | 4 | 530 000 $ | 690 000 $ | −160 000 $ | 23,2 % |
Nos três primeiros imóveis a fórmula é aceitável; no quarto, ela falha em 160 000 dólares. Uma diferença dessa ordem desqualifica a ferramenta: nenhum profissional baseia uma negociação em uma estimativa cujo erro possível atinge um quarto do valor.
| Fator | Situação do imóvel D | Efeito sobre o preço |
|---|---|---|
| Bairro | Zona escolar procurada, estação de transporte a 300 metros | Forte, multiplicativo |
| Reforma | Cozinha e banheiro refeitos 18 meses antes da venda | Aditivo, substancial |
| Garagem | Garagem dupla, rara na região | Aditivo, moderado |
A correção parece simples: adicionar os termos faltantes.
preco = area_m2 x A + numero_de_quartos x B + garagem x C
+ reforma_recente x D + indice_de_bairro x E + FA estrutura é plausível. O problema está em outro lugar:
Quais são os valores de A, B, C, D, E e F?
Ninguém os conhece. Eles não figuram em nenhum referencial e variam conforme a cidade, o segmento e o período. Um especialista pode propor uma ordem de grandeza para A; ele não pode arbitrar entre 34 000 e 41 000 dólares para o valor de uma reforma, nem quantificar o índice de bairro em uma escala coerente com os demais termos. Somam-se a isso as interações — o valor de uma reforma depende do bairro —, as não linearidades e a instabilidade: os coeficientes estarão obsoletos em dezoito meses.
Conclusão: a estrutura do problema é identificável por um especialista; seus parâmetros não são. É exatamente a configuração que pede uma abordagem indutiva.
Reúnem-se as vendas concluídas, descritas pelas mesmas variáveis, com o preço constatado.
| Área | Quartos | Garagem | Reformada | Índice de bairro | Preço constatado |
|---|---|---|---|---|---|
| 90 m² | 3 | 0 | 0 | 3 | 352 000 $ |
| 120 m² | 4 | 1 | 0 | 3 | 448 000 $ |
| 75 m² | 2 | 0 | 0 | 3 | 291 000 $ |
| 140 m² | 4 | 1 | 1 | 7 | 690 000 $ |
| 105 m² | 3 | 1 | 0 | 5 | 468 000 $ |
| 160 m² | 5 | 1 | 1 | 6 | 712 000 $ |
| 82 m² | 2 | 0 | 1 | 4 | 371 000 $ |
O conjunto real contém vários milhares de linhas dessa forma, e o procedimento de aprendizado cabe em três instruções:
X = donnees[["surface", "chambres", "garage", "renovee", "indice_quartier"]]
y = donnees["prix"]
model.fit(X, y)A chamada model.fit(X, y) é a operação de indução: o algoritmo busca
os coeficientes que minimizam a diferença entre preços calculados e preços constatados no
conjunto das vendas.
| Termo | Coeficiente estimado | Leitura de negócio |
|---|---|---|
| Área | 3 120 $ por m² | Valor marginal do metro quadrado |
| Quartos | 6 400 $ por quarto | Efeito próprio, controlada a área |
| Garagem | 14 900 $ | Prêmio por uma garagem |
| Reforma recente | 38 200 $ | Prêmio por uma reforma recente |
| Índice de bairro | 21 500 $ por ponto | Efeito da região |
| Constante | 18 700 $ | Intercepto |
Nenhum desses valores foi fornecido: eles foram induzidos das vendas observadas. O coeficiente de área difere da intuição do especialista — 3 120 em vez de 3 500 — porque a estimativa inicial absorvia implicitamente efeitos agora captados pelos demais termos.
Previsão para um imóvel nunca visto:
Imóvel E: 110 m², 3 quartos, garagem, não reformada, índice de bairro 4
110 x 3 120 = 343 200
3 x 6 400 = 19 200
garagem = 14 900
reforma = 0
4 x 21 500 = 86 000
constante = 18 700
-----------------------
Estimativa = 482 000 $Em uso profissional, essa estimativa pontual vem acompanhada de um intervalo e de um erro médio estabelecidos durante a avaliação.
| Critério | Abordagem determinística | Abordagem indutiva |
|---|---|---|
| Origem dos coeficientes | Postulados por um especialista, não verificáveis | Estimados a partir das vendas constatadas |
| Consideração de um fator novo | Reescrita da fórmula, arbitragem manual do coeficiente | Adição de uma coluna e retreinamento |
| Adaptação a um mercado diferente | Retomada completa da expertise | Retreinamento com os dados locais |
| Medida da qualidade | Diferença constatada a posteriori, sem protocolo | Erro medido em vendas não utilizadas no treinamento |
| Auditabilidade da decisão | Elevada: a fórmula é enunciável | Média a baixa conforme a família de modelos |
Leitura da tabela: a abordagem indutiva vence em quatro critérios e perde na auditabilidade. Esse compromisso é representativo e é decidido pelo contexto de uso: uma estimativa indicativa destinada a um corretor de imóveis tolera uma auditabilidade média; um valor de perícia oponível perante um tribunal não a tolera.
O vocabulário da imprensa — "o algoritmo decide", "a máquina aprende sozinha" — alimenta a ideia de uma automatização integral da cadeia de decisão. O exame do ciclo real de um projeto a contradiz.
| Etapa do ciclo | Conteúdo da decisão | Decisor |
|---|---|---|
| 1. Formular o problema de negócio | Determinar qual pergunta merece ser feita | Humano |
| 2. Decidir sobre a oportunidade do ML | Confrontar o problema com as condições da seção 3 | Humano |
| 3. Definir a variável-alvo | Escolher o que é previsto e como é medido | Humano |
| 4. Escolher e coletar os dados | Determinar fontes, período, população | Humano |
| 5. Definir a medida de desempenho e o limiar | Fixar o que constitui um sucesso, arbitrar entre tipos de erro | Humano |
| 6. Preparar os dados e construir as variáveis | Limpar, codificar, agregar, derivar | Humano, com ferramentas |
| 7. Escolher a família de algoritmos | Arbitrar desempenho, interpretabilidade, custo, restrições | Humano |
| 8. Ajustar os parâmetros do modelo | Estimar os coeficientes que minimizam o erro na amostra | Máquina |
| 9. Avaliar e interpretar os resultados | Analisar os erros, confrontar com o negócio, detectar as anomalias | Humano |
| 10. Decidir a colocação em produção | Decidir sobre a implantação e suas salvaguardas | Humano |
| 11. Monitorar e arbitrar o retreinamento | Detectar a deriva, decidir retomar o ciclo | Humano |
Em onze etapas, a máquina cobre uma, inteiramente condicionada pelas decisões humanas que a precedem: os dados da etapa 4, o alvo da etapa 3, a medida de erro da etapa 5 e a família de modelos da etapa 7 determinam integralmente o que a etapa 8 pode produzir.
Os blocos em tom escuro pertencem à decisão humana. O bloco em tom claro é a única etapa executada pela máquina.
Um espectrômetro produz medidas que nenhum operador saberia obter a olho nu: ele é insubstituível nesse segmento da cadeia. Ele não escolhe a pergunta de pesquisa, não coleta a amostra, não define o protocolo, não interpreta os resultados e não decide publicar. Um algoritmo de aprendizado ocupa exatamente a mesma posição.
Definição rigorosa
Posição de um sistema automatizado na escala que vai da simples produção de informação à decisão executada sem intervenção humana, caracterizada pelo papel atribuído ao operador no laço de decisão.
Os três regimes usuais
| Regime | Papel do humano | Contexto de uso |
|---|---|---|
| Apoio à decisão | O humano decide, o modelo informa | Erro grave, decisão motivada, expertise indispensável |
| Humano no laço por exceção | O modelo decide, o humano arbitra os casos incertos | Volume elevado, erros recuperáveis, incerteza identificável |
| Automatização completa | O modelo decide sozinho, o humano monitora os agregados | Erro de baixa gravidade, volume massivo, reversibilidade imediata |
Ponto de atenção
O regime de autonomia é uma decisão de projeto, independente do desempenho do modelo. Um modelo de altíssimo desempenho pode ser implantado como apoio à decisão porque o contexto o exige; um modelo medíocre pode ser plenamente automatizado porque o erro ali é sem consequência.
Sintoma: formular a escolha como uma modernização, ou opor um método "ultrapassado" a um método "atual".
Razão: as duas abordagens respondem a duas configurações distintas. O Machine Learning não traz nada quando a regra é conhecida, exata e estável; ele introduz aí uma aproximação sem contrapartida.
Formulação correta: "A programação determinística e o aprendizado indutivo tratam de duas configurações diferentes. O critério de escolha é a disponibilidade de uma regra exata e estável, não a antiguidade do método."
Sintoma: descrever o projeto como "entregamos os dados ao algoritmo e ele encontra tudo sozinho".
Razão: o algoritmo executa apenas uma etapa em onze. A escolha do alvo, dos dados, da medida de desempenho e da família de modelos é humana, e condiciona integralmente o resultado obtido.
Formulação correta: "O algoritmo estima os parâmetros. O enquadramento do problema, a escolha dos dados, a definição da medida de desempenho e a validação continuam sendo decisões humanas."
Sintoma: decidir intervir em uma variável porque o modelo lhe atribui um peso importante — "o modelo mostra que os antecedentes de asma reduzem o risco, logo esses pacientes podem voltar para casa".
Razão: um modelo preditivo restitui as regularidades do processo que gerou os dados, protocolos e políticas inclusos. Ele não diz nada sobre o que ocorreria se modificássemos esse processo.
Formulação correta: "O modelo estabelece uma associação válida nas condições de produção dos dados. Toda decisão de intervenção em uma variável exige uma análise causal distinta, com um protocolo adequado."
Sintoma: concluir pela implantação com base apenas em um número global, sem examinar o volume nem a natureza dos erros restantes.
Razão: 95 % de exatidão em 100 000 decisões diárias representa 5 000 erros por dia. A pertinência da implantação depende de sua gravidade, de sua detectabilidade, de sua reversibilidade e do custo de seu tratamento.
Formulação correta: "A taxa de exatidão não basta. É preciso estabelecer o volume de erros esperado, a gravidade de cada tipo de erro, quem os detecta e a que custo eles são corrigidos."
Sintoma: entregar um modelo sem dispositivo de monitoramento, considerando o projeto encerrado na colocação em produção.
Razão: as garantias do aprendizado supõem que os dados de operação seguem a mesma distribuição que os dados de treinamento. Essa hipótese deixa de ser verificada assim que os usuários, o produto, a regulamentação ou um adversário evoluem.
Formulação correta: "Um modelo possui uma duração de validade. A colocação em produção inclui o monitoramento do desempenho e um procedimento de retreinamento." O assunto é tratado no capítulo 082.
A INVERSÃO
Programação determinística : Regras + Dados -> Respostas
Aprendizado indutivo : Dados + Respostas -> REGRAS
A regra é uma ENTRADA no primeiro caso, uma SAÍDA no segundo.
MODO DE INFERÊNCIA
Determinístico : dedução, conclusão necessária
Indutivo : indução, conclusão provável e revisável
ARCABOUÇO FORMAL
f função-alvo, desconhecida, jamais observada
f^ hipótese retida pelo algoritmo, aproximação de f
Lacunas : aproximação (modelo), estimação (dados), deriva (tempo)
CRITÉRIO DE ESCOLHA, NA ORDEM
1. A regra exata é conhecida e estável? -> determinístico
2. Existe um histórico rotulado suficiente? -> senão, coletar
3. Uma resposta aproximada é aceitável? -> senão, determinístico
4. O custo dos erros é controlável? -> senão, apoio à decisão
5. Senão -> abordagem indutiva
O CÁLCULO A FAZER SISTEMATICAMENTE
95 % de exatidão em 100 000 decisões = 5 000 erros por dia
Pergunta : quem os trata, a que custo, em que prazo?
Caso mais perigoso : o erro não detectável.
OS QUATRO LIMITES ESTRUTURAIS
1. Nenhuma informação é criada se estiver ausente dos dados
2. Associação aprendida não é causalidade estabelecida
3. A estacionariedade da relação é uma hipótese, não um fato
4. Dados defeituosos -> modelo defeituoso, sem nenhum sinal de erro
DIVISÃO DE PAPÉIS
11 etapas no ciclo. A máquina cobre 1 :
o ajuste dos parâmetros. As outras 10 são decisões humanas.Enunciado de síntese
A programação determinística e o aprendizado indutivo distinguem-se pela posição da regra de decisão: especificada na entrada no primeiro caso, induzida na saída no segundo. A abordagem indutiva só é pertinente quando a regra exata é inacessível, quando existe um histórico rotulado, quando uma resposta aproximada é aceitável e quando o custo dos erros residuais é controlado; a máquina ali se encarrega de apenas uma etapa, o ajuste dos parâmetros, todas as demais pertencendo à decisão humana.
Quiz e perguntas de entrevista: 002.1-quiz-renversement-paradigme.md a
002.7-quiz-roles-humain-machine.md
Próximo capítulo: 003-trois-familles-apprentissage.md