Aprendizado supervisionado: formalização e mecânica

46 min
Bloco 0 — Situar o aprendizado supervisionado
Objetivo
formalizar rigorosamente o problema supervisionado, compreender a mecânica efetiva do ajuste de um modelo, e estabelecer que a generalização constitui seu objetivo único.
Duração estimada
45 minutos
Pré-requisitos
capítulos 001 a 003
Quizzes associados
004.1-quiz-formalisation.md a 004.7-quiz-generalisation.md

Os capítulos 001 a 003 situaram o aprendizado supervisionado na taxonomia da área e distinguiram as três famílias de aprendizado. Este capítulo passa da situação à mecânica: o que contém um problema supervisionado, o que faz o algoritmo quando ajusta um modelo, e o que se mede quando o avaliamos.


1. Formalização do problema supervisionado

A definição é dada em quatro níveis de precisão decrescente. Os quatro enunciam a mesma coisa. O primeiro deve ser dominado; os três outros servem à transmissão.

1.1 Nível 1 — Formulação matemática

Os espaços. Um espaço das entradas X (tipicamente X ⊆ R^d, onde d é o número de variáveis explicativas) e um espaço das saídas Y. A natureza de Y determina o tipo de problema: Y ⊆ R para a regressão, Y = {c1, ..., cK} finito e não ordenado para a classificação.

A distribuição geradora. Os pares observação-rótulo são supostamente provenientes de uma distribuição conjunta P(X, Y), desconhecida e suposta fixa no período considerado. Sem essa hipótese, nada do que é observado informa sobre o que não é.

A hipótese de dependência. Postula-se uma relação entre X e Y, formalizada por uma função desconhecida f : X → Y, ou, no caso geral em que a relação é ruidosa, pela lei condicional P(Y | X). O modelo usual escreve-se y = f(x) + ε, onde ε é um termo aleatório de esperança nula que representa o que influi sobre y sem ser capturado por x.

A amostra. Não dispomos nem de f, nem de P, mas de uma amostra finita

D = {(x1, y1), (x2, y2), ..., (xn, yn)},   (xi, yi) ~ P(X, Y)

de n observações supostamente independentes e identicamente distribuídas.

O critério. Uma função de perda L : Y × Y → R+ quantifica a diferença entre valor previsto e valor observado. O risco esperado de uma hipótese h é R(h) = E[L(y, h(x))], a esperança recaindo sobre (x, y) ~ P(X, Y). O objetivo teórico é h* = argmin R(h) sobre o espaço das hipóteses H, conjunto das funções que a classe de modelos escolhida pode representar.

O obstáculo e seu contorno. R(h) não é calculável, pois P é desconhecida. Substitui-se por ele o risco empírico

R̂(h) = (1/n) · Σ L(yi, h(xi))     para i = 1..n

e resolve-se o problema acessível f̂ = argmin R̂(h) sobre H. Esse princípio é a minimização do risco empírico (Empirical Risk Minimization, ERM); ele constitui o fundamento formal do aprendizado supervisionado.

DEFINIÇÃO — Risco esperado, risco empírico, minimização do risco empírico

Definição rigorosa

O risco esperado é a esperança da perda sob a distribuição geradora: R(h) = E[L(y, h(x))]. Ele quantifica o desempenho de h sobre o conjunto das observações que a distribuição pode produzir, observadas ou não.

O risco empírico é a média da perda sobre a amostra disponível. É um estimador não enviesado de R(h) para uma hipótese fixada de antemão.

A minimização do risco empírico (Vapnik, 1995) consiste em reter a hipótese que minimiza sobre H, em substituição à minimização inacessível de R.

Ponto de atenção central

A ausência de viés vale para uma hipótese fixada antes de observar a amostra. A partir do momento em que é selecionada minimizando , a quantidade R̂(f̂) torna-se um estimador otimistamente enviesado de R(f̂). É a justificativa formal da separação dos dados (capítulo 026) e a origem mecânica do sobreajuste (overfitting) (capítulo 031).

Tradução em linguagem corrente

Gostaríamos do modelo que erra menos em todos os casos possíveis; só podemos medir o erro nos casos de que dispomos. Escolhemos, portanto, o modelo que erra menos nesses, sabendo que essa pontuação é lisonjeira.

Termo de erroOrigemAlavanca de redução
AproximaçãoA melhor função de H permanece distante de fAmpliar H: modelo mais expressivo, variáveis adicionais
Estimaçãon é finito, só estima R imperfeitamenteAumentar n, restringir H, regularizar
OtimizaçãoO algoritmo não atinge exatamente o mínimo de Ajustar o procedimento de otimização
IrredutívelO ruído ε: y não é determinado por xNenhuma. Ele limita o desempenho atingível

Ampliar H reduz o erro de aproximação e aumenta o erro de estimação. Esse dilema é o compromisso viés-variância, tratado no capítulo 031.

1.2 Nível 2 — Formulação técnica acessível

O aprendizado supervisionado consiste em ajustar uma função parametrizada sobre um conjunto de exemplos cujo valor a prever é conhecido, minimizando uma medida de diferença entre valores previstos e valores observados, a fim de aplicar em seguida essa função a observações cujo valor é desconhecido.

Formulação destinada a um documento de concepção. Ela nomeia os quatro elementos obrigatórios: exemplos rotulados, função parametrizada, medida de diferença, aplicação ao desconhecido.

1.3 Nível 3 — Formulação corrente

Fornece-se a um algoritmo um grande número de casos passados acompanhados de sua resposta. O algoritmo busca a regra que melhor relaciona as informações disponíveis à resposta. Essa regra é em seguida aplicada a casos novos, para os quais a resposta não é conhecida.

Formulação destinada a um comitê de direção. Ela não contém nenhuma aproximação falsa; omite o formalismo.

1.4 Nível 4 — Representação gráfica

Leitura: a seta Y → ALG só existe na fase de treinamento. É ela, e somente ela, que distingue o aprendizado supervisionado do não supervisionado (capítulo 003).

NívelFormulaçãoDestinatárioContexto de uso
1Matemática: f̂ = argmin R̂(h) sobre H, D ~ P(X,Y)Cientista de dados, examinadorEntrevista técnica, especificação
2Técnica: função parametrizada ajustada por minimização de uma diferençaEngenheiro, arquitetoDocumento de concepção
3Corrente: casos passados com resposta, regra induzida, aplicação ao novoDireção, negócioComitê de pilotagem
4Gráfica: duas fases, uma seta discriminanteQualquer públicoMaterial de apresentação
SímboloDesignação
x, yVetor de variáveis explicativas, rótulo observado
n, dNúmero de observações, número de variáveis
P(X, Y)Distribuição conjunta geradora, desconhecida
DAmostra de treinamento, n pares
f, Relação verdadeira desconhecida, modelo ajustado retido
ŷValor previsto, ŷ = f̂(x)
H, LEspaço das hipóteses, função de perda
R(h), R̂(h)Risco esperado (não calculável), risco empírico

1.5 Por que o termo "supervisionado"

DEFINIÇÃO — Supervisão (no sentido do aprendizado de máquina)

Definição rigorosa

A supervisão designa a disponibilidade, para cada observação da amostra de treinamento, de um sinal de referência yi correspondente ao valor que o modelo deve aprender a produzir. Esse sinal desempenha o papel de um supervisor no sentido da teoria do controle: ele fornece, para cada tentativa, a informação de diferença que permite a correção.

Origem terminológica

A expressão supervised learning provém da literatura sobre redes neurais dos anos 1950-1960, que distinguia os procedimentos que dispunham de um teacher signal daqueles que eram desprovidos dele. O supervisor é o sinal, não uma pessoa.

Ponto de atenção

A supervisão é uma propriedade dos dados de treinamento, não do regime de funcionamento do sistema. Um modelo supervisionado implantado pode funcionar sem nenhuma intervenção humana; inversamente, um sistema não supervisionado pode ser colocado sob controle humano permanente.

O que "supervisionado" designaO que "supervisionado" não designa
Um rótulo de referência para cada observação de treinamentoA presença de um operador humano durante a execução
Um sinal de erro calculável a cada tentativaUm controle de qualidade das previsões em produção
Uma propriedade da fase de aprendizadoUma propriedade do sistema implantado
ANALOGIA — O estudante e o gabarito

Um estudante prepara um exame a partir de uma coletânea de exercícios, cada um acompanhado de sua solução. Para cada exercício, ele propõe uma resposta, a compara ao gabarito, constata a diferença, ajusta seu método.

Elemento da analogiaElemento formal
O enunciado do exercícioO vetor x
A solução do gabaritoO rótulo y
A resposta propostaA previsão ŷ
A diferença constatadaA perda L(y, ŷ)
O ajuste do métodoA atualização dos parâmetros
O exame final sobre enunciados inéditosA avaliação no conjunto de teste

O gabarito não é um professor que vigia o estudante durante a prova: é uma informação de referência disponível durante a preparação e indisponível no dia do exame. É exatamente o status do rótulo. A analogia também carrega o fracasso característico: o estudante que memorizou os gabaritos sem adquirir o método obtém uma pontuação perfeita na coletânea e falha no exame. Esse caso é o sobreajuste.


2. Os dados rotulados e a proveniência dos rótulos

DEFINIÇÃO — Dado rotulado (labeled data)

Definição rigorosa

Um dado rotulado é um par (x, y) que associa um vetor de variáveis explicativas x ∈ X ao valor y ∈ Y da variável-alvo para essa mesma observação, tendo esse valor sido observado, medido ou atribuído por um procedimento exterior ao modelo.

Tradução em linguagem corrente

Uma linha de tabela na qual figura, além das informações descritivas, a resposta que se deseja poder prever.

Condição de existência do aprendizado supervisionado

A ausência de rótulos exclui o supervisionado, sem exceção. As alternativas são então: constituir os rótulos (anotação, instrumentação, espera de um histórico), reformular o problema em não supervisionado (capítulo 003), ou renunciar.

2.1 O teste operacional

Existe, nos dados disponíveis, uma coluna contendo exatamente o que se quer prever, preenchida para as observações passadas?

RespostaConsequência
Sim, preenchida e confiávelO problema é supervisionado. O restante do curso se aplica
Sim, mas parcialmente preenchida ou duvidosaProblema supervisionado com reservas. A qualidade dos rótulos torna-se a primeira frente de trabalho
NãoO problema não é supervisionado em seu estado atual. É preciso criar o rótulo ou mudar de paradigma

Ponto de atenção: "exatamente o que se quer prever" é uma exigência estrita. Prever a satisfação do cliente a partir de uma coluna "reabriu um ticket" equivale a prever a reabertura de ticket, não a satisfação.

2.2 Três exemplos de tabelas rotuladas

Exemplo A — Detecção de e-mails indesejados

Remetente conhecidoNº de linksMaiúsculas (%)AnexoIndesejado
Sim14NãoNão
Não1462SimSim
Sim02SimNão
Não948NãoSim

As quatro primeiras colunas constituem x; a coluna em negrito é y, com valores em {Sim, Não}: classificação binária. Rótulo proveniente da ação do usuário, por denúncia manual.

Exemplo B — Manutenção preditiva em equipamento instrumentado

Vibração (mm/s)Temperatura (°C)Horas desde a revisãoCiclos/diaPane em 7 dias
2,164820142Não
5,8812 340168Sim
3,4711 510151Não
6,2882 780174Sim

y binário: classificação. O rótulo é reconstruído a posteriori a partir do registro de intervenções: para cada leitura, verifica-se se uma falha ocorreu nos sete dias seguintes. Essa reconstrução é o ponto técnico mais delicado do caso, desenvolvido na seção 7.

Exemplo C — Estimativa de preço imobiliário

Área (m²)QuartosAno de construçãoDistância do centro (km)Preço de venda ($)
75219946,2272 500
100320064,1370 000
125420113,4467 500
150520182,8560 000

y numérico contínuo: regressão. O rótulo é um fato registrado, o preço constante na escritura de venda.

2.3 A proveniência dos rótulos

Os três exemplos carregam rótulos de natureza radicalmente diferente: uma denúncia de usuário, uma reconstrução a partir de um registro, um montante contratual. Essas diferenças determinam a confiabilidade do modelo muito mais do que a escolha do algoritmo.

FonteDescriçãoCustoConfiabilidadeArmadilha associada
Histórico naturalO evento ocorreu e foi registrado: venda concluída, contrato rescindido, sinistro declaradoNulo a baixoElevadaA definição do evento no sistema pode diferir da definição de negócio; data de registro e data de ocorrência diferem
Ação do usuárioO usuário produz o sinal: clique, compra, denúncia, avaliaçãoNuloMédiaViés de seleção massivo: apenas uma minoria age. A ausência de sinal não vale como sinal negativo
Anotação humanaOperadores rotulam observações para o projetoElevadoVariávelSubjetividade, fadiga, deriva de critério. Exige uma medida de concordância entre anotadores
Especialista do domínioUm especialista qualifica cada caso segundo seu julgamento profissionalMuito elevadoElevada nos casos típicosBaixa vazão, logo baixo volume. Desacordo entre especialistas nos casos-limite, que são os casos de interesse
Regra de negócio automáticaUma regra existente produziu o rótulo: limiar, motor de regras, sistema especialistaNuloIlusóriaO modelo aprende a regra, não o fenômeno. Seu desempenho atinge o teto do sistema que produziu os rótulos
Medida instrumentalUm sensor fornece o valor: sonda, medidor, analisadorMédioElevadaDeriva de calibração, panes que produzem valores padrão, dessincronização temporal

Pergunta a instruir no início de todo projeto:

Como esse rótulo foi produzido, e essa produção é confiável?

Ela precede a escolha do algoritmo, a das variáveis e qualquer consideração de arquitetura. Ela é instruída junto às pessoas que operam o sistema de origem, não junto às que operam o banco de dados.

PONTO DE ATENÇÃO — O teto imposto pelos rótulos provenientes de um sistema de regras

Situação

Uma organização dispõe há anos de um motor de regras que classifica automaticamente as solicitações recebidas. O histórico contém, portanto, para cada solicitação, a classe atribuída por esse motor: uma coluna imediatamente disponível, que parece constituir um rótulo ideal.

O que acontece

O modelo é treinado para reproduzir as decisões do motor. Ele consegue, frequentemente acima de 95 % de exatidão. Essa exatidão mede a fidelidade da imitação, não a correção das decisões. Todos os erros do motor são aprendidos como verdades: eles constituem, nos dados, a própria definição da resposta correta.

Um modelo supervisionado não pode ser melhor do que o procedimento que produziu seus rótulos. Ele pode ser mais rápido, mais regular, menos custoso, e generalizar para casos não cobertos pelas regras explícitas. Ele não pode ser mais correto.

Consequência prática

Um projeto assim permanece legítimo quando o objetivo é a redução do custo de execução, a cobertura de casos não tratados, ou a simplificação de um motor que se tornou ingovernável. Ele é ilegítimo quando o objetivo anunciado é a melhoria da qualidade das decisões: uma fonte de rótulos independente do sistema a substituir é então requerida, por auditoria de uma amostra ou por observação do resultado real das decisões.


3. A mecânica de ajuste

Um algoritmo de aprendizado supervisionado não procede a nenhuma análise do domínio. Ele executa um ciclo em três tempos, repetido até a satisfação de um critério de parada.

As modalidades da correção variam: descida de gradiente para os modelos paramétricos e as redes neurais, particionamento recursivo por maximização de um ganho de informação para as árvores, resolução analítica fechada para os mínimos quadrados ordinários. A estrutura lógica do ciclo é idêntica.

DEFINIÇÃO — Parâmetro de um modelo

Definição rigorosa

Um parâmetro é uma grandeza interna ao modelo cujo valor é determinado pelo algoritmo de aprendizado a partir dos dados, por minimização do risco empírico. O conjunto dos valores dos parâmetros constitui o estado do modelo e basta, com sua estrutura, para reproduzir suas previsões.

Classe de modelosParâmetros
Regressão linear ou logísticaCoeficientes das variáveis, intercepto
Árvore de decisãoVariáveis de corte, limiares, valores das folhas
Rede neuralPesos das conexões, vieses dos neurônios

Tradução em linguagem corrente

Os parâmetros são o que a máquina aprendeu: o conteúdo do arquivo salvo ao final do treinamento.

DEFINIÇÃO — Função de perda (loss function)

Definição rigorosa

Uma função de perda L : Y × Y → R+ associa a um par (valor observado, valor previsto) uma medida escalar positiva da diferença, nula se e somente se a previsão coincide com a observação, e crescente com a gravidade da diferença. Ela deve ser calculável e, para os algoritmos baseados em gradiente, derivável em relação aos parâmetros.

Status

Ela constitui a definição operacional de "prever bem". É uma escolha de engenharia, não um dado do problema: duas funções de perda diferentes aplicadas à mesma amostra produzem dois modelos diferentes.

Tradução em linguagem corrente

A regra de pontuação: o que conta como uma falta, e quanto essa falta custa.

Ponto de atenção

A perda usada para a otimização e a métrica usada para a avaliação de negócio são dois objetos distintos, que raramente coincidem (capítulos 029 e 052).

DEFINIÇÃO — Risco empírico (empirical risk, training loss)

Definição rigorosa

Média aritmética das perdas individuais sobre a amostra: R̂(h) = (1/n) · Σ L(yi, h(xi)). É a quantidade efetivamente minimizada pelo algoritmo de aprendizado.

Distinção em relação ao risco esperado

O risco empírico é uma média sobre n observações disponíveis, o risco esperado uma esperança sobre a distribuição geradora. O primeiro é calculável e serve de objetivo de otimização; o segundo é o objetivo real e nunca é diretamente acessível.

Ponto de atenção

Um risco empírico nulo não tem nenhum valor informativo: ele é sempre atingível por um modelo suficientemente expressivo, por simples memorização da amostra.

Função de perdaTipo de problemaExpressãoPropriedade
Erro quadráticoRegressão(y − ŷ)²Penaliza fortemente as grandes diferenças; sensível a valores aberrantes
Erro absolutoRegressãovalor absoluto de y − ŷPenalização proporcional; robusto a valores aberrantes
Entropia cruzada bináriaClassificação binária−[y·log(p) + (1−y)·log(1−p)]Opera sobre a probabilidade prevista p, não sobre a classe
Perda de dobradiça (hinge)Classificação com margemmax(0, 1 − y·score)Penaliza também os pontos corretos próximos demais da fronteira

O erro quadrático ajusta a média condicional, o erro absoluto a mediana condicional. A escolha depende da questão de negócio: o custo de um erro grande é proporcional ao seu tamanho, ou mais que proporcional?

3.1 Parâmetro e hiperparâmetro

CritérioParâmetroHiperparâmetro
Quem fixa o valorO algoritmo de aprendizadoO engenheiro, ou um procedimento de busca
QuandoDurante o treinamentoAntes do treinamento
Fonte do valorOs dados de treinamentoUma escolha metodológica validada
ExemplosCoeficientes, limiares de uma árvore, pesos de uma redeProfundidade máxima, taxa de aprendizado, coeficiente de regularização, número de árvores
Efeito de uma modificaçãoMuda as previsões do modelo ajustadoMuda o modelo que será ajustado

Os hiperparâmetros definem H e o procedimento de otimização; os parâmetros designam o ponto retido em H. Seu ajuste é tratado no capítulo 009.

3.2 O que a mecânica não é

O ciclo não contém nenhuma etapa de compreensão, de interpretação ou de raciocínio causal. Ele contém uma forma funcional escolhida pelo engenheiro, uma medida de diferença escolhida pelo engenheiro, e um procedimento numérico que reduz essa medida.

Não há compreensão. Há uma minimização iterativa de uma quantidade escalar.

Não se trata de uma precaução retórica: um modelo explorará toda regularidade estatística presente nos dados, inclusive as que não têm nenhum sentido de negócio, as que resultam de artefatos de coleta, e as que não subsistirão em produção.

ANALOGIA — A afinação de um instrumento por um afinador surdo

Um operador dispõe de um instrumento com dois botões giratórios e de um mostrador graduado que exibe uma diferença. Ele não percebe o som. Ele gira o primeiro botão, lê o mostrador, constata que a diferença diminuiu, continua na mesma direção. Quando a diferença para de diminuir, ele passa ao segundo botão. Após algumas dezenas de ajustes, o mostrador exibe uma diferença mínima.

O operador não ouviu nada, não tem nenhuma noção de música e não poderia explicar o que é uma quinta justa. Ele minimizou o valor de um mostrador.

Duas consequências se transpõem exatamente: se o mostrador está mal calibrado, o instrumento estará desafinado com uma diferença exibida nula — papel crítico da função de perda e dos rótulos; se o mostrador mede apenas uma corda em seis, as cinco outras permanecerão desafinadas — papel crítico da escolha da métrica.


4. Ilustração com números em regressão

Tarefa: estimar o preço de venda de um imóvel a partir de sua área. X = área em m², Y = preço em dólares, n = 4.

CasaÁrea (m²)Preço observado ($)
A75272 500
B100370 000
C125467 500
D150560 000

O engenheiro postula uma relação afim preço = a × área + b. Essa escolha define H: o conjunto das retas do plano. Os parâmetros a determinar são a (preço por metro quadrado) e b (termo constante). A função de perda escolhida é o erro absoluto, escolhido pela legibilidade dos cálculos; o risco empírico é, portanto, o erro absoluto médio sobre as quatro casas.

4.1 Iteração 1 — Inicialização: a = 1 000, b = 0

CasaÁreaPreço observadoPreço previstoErro absoluto
A75272 50075 000197 500
B100370 000100 000270 000
C125467 500125 000342 500
D150560 000150 000410 000
Erro médio305 000

Todas as previsões são inferiores aos preços observados e a diferença cresce com a área: o coeficiente a é fraco demais. Direção de correção: aumentar a.

4.2 Iteração 2 — a = 2 000, b = 0

CasaÁreaPreço observadoPreço previstoErro absoluto
A75272 500150 000122 500
B100370 000200 000170 000
C125467 500250 000217 500
D150560 000300 000260 000
Erro médio192 500

O erro médio cai de 305 000 para 192 500: a correção ia na direção certa. O diagnóstico permanece inalterado, continua-se com um passo maior.

4.3 Iteração 3 — a = 3 500, b = 0

CasaÁreaPreço observadoPreço previstoErro absoluto
A75272 500262 50010 000
B100370 000350 00020 000
C125467 500437 50030 000
D150560 000525 00035 000
Erro médio23 750

O diagnóstico muda de natureza: os erros são agora da mesma ordem de grandeza e todos do mesmo sinal, as previsões permanecendo inferiores aos preços observados em cerca de 25 000 $. Esse deslocamento constante não é corrigível por a — fazê-lo crescer degradaria as grandes áreas. Ele pertence ao termo constante b.

4.4 Iteração 4 — a = 3 500, b = 25 000

CasaÁreaPreço observadoPreço previstoErro com sinalErro absoluto
A75272 500287 500−15 00015 000
B100370 000375 000−5 0005 000
C125467 500462 500+5 0005 000
D150560 000550 000+10 00010 000
Erro médio8 750

Os erros são agora de sinais opostos: duas previsões altas demais, duas baixas demais. Nenhuma correção global de a ou de b pode mais reduzir o conjunto simultaneamente. O processo atingiu um regime de compromisso, o que constitui o critério de parada.

4.5 O modelo final e sua aplicação

preço estimado = 3 500 × área + 25 000

Esses dois números constituem a integralidade do que foi aprendido. Aplicado a um caso novo, um imóvel de 110 m² ausente da amostra:

preço estimado = 3 500 × 110 + 25 000 = 410 000 $

O modelo produz um valor para uma observação jamais encontrada. Essa passagem do conhecido ao desconhecido é a generalização, tratada na seção 7.

O que este exemplo estabelece

Primeiro ensinamento — Nenhuma compreensão do domínio é mobilizada

O procedimento não mobilizou nenhum conhecimento do mercado imobiliário. Ele não consultou nenhuma tabela, não conhece nem a noção de bairro, nem a de estado do imóvel, nem a de taxa de juros. Ele produziu dois números que minimizam uma média de diferenças. O fato de a = 3 500 ser interpretado como um preço por metro quadrado é uma leitura efetuada pelo analista a posteriori, não um conhecimento detido pelo modelo.

Segundo ensinamento — O mecanismo é tentativa, medida, ajuste

Quatro iterações foram apresentadas; um algoritmo real efetua milhares, com ajustes de pequena amplitude guiados pelo gradiente em vez da inspeção dos sinais de erro. A estrutura lógica é a da seção 3, sem acréscimo: propor, medir a diferença, corrigir na direção que reduz a diferença.

Terceiro ensinamento — A forma da regra é escolhida pelo engenheiro

A máquina não decidiu que o preço seria uma função afim da área. Essa hipótese foi colocada antes de qualquer cálculo e restringe definitivamente o resultado: se a relação real é em escada, atinge um teto além de certa área, ou depende de uma interação com o bairro, esse modelo jamais poderá representá-la, qualquer que seja o volume de dados fornecido. A escolha da classe de modelos é um ato de engenharia anterior e superior ao ajuste: é o erro de aproximação definido na seção 1.


5. Ilustração em classificação e fronteira de decisão

Tarefa: prever se um prospect efetuará uma compra a partir de sua idade e de seu salário anual. X = (idade, salário), Y = {Compra, Sem compra}, n = 6.

ProspectIdadeSalário anual ($)Compra
P12228 000Não
P22532 000Não
P33141 000Não
P43858 000Sim
P54572 000Sim
P65285 000Sim

A diferença formal em relação à seção 4 está na natureza de Y: um conjunto finito não ordenado substitui um intervalo de reais. Essa única diferença muda a função de perda, as métricas de avaliação e a interpretação geométrica do modelo.

DEFINIÇÃO — Fronteira de decisão (decision boundary)

Definição rigorosa

Para um classificador f̂ : X → Y, a fronteira de decisão é o subconjunto de X constituído pelos pontos nos quais a regra de decisão muda de classe atribuída. No caso binário baseado em um score contínuo s(x) e um limiar t, ela é o conjunto de nível { x ∈ X | s(x) = t }. Ela particiona X em regiões de decisão, cada uma associada a uma classe.

Propriedade geométrica

Em um espaço com d variáveis, a fronteira é uma hipersuperfície de dimensão d − 1: um ponto em uma reta, uma curva no plano, uma superfície em dimensão três.

Classe de modelosForma da fronteira
Regressão logísticaHiperplano: reta no plano
Árvore de decisãoSegmentos paralelos aos eixos, em escada
Máquina de vetores de suporte com kernelCurva regular, forma dependente do kernel
Rede neuralHipersuperfície arbitrariamente complexa

Ponto de atenção

A fronteira é deslocável sem retreinamento: modificar o limiar t a desloca ao longo das linhas de nível do score. Essa propriedade é explorada no capítulo 062.

Sobre as seis observações, uma regra afim separa perfeitamente os dois grupos: score bruto = salário + 1 000 × idade, fronteira em 90 000.

ProspectScore brutoPosiçãoClasse previstaClasse observada
P150 000Abaixo da fronteiraNãoNão
P257 000Abaixo da fronteiraNãoNão
P372 000Abaixo da fronteiraNãoNão
P496 000AcimaSimSim
P5117 000AcimaSimSim
P6137 000AcimaSimSim

Ponto de atenção: uma separação perfeita sobre seis observações não é um desempenho. Quando o número de observações é baixo diante do número de variáveis, a separabilidade perfeita é frequente e constitui até um sinal de alerta quanto ao sobreajuste (capítulo 031).

5.1 A saída probabilística e o limiar

Um classificador não produz diretamente uma classe. Ele produz primeiro um score contínuo, geralmente transformado em estimativa de probabilidade condicional, depois aplica um limiar para decidir.

DEFINIÇÃO — Score, probabilidade prevista e limiar de decisão

Definição rigorosa

Um classificador probabilístico estima a lei condicional P(Y | X = x). Para um problema binário com Y = {0, 1}, ele produz p̂(x) ∈ [0, 1] estimando P(Y = 1 | X = x). A regra de decisão associada a um limiar t é: ŷ = 1 se p̂(x) ≥ t, ŷ = 0 senão.

AtoNaturezaQuem o determinaModificável após o treinamento
Estimativa de p̂(x)EstatísticaO modelo, por ajuste sobre DNão, sem retreinamento
Escolha do limiar tDecisóriaA organização, segundo o custo dos errosSim, imediatamente

Ponto de atenção sobre a calibração

Um score elevado não equivale a probabilidade confiável. Um modelo está calibrado quando, entre as observações às quais ele atribui um score de 0,80, aproximadamente 80 % pertencem efetivamente à classe positiva. Os scores brutos de numerosos algoritmos não possuem essa propriedade e necessitam de uma recalibração (capítulo 029).

Tradução em linguagem corrente

O modelo produz um grau de confiança. A transformação desse grau em decisão é uma escolha de gestão, não uma escolha técnica. O valor 0,50 é um padrão de implementação, jamais uma justificativa.

Para o caso novo "35 anos, 60 000 $", o score bruto vale 95 000, ou seja, 5 000 acima da fronteira; transformado em probabilidade, dá P(y = Compra | x) = 0,81, e o limiar padrão de 0,50 leva a prever "Compra". Com um limiar elevado a 0,85, a mesma observação, o mesmo modelo e o mesmo score levariam a prever "Sem compra". O modelo não mudou; a decisão mudou. A escolha do limiar depende do custo respectivo dos dois tipos de erro, tratado nos capítulos 052 e 062.

CritérioRegressão (seção 4)Classificação (seção 5)
Natureza de YIntervalo de reaisConjunto finito não ordenado
Saída bruta do modeloUm valor numéricoUm score ou uma probabilidade por classe
Etapa de decisão adicionalNenhumaAplicação de um limiar
Função de perda usualErro quadrático, erro absolutoEntropia cruzada
Interpretação geométricaCurva de ajusteFronteira de decisão
Métricas de avaliaçãoErro médio, coeficiente de determinaçãoExatidão, precisão, recall, área sob a curva

6. Os três regimes: treinamento, avaliação, produção

TreinamentoAvaliaçãoProdução
Natureza dos dadosConjunto de treinamento, históricoConjunto de teste, histórico posto de ladoFluxo real, observações novas
Rótulo disponívelSim, utilizado para o ajusteSim, apenas para a comparaçãoNão, no momento da previsão
Ação do sistemaAjustar os parâmetrosPrever e medir a diferençaPrever
Chamada de códigomodel.fit(X_train, y_train)model.predict(X_test) depois comparação com y_testmodel.predict(x_nouveau)
O modelo é modificadoSimNãoNão
AnalogiaA preparação com os gabaritosO simulado sobre provas inéditasO exercício profissional real
O que se obtémUm modelo ajustadoUma estimativa do risco esperadoUma decisão operacional
python
# Regime 1 — treinamento: o modelo vê x e y
model.fit(X_train, y_train)

# Regime 2 — avaliação: o modelo vê x, y serve unicamente à comparação
y_pred = model.predict(X_test)
score = metrique(y_test, y_pred)

# Regime 3 — produção: y ainda não existe
y_estime = model.predict(x_nouvelle_observation)

A dificuldade profissional não reside na escrita dessas três linhas, mas na constituição correta de X_train, X_test e de seus rótulos.

Ponto de atenção maior

Avaliar um modelo sobre os dados que serviram ao seu treinamento produz uma estimativa otimista, desprovida de valor informativo.

A justificativa formal foi dada na seção 1: foi selecionada precisamente para minimizar sobre essas observações, de modo que R̂(f̂) é um estimador enviesado de R(f̂). As modalidades de divisão e a validação cruzada são tratadas no capítulo 026.

DEFINIÇÃO — Conjunto de treinamento, conjunto de validação, conjunto de teste

Definição rigorosa

  • O conjunto de treinamento é o subconjunto de D utilizado para o ajuste dos parâmetros.
  • O conjunto de validação é o subconjunto utilizado para as escolhas efetuadas pelo engenheiro: hiperparâmetros, classe de modelos, variáveis retidas.
  • O conjunto de teste é o subconjunto reservado à estimativa final do risco esperado, utilizado uma única vez, depois que todas as escolhas foram fechadas.

Justificativa da distinção validação / teste

Toda escolha efetuada à vista de uma pontuação sobre um conjunto de dados otimiza implicitamente sobre esse conjunto. Um conjunto de validação consultado várias dezenas de vezes deixa de ser neutro: o processo de seleção introduziu nele um viés otimista, de natureza idêntica ao do conjunto de treinamento, embora de amplitude menor.

Regra operacional

O conjunto de teste só é aberto uma vez, e o resultado obtido é o que é reportado. Se ele for consultado e depois seguido de uma modificação do modelo, ele mudou de natureza e tornou-se um conjunto de validação.

ANALOGIA — O simulado

Uma escola deseja estimar os resultados de seus estudantes no exame final.

Protocolo falho: o simulado retoma os exercícios da coletânea de treinamento. Os resultados são excelentes e não preveem nada; eles medem a memorização da coletânea.

Protocolo válido: o simulado versa sobre provas inéditas, de mesma natureza e de mesma dificuldade que as do exame final. Os resultados são mais baixos e constituem uma estimativa utilizável.

A diferença entre os dois protocolos não é a dificuldade das provas, mas o fato de elas terem sido, ou não, utilizadas durante a preparação. É a única questão que governa a validade de uma avaliação.


7. A generalização como objetivo único

DEFINIÇÃO — Generalização

Definição rigorosa

A generalização designa a capacidade de um modelo ajustado de manter um nível de desempenho dado sobre observações provenientes da mesma distribuição P(X, Y) que as da amostra de treinamento, mas não observadas durante o ajuste. Ela se quantifica pela lacuna de generalização R(f̂) − R̂(f̂): uma lacuna pequena indica que o desempenho medido sobre a amostra é representativo do desempenho esperado.

Condição de validade

A definição contém uma condição explícita: "provenientes da mesma distribuição". Quando a distribuição dos dados de produção difere da dos dados de treinamento, a garantia não se aplica mais. Esse fenômeno é a deriva, tratada no capítulo 082; a generalização não protege contra ela.

Tradução em linguagem corrente

Generalizar é funcionar em casos jamais encontrados, e não apenas nos que serviram ao aprendizado.

Erro de treinamentoErro de generalização
DefiniçãoRisco empírico sobre o conjunto de treinamentoRisco esperado sobre a distribuição geradora
NotaçãoR̂(f̂) sobre D_trainR(f̂)
CalculávelSim, diretamenteNão, apenas estimável
Estimador práticoErro medido no conjunto de teste
O que medeA qualidade do ajuste aos dados vistosA qualidade esperada em produção
Pode ser nuloSim, por um modelo suficientemente expressivoNão, o erro irredutível o limita
Valor decisórioNulo tomado isoladamenteÚnico valor decisório do projeto

A lacuna entre os dois constitui o diagnóstico principal do praticante.

Erro de treinamentoErro de testeDiagnósticoTratamento
ElevadoElevadoSubajuste (underfitting): modelo restrito demaisEnriquecer as variáveis, aumentar a expressividade
BaixoElevadoSobreajuste: o modelo memorizouRegularizar, simplificar, aumentar o volume
BaixoBaixoRegime satisfatórioVerificar a ausência de vazamento (capítulo 028)
ElevadoBaixoSituação anormalVerificar o protocolo de divisão

7.1 O exemplo canônico

Um modelo de previsão de demanda é treinado com os dados de janeiro a junho. Ele atinge um erro médio de 3,1 % nesse período. Esse número não apresenta nenhum interesse decisório: ele descreve a capacidade do modelo de reajustar um período cujos valores ele já conhece.

A única pergunta que importa é: qual é o erro em julho?

Julho não foi observado durante o ajuste. O desempenho em julho é a única informação que esclarece o que o modelo produzirá em agosto e em qualquer período futuro. O que vale para uma separação temporal vale para uma separação aleatória, por site, por cliente ou por região. A pergunta é invariante: qual é o desempenho sobre o que não serviu ao ajuste?

Nenhuma dessas técnicas tem finalidade própria. A separação dos dados não existe para respeitar uma convenção; a regularização não existe para produzir modelos mais elegantes. Cada uma existe para tornar o erro de generalização estimável, ou para reduzi-lo.

Um praticante que não relaciona o conjunto de suas escolhas metodológicas à lacuna de generalização aplica receitas.

ANALOGIA — O ator que memorizou seu texto

Um ator conhece integralmente o texto de sua peça. Ele o restitui sem falha, com as entonações acertadas no ensaio: nesse repertório, seu desempenho é perfeito.

Na noite da apresentação, um parceiro pula uma réplica. O ator que memorizou se interrompe: a sequência aprendida não corresponde mais à situação. O ator que compreendeu a situação dramática improvisa uma réplica coerente e prossegue. Os dois eram indistinguíveis no ensaio: obtinham a mesma pontuação no conjunto de treinamento.

AtorSobre o texto conhecidoSobre a situação imprevistaModelo correspondente
Aquele que memorizouPerfeitoFalhoSobreajuste
Aquele que compreendeuBomBomGeneralização

Ponto de transposição: a única maneira de distinguir os dois atores é colocá-los diante de uma situação não ensaiada. É exatamente a função do conjunto de teste. Sem essa prova, os dois perfis são indistinguíveis — e o perfil falho obtém até as melhores pontuações aparentes.

7.2 Estudo de caso — Manutenção preditiva em um parque de 300 máquinas

Contexto. Um industrial opera 300 máquinas instrumentadas distribuídas em quatro sites, transmitindo continuamente leituras de vibração, de temperatura, de consumo elétrico e de contadores de uso. O serviço de manutenção dispõe de um registro de intervenções cobrindo trinta meses. Uma parada não planejada custa cerca de 18 000 $ em produção perdida; uma intervenção preventiva planejada, cerca de 1 200 $.

Etapa 1 — Verificação da viabilidade do supervisionado

CondiçãoVerificação efetuadaStatus
Um alvo observável existe no históricoO registro permite datar cada falhaSatisfeita
O histórico é suficiente em volume e em eventos30 meses, 300 máquinas, 412 falhas não planejadasSatisfeita
As variáveis estão disponíveis no momento da previsãoLeituras com carimbo de tempo, acessíveis em tempo realSatisfeita
A previsão abre para uma decisão acionávelUma intervenção preventiva pode ser planejadaSatisfeita
O custo do erro é aceitávelFalso positivo 1 200 $, falso negativo 18 000 $Satisfeita, com forte assimetria

Etapa 2 — Formulação operacional do alvo

A formulação de negócio inicial — "antecipar as panes" — não é explorável em seu estado atual. Quatro formulações candidatas foram instruídas.

Formulação candidataTipo de problemaDefeito eliminatório
"A máquina está atualmente em pane?"Classificação sobre estado instantâneoA variável é diretamente observável e a pane já ocorreu. Nenhuma antecipação, logo nenhuma decisão possível
"Qual é a vida útil residual?"RegressãoExige a data exata de falha futura para cada observação. As máquinas em serviço não têm data de fim: a amostra é censurada, o que invalida uma regressão ingênua
"A máquina cairá em pane algum dia?"Classificação sem horizonteAlvo degenerado: a resposta é positiva para todas as máquinas. Prevalência de 100 %, nenhuma informação a aprender
"A máquina cairá em pane nos próximos 7 dias?"Classificação binária com horizonte fixadoRetida. Defeitos residuais conhecidos e gerenciáveis: forte desbalanceamento das classes, sensibilidade à escolha do horizonte

Alvo retido: panne_7j = 1 se uma falha não planejada ocorre na máquina nos 7 dias seguintes à data da leitura, 0 senão.

Etapa 3 — Justificativa do horizonte pelo prazo de intervenção

Horizonte consideradoConsequência
2 diasPrevisões mais exatas, mas inexploráveis: a peça não é entregue a tempo. Nenhum valor de negócio
7 diasCompatível com a cadeia logística de intervenção. Horizonte retido
30 diasSinal precursor fraco demais nesse prazo: a prevalência aumenta, mas a separabilidade cai. Alertas numerosos demais e precoces demais

Princípio: o horizonte de um alvo preditivo deduz-se do prazo de acionabilidade da decisão, jamais da comodidade estatística.

Etapa 4 — Variáveis candidatas

VariávelDescriçãoJustificativa de negócio
vib_rms_24hVibração eficaz média em 24 horasIndicador direto do desgaste dos rolamentos e do desbalanceamento
vib_delta_7jDesvio em relação à média dos 7 dias anterioresA degradação se sinaliza por uma evolução, não por um nível absoluto próprio de cada máquina
temp_max_24hTemperatura máxima da carcaça em 24 horasUm aquecimento anormal sinaliza uma fricção ou um defeito de lubrificação
temp_ecart_consigneDesvio em relação à temperatura nominal do modeloNormaliza a temperatura entre máquinas de gerações diferentes
heures_depuis_maintenanceHoras de funcionamento desde a última intervençãoO desgaste é função do tempo de serviço, não do tempo de calendário
cycles_jour_moyen_7jNúmero médio de ciclos diários em 7 diasMede a intensidade de solicitação
conso_elec_ecartDesvio de consumo em relação à linha de base da máquinaUm sobreconsumo a carga constante indica uma resistência mecânica aumentada
nb_arrets_courts_30jNúmero de microparadas em 30 diasAs microparadas precedem frequentemente as falhas maiores
age_machine_moisIdade da máquinaA taxa de falha depende da posição no ciclo de vida
siteSite de operaçãoCaptura as diferenças de ambiente: temperatura ambiente, qualidade do ar, práticas locais de manutenção

Ponto de atenção: vib_delta_7j, temp_ecart_consigne e conso_elec_ecart são variáveis construídas, não leituras brutas. Sua construção deve ser reprodutível de forma idêntica em produção (capítulo 040).

Etapa 5 — Estrutura do conjunto de dados

Uma observação é um par (máquina, data), ou seja, cerca de 270 000 linhas. Taxa de eventos positivos: cerca de 1,1 %.

machine_iddatevib_rms_24hvib_delta_7jtemp_max_24hheures_depuis_maint.nb_arrets_courts_30jsitepanne_7j
M-0142024-03-112,1+0,1648200Nord0
M-0142024-03-122,2+0,2658280Nord0
M-0872024-05-025,8+2,4812 3404Sud1
M-0872024-05-036,1+2,7842 3485Sud1
M-2012024-07-193,4+0,3711 5101Est0
M-2332024-09-086,2+3,1882 7807Nord1

Etapa 6 — Estrutura do modelo aprendido

Uma árvore de decisão de baixa profundidade ajustada sobre esses dados produz a estrutura a seguir; as probabilidades são as da classe positiva em cada folha.

Leitura: a variável mais discriminante não é o nível de vibração, mas sua variação recente, resultado coerente com a expertise de negócio — cada máquina possui sua assinatura vibratória própria, e é o desvio em relação a essa assinatura que carrega a informação. Essa coerência não constitui uma validação, mas sua ausência teria constituído um sinal de alerta sobre a construção dos dados.

Etapa 7 — As cinco armadilhas esperadas

ArmadilhaManifestação neste casoConsequência se não tratadaCapítulo
Desbalanceamento das classes1,1 % de observações positivasUm modelo que prevê sempre "sem pane" atinge 98,9 % de exatidão e não detecta nada. A exatidão é inutilizável como métrica050
Custo assimétrico dos errosFalso negativo 18 000 $, falso positivo 1 200 $, razão de 15 para 1Um limiar em 0,50 minimiza o número de erros, não seu custo. O limiar deve ser reduzido até o ponto de equilíbrio econômico052 e 075
Vazamento de dadosAs colunas date_intervention, code_panne e duree_arret só são preenchidas após a falhaDesempenho quase perfeito em validação, colapso em produção. Modo de falha mais frequente nesse tipo de projeto028
Sobreajuste270 000 linhas, mas 412 eventos reais, e fortes correlações entre leituras sucessivas de uma mesma máquinaO modelo memoriza as assinaturas das máquinas que sofreram uma pane em vez de aprender o mecanismo de degradação031
DerivaRenovação do parque, mudança de fornecedor de peças, modificação das cadênciasO desempenho se degrada progressivamente sem alerta, os sensores continuando a emitir valores plausíveis082
PONTO DE ATENÇÃO — A divisão aleatória por linha em dados temporais

O que acontece

Extrair aleatoriamente 20 % das 270 000 linhas para constituir o conjunto de teste coloca as leituras da máquina M-087 de 2 de maio em treinamento e as de 3 de maio em teste, quando elas são quase idênticas. O modelo é avaliado sobre observações das quais viu quase-réplicas durante o ajuste: o erro de teste torna-se um estimador otimista do erro de generalização, a condição "não observadas" não sendo satisfeita na prática, embora o seja formalmente no nível da linha.

Protocolo correto

A divisão deve reproduzir a situação de produção: o modelo será aplicado a datas posteriores às de seu treinamento, e às vezes a máquinas recém-instaladas.

DivisãoPergunta à qual responde
Temporal: treinamento em 24 meses, teste nos 6 últimosO modelo funciona no período futuro?
Por máquina: treinamento em 240 máquinas, teste em 60 reservadasO modelo funciona em uma máquina jamais observada?

As duas estimativas são úteis e respondem a perguntas distintas (capítulo 026).


8. Erros de raciocínio frequentes

ERRO — Atribuir ao modelo uma compreensão do domínio

O exemplo da seção 4 produziu a = 3 500. É tentador concluir que o modelo "sabe" que o metro quadrado vale 3 500 $. O modelo não detém nenhuma noção de metro quadrado, de preço nem de imóvel: ele detém dois números que minimizam uma média de diferenças sobre quatro observações.

Consequência operacional: uma área de 900 m² produzirá uma estimativa de 3 175 000 $ sem que nenhum mecanismo alerte sobre o absurdo da extrapolação.

Formulação correta: "O modelo ajustou dois parâmetros que minimizam a diferença média em relação aos preços observados na amostra fornecida."

ERRO — Interpretar "supervisionado" como uma supervisão humana em produção

A supervisão qualifica a disponibilidade de rótulos de referência durante o treinamento. Ela não descreve o regime de funcionamento do sistema implantado, que pode ser inteiramente automático. Essa confusão leva a supor um controle humano que não existe, e a não prever as salvaguardas necessárias.

Formulação correta: "O aprendizado é dito supervisionado porque cada observação de treinamento estava acompanhada do valor-alvo a reproduzir. A presença de um operador em produção é uma decisão distinta."

ERRO — Tratar o rótulo como um dado neutro

O rótulo é apresentado como a verdade de referência. Ele é, na realidade, o produto de um procedimento — registro, declaração, julgamento, regra — que possui seus vieses, seus pontos cegos e sua taxa de erro própria.

Caso característico: treinar um modelo sobre as fraudes detectadas equivale a aprender a detectar o que o dispositivo atual já detecta; as fraudes que lhe escapam estão rotuladas "não fraudulentas" nos dados.

Formulação correta: "O desempenho do modelo é limitado pela qualidade do procedimento que produziu os rótulos. A primeira etapa do projeto é a instrução desse procedimento."

ERRO — Formular o alvo sem definição operacional nem horizonte

"Prever as panes", "prever o cancelamento", "prever a fraude" não são alvos, mas intenções. Um alvo explorável contém três elementos: um evento definido sem ambiguidade, um horizonte temporal, e uma data de observação a partir da qual esse horizonte corre. Sem eles, a coluna-alvo não pode ser construída, e duas pessoas trabalhando no mesmo projeto construirão duas versões diferentes.

Formulação correta: "panne_7j vale 1 quando uma falha não planejada ocorre nos 7 dias seguintes à data da leitura, 0 senão."

ERRO — Avaliar o modelo sobre os dados de treinamento

A pontuação obtida sobre os dados que serviram ao ajuste é um estimador otimistamente enviesado do risco esperado: o modelo foi selecionado para minimizar precisamente essa quantidade. Uma árvore de decisão não restrita atinge 100 % de exatidão em seus dados de treinamento, quaisquer que sejam os dados; esse número mede apenas sua capacidade de memorização.

Formulação correta: "O erro reportado é o medido em um conjunto de teste constituído de observações que não participaram nem do ajuste dos parâmetros nem da seleção dos hiperparâmetros."

ERRO — Confundir parâmetro e hiperparâmetro

Os parâmetros são determinados pelo algoritmo a partir dos dados; os hiperparâmetros são fixados antes do treinamento e definem o espaço das hipóteses assim como o procedimento de otimização.

Consequência operacional: os hiperparâmetros não podem ser ajustados sobre o conjunto de treinamento, já que governam a capacidade do modelo de se ajustar a ele; tal ajuste leva sistematicamente ao modelo mais expressivo possível, logo ao sobreajuste (capítulo 009).

Formulação correta: "Os hiperparâmetros são selecionados por validação sobre dados distintos dos que servem ao ajuste dos parâmetros."

ERRO — Usar uma variável indisponível no instante da previsão

Uma variável presente no histórico não está necessariamente disponível no momento em que a previsão deverá ser produzida: o registro de manutenção contém a duração de parada, conhecida somente após a pane.

Teste a aplicar sistematicamente: para cada variável candidata, perguntar-se se seu valor será conhecido no instante exato em que o modelo deverá prever em produção. Toda resposta negativa desqualifica a variável. O sintoma é um desempenho anormalmente elevado em validação seguido de um colapso em produção: é o vazamento de dados, tratado no capítulo 028.

Formulação correta: "O conjunto das variáveis retidas está disponível no instante da previsão, o que foi verificado variável por variável junto aos operadores do sistema de origem."

ERRO — Considerar o desempenho medido como garantido no tempo

A definição da generalização contém a condição "provenientes da mesma distribuição". Essa condição é verificável no momento da avaliação; ela não é garantida depois. Um modelo validado a 92 % de exatidão pode funcionar a 71 % dezoito meses depois sem que nenhum erro técnico tenha ocorrido e sem que nenhum alerta se dispare.

Formulação correta: "O desempenho medido vale para a distribuição observada no período de avaliação. Um dispositivo de monitoramento da deriva e um procedimento de retreinamento estão previstos (capítulo 082)."


9. Síntese

FORMALIZAÇÃO
    Dados     : D = {(xi, yi)}, i = 1..n, extraídos de P(X, Y) desconhecida e fixa
    Hipótese  : existe f : X → Y, eventualmente ruidosa
    Objetivo  : minimizar o risco esperado       R(h)  = E[L(y, h(x))]
    Realidade : minimiza-se o risco empírico     R^(h) = (1/n) Σ L(yi, h(xi))
    Princípio : minimização do risco empírico (ERM)

O TERMO "SUPERVISIONADO"
    Designa a disponibilidade de um rótulo de referência no treinamento.
    Não designa nenhuma vigilância humana em execução.

OS RÓTULOS
    Seis fontes : histórico natural, ação do usuário, anotação humana,
    especialista do domínio, regra de negócio automática, medida instrumental.
    Pergunta obrigatória : como o rótulo foi produzido?
    Rótulos provenientes de um sistema de regras : o desempenho atinge aí seu teto.

A MECÂNICA
    Tentativa  ->  Medida do erro  ->  Correção  ->  Tentativa ...
    Parâmetro      : ajustado pelo algoritmo, a partir dos dados
    Hiperparâmetro : fixado pelo engenheiro, antes do treinamento
    Não há compreensão. Há uma minimização iterativa.

OS DOIS TIPOS DE PROBLEMAS
    Regressão      : Y contínuo  ->  um valor
    Classificação  : Y finito    ->  um score, depois um limiar, depois uma classe
    A fronteira de decisão se desloca mudando o limiar,
    sem retreinar o modelo.

OS TRÊS REGIMES
    Treinamento : y conhecido e utilizado   model.fit(X_train, y_train)
    Avaliação   : y conhecido, oculto       model.predict(X_test) depois comparação
    Produção    : y desconhecido            model.predict(x_nouveau)

O OBJETIVO ÚNICO
    Lacuna de generalização = risco esperado − risco empírico
    Erro de treinamento : sem valor decisório
    Erro de teste       : única estimativa utilizável
    Separação dos dados, validação cruzada, regularização, detecção
    do sobreajuste : nenhuma tem finalidade própria.
    Todas servem à generalização.

Enunciado de síntese

O aprendizado supervisionado consiste em ajustar uma função parametrizada sobre uma amostra de observações rotuladas, minimizando um risco empírico que não é mais que um substituto calculável do risco realmente visado; o valor do modelo nunca se mede sobre as observações que serviram para ajustá-lo, mas sobre aquelas que ele não viu.


Quizzes associados: 004.1-quiz-formalisation.md, 004.2-quiz-donnees-etiquetees.md, 004.3-quiz-mecanique-ajustement.md, 004.4-quiz-regression-chiffree.md, 004.5-quiz-classification-frontiere.md, 004.6-quiz-trois-regimes.md, 004.7-quiz-generalisation.md

Próximo capítulo: 005-dataset-observation.md