Os capítulos 001 a 003 situaram o aprendizado supervisionado na taxonomia da área e distinguiram as três famílias de aprendizado. Este capítulo passa da situação à mecânica: o que contém um problema supervisionado, o que faz o algoritmo quando ajusta um modelo, e o que se mede quando o avaliamos.
A definição é dada em quatro níveis de precisão decrescente. Os quatro enunciam a mesma coisa. O primeiro deve ser dominado; os três outros servem à transmissão.
Os espaços. Um espaço das entradas X (tipicamente X ⊆ R^d, onde d é o
número de variáveis explicativas) e um espaço das saídas Y. A natureza de Y
determina o tipo de problema: Y ⊆ R para a regressão,
Y = {c1, ..., cK} finito e não ordenado para a classificação.
A distribuição geradora. Os pares observação-rótulo são supostamente
provenientes de uma distribuição conjunta P(X, Y), desconhecida e suposta fixa no
período considerado. Sem essa hipótese, nada do que é observado
informa sobre o que não é.
A hipótese de dependência. Postula-se uma relação entre X e Y,
formalizada por uma função desconhecida f : X → Y, ou, no caso geral em que a
relação é ruidosa, pela lei condicional P(Y | X). O modelo usual
escreve-se y = f(x) + ε, onde ε é um termo aleatório de esperança nula
que representa o que influi sobre y sem ser capturado por x.
A amostra. Não dispomos nem de f, nem de P, mas de uma amostra finita
D = {(x1, y1), (x2, y2), ..., (xn, yn)}, (xi, yi) ~ P(X, Y)de n observações supostamente independentes e identicamente distribuídas.
O critério. Uma função de perda L : Y × Y → R+ quantifica a diferença entre
valor previsto e valor observado. O risco esperado de uma hipótese h é
R(h) = E[L(y, h(x))], a esperança recaindo sobre (x, y) ~ P(X, Y). O objetivo
teórico é h* = argmin R(h) sobre o espaço das hipóteses H, conjunto das
funções que a classe de modelos escolhida pode representar.
O obstáculo e seu contorno. R(h) não é calculável, pois P é
desconhecida. Substitui-se por ele o risco empírico
R̂(h) = (1/n) · Σ L(yi, h(xi)) para i = 1..ne resolve-se o problema acessível f̂ = argmin R̂(h) sobre H. Esse princípio é
a minimização do risco empírico (Empirical Risk Minimization, ERM); ele
constitui o fundamento formal do aprendizado supervisionado.
Definição rigorosa
O risco esperado é a esperança da perda sob a distribuição
geradora: R(h) = E[L(y, h(x))]. Ele quantifica o desempenho de h sobre
o conjunto das observações que a distribuição pode produzir, observadas ou não.
O risco empírico é a média da perda sobre a amostra disponível.
É um estimador não enviesado de R(h) para uma hipótese fixada de antemão.
A minimização do risco empírico (Vapnik, 1995) consiste em reter a
hipótese que minimiza R̂ sobre H, em substituição à minimização
inacessível de R.
Ponto de atenção central
A ausência de viés vale para uma hipótese fixada antes de observar a
amostra. A partir do momento em que f̂ é selecionada minimizando R̂, a
quantidade R̂(f̂) torna-se um estimador otimistamente enviesado de R(f̂). É
a justificativa formal da separação dos dados (capítulo 026) e
a origem mecânica do sobreajuste (overfitting) (capítulo 031).
Tradução em linguagem corrente
Gostaríamos do modelo que erra menos em todos os casos possíveis; só podemos medir o erro nos casos de que dispomos. Escolhemos, portanto, o modelo que erra menos nesses, sabendo que essa pontuação é lisonjeira.
| Termo de erro | Origem | Alavanca de redução |
|---|---|---|
| Aproximação | A melhor função de H permanece distante de f | Ampliar H: modelo mais expressivo, variáveis adicionais |
| Estimação | n é finito, R̂ só estima R imperfeitamente | Aumentar n, restringir H, regularizar |
| Otimização | O algoritmo não atinge exatamente o mínimo de R̂ | Ajustar o procedimento de otimização |
| Irredutível | O ruído ε: y não é determinado por x | Nenhuma. Ele limita o desempenho atingível |
Ampliar H reduz o erro de aproximação e aumenta o erro de estimação.
Esse dilema é o compromisso viés-variância, tratado no capítulo 031.
O aprendizado supervisionado consiste em ajustar uma função parametrizada sobre um conjunto de exemplos cujo valor a prever é conhecido, minimizando uma medida de diferença entre valores previstos e valores observados, a fim de aplicar em seguida essa função a observações cujo valor é desconhecido.
Formulação destinada a um documento de concepção. Ela nomeia os quatro elementos obrigatórios: exemplos rotulados, função parametrizada, medida de diferença, aplicação ao desconhecido.
Fornece-se a um algoritmo um grande número de casos passados acompanhados de sua resposta. O algoritmo busca a regra que melhor relaciona as informações disponíveis à resposta. Essa regra é em seguida aplicada a casos novos, para os quais a resposta não é conhecida.
Formulação destinada a um comitê de direção. Ela não contém nenhuma aproximação falsa; omite o formalismo.
Leitura: a seta Y → ALG só existe na fase de treinamento. É ela,
e somente ela, que distingue o aprendizado supervisionado do não supervisionado
(capítulo 003).
| Nível | Formulação | Destinatário | Contexto de uso |
|---|---|---|---|
| 1 | Matemática: f̂ = argmin R̂(h) sobre H, D ~ P(X,Y) | Cientista de dados, examinador | Entrevista técnica, especificação |
| 2 | Técnica: função parametrizada ajustada por minimização de uma diferença | Engenheiro, arquiteto | Documento de concepção |
| 3 | Corrente: casos passados com resposta, regra induzida, aplicação ao novo | Direção, negócio | Comitê de pilotagem |
| 4 | Gráfica: duas fases, uma seta discriminante | Qualquer público | Material de apresentação |
| Símbolo | Designação |
|---|---|
x, y | Vetor de variáveis explicativas, rótulo observado |
n, d | Número de observações, número de variáveis |
P(X, Y) | Distribuição conjunta geradora, desconhecida |
D | Amostra de treinamento, n pares |
f, f̂ | Relação verdadeira desconhecida, modelo ajustado retido |
ŷ | Valor previsto, ŷ = f̂(x) |
H, L | Espaço das hipóteses, função de perda |
R(h), R̂(h) | Risco esperado (não calculável), risco empírico |
Definição rigorosa
A supervisão designa a disponibilidade, para cada observação da amostra
de treinamento, de um sinal de referência yi correspondente ao valor que
o modelo deve aprender a produzir. Esse sinal desempenha o papel de um supervisor no
sentido da teoria do controle: ele fornece, para cada tentativa, a informação
de diferença que permite a correção.
Origem terminológica
A expressão supervised learning provém da literatura sobre redes neurais dos anos 1950-1960, que distinguia os procedimentos que dispunham de um teacher signal daqueles que eram desprovidos dele. O supervisor é o sinal, não uma pessoa.
Ponto de atenção
A supervisão é uma propriedade dos dados de treinamento, não do regime de funcionamento do sistema. Um modelo supervisionado implantado pode funcionar sem nenhuma intervenção humana; inversamente, um sistema não supervisionado pode ser colocado sob controle humano permanente.
| O que "supervisionado" designa | O que "supervisionado" não designa |
|---|---|
| Um rótulo de referência para cada observação de treinamento | A presença de um operador humano durante a execução |
| Um sinal de erro calculável a cada tentativa | Um controle de qualidade das previsões em produção |
| Uma propriedade da fase de aprendizado | Uma propriedade do sistema implantado |
Um estudante prepara um exame a partir de uma coletânea de exercícios, cada um acompanhado de sua solução. Para cada exercício, ele propõe uma resposta, a compara ao gabarito, constata a diferença, ajusta seu método.
| Elemento da analogia | Elemento formal |
|---|---|
| O enunciado do exercício | O vetor x |
| A solução do gabarito | O rótulo y |
| A resposta proposta | A previsão ŷ |
| A diferença constatada | A perda L(y, ŷ) |
| O ajuste do método | A atualização dos parâmetros |
| O exame final sobre enunciados inéditos | A avaliação no conjunto de teste |
O gabarito não é um professor que vigia o estudante durante a prova: é uma informação de referência disponível durante a preparação e indisponível no dia do exame. É exatamente o status do rótulo. A analogia também carrega o fracasso característico: o estudante que memorizou os gabaritos sem adquirir o método obtém uma pontuação perfeita na coletânea e falha no exame. Esse caso é o sobreajuste.
Definição rigorosa
Um dado rotulado é um par (x, y) que associa um vetor de variáveis
explicativas x ∈ X ao valor y ∈ Y da variável-alvo para essa mesma
observação, tendo esse valor sido observado, medido ou atribuído por um
procedimento exterior ao modelo.
Tradução em linguagem corrente
Uma linha de tabela na qual figura, além das informações descritivas, a resposta que se deseja poder prever.
Condição de existência do aprendizado supervisionado
A ausência de rótulos exclui o supervisionado, sem exceção. As alternativas são então: constituir os rótulos (anotação, instrumentação, espera de um histórico), reformular o problema em não supervisionado (capítulo 003), ou renunciar.
Existe, nos dados disponíveis, uma coluna contendo exatamente o que se quer prever, preenchida para as observações passadas?
| Resposta | Consequência |
|---|---|
| Sim, preenchida e confiável | O problema é supervisionado. O restante do curso se aplica |
| Sim, mas parcialmente preenchida ou duvidosa | Problema supervisionado com reservas. A qualidade dos rótulos torna-se a primeira frente de trabalho |
| Não | O problema não é supervisionado em seu estado atual. É preciso criar o rótulo ou mudar de paradigma |
Ponto de atenção: "exatamente o que se quer prever" é uma exigência estrita. Prever a satisfação do cliente a partir de uma coluna "reabriu um ticket" equivale a prever a reabertura de ticket, não a satisfação.
Exemplo A — Detecção de e-mails indesejados
| Remetente conhecido | Nº de links | Maiúsculas (%) | Anexo | Indesejado |
|---|---|---|---|---|
| Sim | 1 | 4 | Não | Não |
| Não | 14 | 62 | Sim | Sim |
| Sim | 0 | 2 | Sim | Não |
| Não | 9 | 48 | Não | Sim |
As quatro primeiras colunas constituem x; a coluna em negrito é y, com
valores em {Sim, Não}: classificação binária. Rótulo proveniente da
ação do usuário, por denúncia manual.
Exemplo B — Manutenção preditiva em equipamento instrumentado
| Vibração (mm/s) | Temperatura (°C) | Horas desde a revisão | Ciclos/dia | Pane em 7 dias |
|---|---|---|---|---|
| 2,1 | 64 | 820 | 142 | Não |
| 5,8 | 81 | 2 340 | 168 | Sim |
| 3,4 | 71 | 1 510 | 151 | Não |
| 6,2 | 88 | 2 780 | 174 | Sim |
y binário: classificação. O rótulo é reconstruído a posteriori a
partir do registro de intervenções: para cada leitura, verifica-se se uma
falha ocorreu nos sete dias seguintes. Essa reconstrução é
o ponto técnico mais delicado do caso, desenvolvido na seção 7.
Exemplo C — Estimativa de preço imobiliário
| Área (m²) | Quartos | Ano de construção | Distância do centro (km) | Preço de venda ($) |
|---|---|---|---|---|
| 75 | 2 | 1994 | 6,2 | 272 500 |
| 100 | 3 | 2006 | 4,1 | 370 000 |
| 125 | 4 | 2011 | 3,4 | 467 500 |
| 150 | 5 | 2018 | 2,8 | 560 000 |
y numérico contínuo: regressão. O rótulo é um fato registrado, o
preço constante na escritura de venda.
Os três exemplos carregam rótulos de natureza radicalmente diferente: uma denúncia de usuário, uma reconstrução a partir de um registro, um montante contratual. Essas diferenças determinam a confiabilidade do modelo muito mais do que a escolha do algoritmo.
| Fonte | Descrição | Custo | Confiabilidade | Armadilha associada |
|---|---|---|---|---|
| Histórico natural | O evento ocorreu e foi registrado: venda concluída, contrato rescindido, sinistro declarado | Nulo a baixo | Elevada | A definição do evento no sistema pode diferir da definição de negócio; data de registro e data de ocorrência diferem |
| Ação do usuário | O usuário produz o sinal: clique, compra, denúncia, avaliação | Nulo | Média | Viés de seleção massivo: apenas uma minoria age. A ausência de sinal não vale como sinal negativo |
| Anotação humana | Operadores rotulam observações para o projeto | Elevado | Variável | Subjetividade, fadiga, deriva de critério. Exige uma medida de concordância entre anotadores |
| Especialista do domínio | Um especialista qualifica cada caso segundo seu julgamento profissional | Muito elevado | Elevada nos casos típicos | Baixa vazão, logo baixo volume. Desacordo entre especialistas nos casos-limite, que são os casos de interesse |
| Regra de negócio automática | Uma regra existente produziu o rótulo: limiar, motor de regras, sistema especialista | Nulo | Ilusória | O modelo aprende a regra, não o fenômeno. Seu desempenho atinge o teto do sistema que produziu os rótulos |
| Medida instrumental | Um sensor fornece o valor: sonda, medidor, analisador | Médio | Elevada | Deriva de calibração, panes que produzem valores padrão, dessincronização temporal |
Pergunta a instruir no início de todo projeto:
Como esse rótulo foi produzido, e essa produção é confiável?
Ela precede a escolha do algoritmo, a das variáveis e qualquer consideração de arquitetura. Ela é instruída junto às pessoas que operam o sistema de origem, não junto às que operam o banco de dados.
Situação
Uma organização dispõe há anos de um motor de regras que classifica automaticamente as solicitações recebidas. O histórico contém, portanto, para cada solicitação, a classe atribuída por esse motor: uma coluna imediatamente disponível, que parece constituir um rótulo ideal.
O que acontece
O modelo é treinado para reproduzir as decisões do motor. Ele consegue, frequentemente acima de 95 % de exatidão. Essa exatidão mede a fidelidade da imitação, não a correção das decisões. Todos os erros do motor são aprendidos como verdades: eles constituem, nos dados, a própria definição da resposta correta.
Um modelo supervisionado não pode ser melhor do que o procedimento que produziu seus rótulos. Ele pode ser mais rápido, mais regular, menos custoso, e generalizar para casos não cobertos pelas regras explícitas. Ele não pode ser mais correto.
Consequência prática
Um projeto assim permanece legítimo quando o objetivo é a redução do custo de execução, a cobertura de casos não tratados, ou a simplificação de um motor que se tornou ingovernável. Ele é ilegítimo quando o objetivo anunciado é a melhoria da qualidade das decisões: uma fonte de rótulos independente do sistema a substituir é então requerida, por auditoria de uma amostra ou por observação do resultado real das decisões.
Um algoritmo de aprendizado supervisionado não procede a nenhuma análise do domínio. Ele executa um ciclo em três tempos, repetido até a satisfação de um critério de parada.
As modalidades da correção variam: descida de gradiente para os modelos paramétricos e as redes neurais, particionamento recursivo por maximização de um ganho de informação para as árvores, resolução analítica fechada para os mínimos quadrados ordinários. A estrutura lógica do ciclo é idêntica.
Definição rigorosa
Um parâmetro é uma grandeza interna ao modelo cujo valor é determinado pelo algoritmo de aprendizado a partir dos dados, por minimização do risco empírico. O conjunto dos valores dos parâmetros constitui o estado do modelo e basta, com sua estrutura, para reproduzir suas previsões.
| Classe de modelos | Parâmetros |
|---|---|
| Regressão linear ou logística | Coeficientes das variáveis, intercepto |
| Árvore de decisão | Variáveis de corte, limiares, valores das folhas |
| Rede neural | Pesos das conexões, vieses dos neurônios |
Tradução em linguagem corrente
Os parâmetros são o que a máquina aprendeu: o conteúdo do arquivo salvo ao final do treinamento.
Definição rigorosa
Uma função de perda L : Y × Y → R+ associa a um par (valor observado,
valor previsto) uma medida escalar positiva da diferença, nula se e somente se
a previsão coincide com a observação, e crescente com a gravidade da
diferença. Ela deve ser calculável e, para os algoritmos baseados em
gradiente, derivável em relação aos parâmetros.
Status
Ela constitui a definição operacional de "prever bem". É uma escolha de engenharia, não um dado do problema: duas funções de perda diferentes aplicadas à mesma amostra produzem dois modelos diferentes.
Tradução em linguagem corrente
A regra de pontuação: o que conta como uma falta, e quanto essa falta custa.
Ponto de atenção
A perda usada para a otimização e a métrica usada para a avaliação de negócio são dois objetos distintos, que raramente coincidem (capítulos 029 e 052).
Definição rigorosa
Média aritmética das perdas individuais sobre a amostra:
R̂(h) = (1/n) · Σ L(yi, h(xi)). É a quantidade efetivamente minimizada pelo
algoritmo de aprendizado.
Distinção em relação ao risco esperado
O risco empírico é uma média sobre n observações disponíveis, o risco
esperado uma esperança sobre a distribuição geradora. O primeiro é calculável
e serve de objetivo de otimização; o segundo é o objetivo real e nunca é
diretamente acessível.
Ponto de atenção
Um risco empírico nulo não tem nenhum valor informativo: ele é sempre atingível por um modelo suficientemente expressivo, por simples memorização da amostra.
| Função de perda | Tipo de problema | Expressão | Propriedade |
|---|---|---|---|
| Erro quadrático | Regressão | (y − ŷ)² | Penaliza fortemente as grandes diferenças; sensível a valores aberrantes |
| Erro absoluto | Regressão | valor absoluto de y − ŷ | Penalização proporcional; robusto a valores aberrantes |
| Entropia cruzada binária | Classificação binária | −[y·log(p) + (1−y)·log(1−p)] | Opera sobre a probabilidade prevista p, não sobre a classe |
| Perda de dobradiça (hinge) | Classificação com margem | max(0, 1 − y·score) | Penaliza também os pontos corretos próximos demais da fronteira |
O erro quadrático ajusta a média condicional, o erro absoluto a mediana condicional. A escolha depende da questão de negócio: o custo de um erro grande é proporcional ao seu tamanho, ou mais que proporcional?
| Critério | Parâmetro | Hiperparâmetro |
|---|---|---|
| Quem fixa o valor | O algoritmo de aprendizado | O engenheiro, ou um procedimento de busca |
| Quando | Durante o treinamento | Antes do treinamento |
| Fonte do valor | Os dados de treinamento | Uma escolha metodológica validada |
| Exemplos | Coeficientes, limiares de uma árvore, pesos de uma rede | Profundidade máxima, taxa de aprendizado, coeficiente de regularização, número de árvores |
| Efeito de uma modificação | Muda as previsões do modelo ajustado | Muda o modelo que será ajustado |
Os hiperparâmetros definem H e o procedimento de otimização; os
parâmetros designam o ponto retido em H. Seu ajuste é tratado no
capítulo 009.
O ciclo não contém nenhuma etapa de compreensão, de interpretação ou de raciocínio causal. Ele contém uma forma funcional escolhida pelo engenheiro, uma medida de diferença escolhida pelo engenheiro, e um procedimento numérico que reduz essa medida.
Não há compreensão. Há uma minimização iterativa de uma quantidade escalar.
Não se trata de uma precaução retórica: um modelo explorará toda regularidade estatística presente nos dados, inclusive as que não têm nenhum sentido de negócio, as que resultam de artefatos de coleta, e as que não subsistirão em produção.
Um operador dispõe de um instrumento com dois botões giratórios e de um mostrador graduado que exibe uma diferença. Ele não percebe o som. Ele gira o primeiro botão, lê o mostrador, constata que a diferença diminuiu, continua na mesma direção. Quando a diferença para de diminuir, ele passa ao segundo botão. Após algumas dezenas de ajustes, o mostrador exibe uma diferença mínima.
O operador não ouviu nada, não tem nenhuma noção de música e não poderia explicar o que é uma quinta justa. Ele minimizou o valor de um mostrador.
Duas consequências se transpõem exatamente: se o mostrador está mal calibrado, o instrumento estará desafinado com uma diferença exibida nula — papel crítico da função de perda e dos rótulos; se o mostrador mede apenas uma corda em seis, as cinco outras permanecerão desafinadas — papel crítico da escolha da métrica.
Tarefa: estimar o preço de venda de um imóvel a partir de sua área.
X = área em m², Y = preço em dólares, n = 4.
| Casa | Área (m²) | Preço observado ($) |
|---|---|---|
| A | 75 | 272 500 |
| B | 100 | 370 000 |
| C | 125 | 467 500 |
| D | 150 | 560 000 |
O engenheiro postula uma relação afim preço = a × área + b. Essa escolha
define H: o conjunto das retas do plano. Os parâmetros a determinar são
a (preço por metro quadrado) e b (termo constante). A função de perda escolhida
é o erro absoluto, escolhido pela legibilidade dos cálculos; o risco
empírico é, portanto, o erro absoluto médio sobre as quatro casas.
| Casa | Área | Preço observado | Preço previsto | Erro absoluto |
|---|---|---|---|---|
| A | 75 | 272 500 | 75 000 | 197 500 |
| B | 100 | 370 000 | 100 000 | 270 000 |
| C | 125 | 467 500 | 125 000 | 342 500 |
| D | 150 | 560 000 | 150 000 | 410 000 |
| Erro médio | 305 000 |
Todas as previsões são inferiores aos preços observados e a diferença cresce com
a área: o coeficiente a é fraco demais. Direção de correção:
aumentar a.
| Casa | Área | Preço observado | Preço previsto | Erro absoluto |
|---|---|---|---|---|
| A | 75 | 272 500 | 150 000 | 122 500 |
| B | 100 | 370 000 | 200 000 | 170 000 |
| C | 125 | 467 500 | 250 000 | 217 500 |
| D | 150 | 560 000 | 300 000 | 260 000 |
| Erro médio | 192 500 |
O erro médio cai de 305 000 para 192 500: a correção ia na direção certa. O diagnóstico permanece inalterado, continua-se com um passo maior.
| Casa | Área | Preço observado | Preço previsto | Erro absoluto |
|---|---|---|---|---|
| A | 75 | 272 500 | 262 500 | 10 000 |
| B | 100 | 370 000 | 350 000 | 20 000 |
| C | 125 | 467 500 | 437 500 | 30 000 |
| D | 150 | 560 000 | 525 000 | 35 000 |
| Erro médio | 23 750 |
O diagnóstico muda de natureza: os erros são agora da mesma ordem de
grandeza e todos do mesmo sinal, as previsões permanecendo inferiores aos
preços observados em cerca de 25 000 $. Esse deslocamento constante não é corrigível por
a — fazê-lo crescer degradaria as grandes áreas. Ele pertence ao termo
constante b.
| Casa | Área | Preço observado | Preço previsto | Erro com sinal | Erro absoluto |
|---|---|---|---|---|---|
| A | 75 | 272 500 | 287 500 | −15 000 | 15 000 |
| B | 100 | 370 000 | 375 000 | −5 000 | 5 000 |
| C | 125 | 467 500 | 462 500 | +5 000 | 5 000 |
| D | 150 | 560 000 | 550 000 | +10 000 | 10 000 |
| Erro médio | 8 750 |
Os erros são agora de sinais opostos: duas previsões altas demais,
duas baixas demais. Nenhuma correção global de a ou de b pode mais reduzir
o conjunto simultaneamente. O processo atingiu um regime de compromisso, o que
constitui o critério de parada.
preço estimado = 3 500 × área + 25 000Esses dois números constituem a integralidade do que foi aprendido. Aplicado a um caso novo, um imóvel de 110 m² ausente da amostra:
preço estimado = 3 500 × 110 + 25 000 = 410 000 $O modelo produz um valor para uma observação jamais encontrada. Essa passagem do conhecido ao desconhecido é a generalização, tratada na seção 7.
Primeiro ensinamento — Nenhuma compreensão do domínio é mobilizada
O procedimento não mobilizou nenhum conhecimento do mercado imobiliário. Ele não consultou
nenhuma tabela, não conhece nem a noção de bairro, nem a de estado do imóvel, nem
a de taxa de juros. Ele produziu dois números que minimizam uma média
de diferenças. O fato de a = 3 500 ser interpretado como um preço por metro quadrado é
uma leitura efetuada pelo analista a posteriori, não um conhecimento
detido pelo modelo.
Segundo ensinamento — O mecanismo é tentativa, medida, ajuste
Quatro iterações foram apresentadas; um algoritmo real efetua milhares, com ajustes de pequena amplitude guiados pelo gradiente em vez da inspeção dos sinais de erro. A estrutura lógica é a da seção 3, sem acréscimo: propor, medir a diferença, corrigir na direção que reduz a diferença.
Terceiro ensinamento — A forma da regra é escolhida pelo engenheiro
A máquina não decidiu que o preço seria uma função afim da área. Essa hipótese foi colocada antes de qualquer cálculo e restringe definitivamente o resultado: se a relação real é em escada, atinge um teto além de certa área, ou depende de uma interação com o bairro, esse modelo jamais poderá representá-la, qualquer que seja o volume de dados fornecido. A escolha da classe de modelos é um ato de engenharia anterior e superior ao ajuste: é o erro de aproximação definido na seção 1.
Tarefa: prever se um prospect efetuará uma compra a partir de sua idade e de
seu salário anual. X = (idade, salário), Y = {Compra, Sem compra}, n = 6.
| Prospect | Idade | Salário anual ($) | Compra |
|---|---|---|---|
| P1 | 22 | 28 000 | Não |
| P2 | 25 | 32 000 | Não |
| P3 | 31 | 41 000 | Não |
| P4 | 38 | 58 000 | Sim |
| P5 | 45 | 72 000 | Sim |
| P6 | 52 | 85 000 | Sim |
A diferença formal em relação à seção 4 está na natureza de Y: um conjunto
finito não ordenado substitui um intervalo de reais. Essa única diferença muda
a função de perda, as métricas de avaliação e a interpretação geométrica
do modelo.
Definição rigorosa
Para um classificador f̂ : X → Y, a fronteira de decisão é o subconjunto de
X constituído pelos pontos nos quais a regra de decisão muda de classe
atribuída. No caso binário baseado em um score contínuo s(x) e um limiar t,
ela é o conjunto de nível { x ∈ X | s(x) = t }. Ela particiona X em
regiões de decisão, cada uma associada a uma classe.
Propriedade geométrica
Em um espaço com d variáveis, a fronteira é uma hipersuperfície de dimensão
d − 1: um ponto em uma reta, uma curva no plano, uma superfície em
dimensão três.
| Classe de modelos | Forma da fronteira |
|---|---|
| Regressão logística | Hiperplano: reta no plano |
| Árvore de decisão | Segmentos paralelos aos eixos, em escada |
| Máquina de vetores de suporte com kernel | Curva regular, forma dependente do kernel |
| Rede neural | Hipersuperfície arbitrariamente complexa |
Ponto de atenção
A fronteira é deslocável sem retreinamento: modificar o limiar t a
desloca ao longo das linhas de nível do score. Essa propriedade é explorada no
capítulo 062.
Sobre as seis observações, uma regra afim separa perfeitamente os dois grupos:
score bruto = salário + 1 000 × idade, fronteira em 90 000.
| Prospect | Score bruto | Posição | Classe prevista | Classe observada |
|---|---|---|---|---|
| P1 | 50 000 | Abaixo da fronteira | Não | Não |
| P2 | 57 000 | Abaixo da fronteira | Não | Não |
| P3 | 72 000 | Abaixo da fronteira | Não | Não |
| P4 | 96 000 | Acima | Sim | Sim |
| P5 | 117 000 | Acima | Sim | Sim |
| P6 | 137 000 | Acima | Sim | Sim |
Ponto de atenção: uma separação perfeita sobre seis observações não é um desempenho. Quando o número de observações é baixo diante do número de variáveis, a separabilidade perfeita é frequente e constitui até um sinal de alerta quanto ao sobreajuste (capítulo 031).
Um classificador não produz diretamente uma classe. Ele produz primeiro um score contínuo, geralmente transformado em estimativa de probabilidade condicional, depois aplica um limiar para decidir.
Definição rigorosa
Um classificador probabilístico estima a lei condicional P(Y | X = x). Para um
problema binário com Y = {0, 1}, ele produz p̂(x) ∈ [0, 1] estimando
P(Y = 1 | X = x). A regra de decisão associada a um limiar t é: ŷ = 1 se
p̂(x) ≥ t, ŷ = 0 senão.
| Ato | Natureza | Quem o determina | Modificável após o treinamento |
|---|---|---|---|
Estimativa de p̂(x) | Estatística | O modelo, por ajuste sobre D | Não, sem retreinamento |
Escolha do limiar t | Decisória | A organização, segundo o custo dos erros | Sim, imediatamente |
Ponto de atenção sobre a calibração
Um score elevado não equivale a probabilidade confiável. Um modelo está calibrado quando, entre as observações às quais ele atribui um score de 0,80, aproximadamente 80 % pertencem efetivamente à classe positiva. Os scores brutos de numerosos algoritmos não possuem essa propriedade e necessitam de uma recalibração (capítulo 029).
Tradução em linguagem corrente
O modelo produz um grau de confiança. A transformação desse grau em decisão é uma escolha de gestão, não uma escolha técnica. O valor 0,50 é um padrão de implementação, jamais uma justificativa.
Para o caso novo "35 anos, 60 000 $", o score bruto vale 95 000, ou seja, 5 000
acima da fronteira; transformado em probabilidade, dá
P(y = Compra | x) = 0,81, e o limiar padrão de 0,50 leva a prever
"Compra". Com um limiar elevado a 0,85, a mesma observação, o mesmo modelo e o
mesmo score levariam a prever "Sem compra". O modelo não mudou;
a decisão mudou. A escolha do limiar depende do custo respectivo dos dois tipos
de erro, tratado nos capítulos 052 e 062.
| Critério | Regressão (seção 4) | Classificação (seção 5) |
|---|---|---|
Natureza de Y | Intervalo de reais | Conjunto finito não ordenado |
| Saída bruta do modelo | Um valor numérico | Um score ou uma probabilidade por classe |
| Etapa de decisão adicional | Nenhuma | Aplicação de um limiar |
| Função de perda usual | Erro quadrático, erro absoluto | Entropia cruzada |
| Interpretação geométrica | Curva de ajuste | Fronteira de decisão |
| Métricas de avaliação | Erro médio, coeficiente de determinação | Exatidão, precisão, recall, área sob a curva |
| Treinamento | Avaliação | Produção | |
|---|---|---|---|
| Natureza dos dados | Conjunto de treinamento, histórico | Conjunto de teste, histórico posto de lado | Fluxo real, observações novas |
| Rótulo disponível | Sim, utilizado para o ajuste | Sim, apenas para a comparação | Não, no momento da previsão |
| Ação do sistema | Ajustar os parâmetros | Prever e medir a diferença | Prever |
| Chamada de código | model.fit(X_train, y_train) | model.predict(X_test) depois comparação com y_test | model.predict(x_nouveau) |
| O modelo é modificado | Sim | Não | Não |
| Analogia | A preparação com os gabaritos | O simulado sobre provas inéditas | O exercício profissional real |
| O que se obtém | Um modelo ajustado | Uma estimativa do risco esperado | Uma decisão operacional |
# Regime 1 — treinamento: o modelo vê x e y
model.fit(X_train, y_train)
# Regime 2 — avaliação: o modelo vê x, y serve unicamente à comparação
y_pred = model.predict(X_test)
score = metrique(y_test, y_pred)
# Regime 3 — produção: y ainda não existe
y_estime = model.predict(x_nouvelle_observation)A dificuldade profissional não reside na escrita dessas três linhas,
mas na constituição correta de X_train, X_test e de seus rótulos.
Ponto de atenção maior
Avaliar um modelo sobre os dados que serviram ao seu treinamento produz uma estimativa otimista, desprovida de valor informativo.
A justificativa formal foi dada na seção 1: f̂ foi selecionada
precisamente para minimizar R̂ sobre essas observações, de modo que R̂(f̂) é um
estimador enviesado de R(f̂). As modalidades de divisão e a validação cruzada
são tratadas no capítulo 026.
Definição rigorosa
D utilizado para o ajuste
dos parâmetros.Justificativa da distinção validação / teste
Toda escolha efetuada à vista de uma pontuação sobre um conjunto de dados otimiza implicitamente sobre esse conjunto. Um conjunto de validação consultado várias dezenas de vezes deixa de ser neutro: o processo de seleção introduziu nele um viés otimista, de natureza idêntica ao do conjunto de treinamento, embora de amplitude menor.
Regra operacional
O conjunto de teste só é aberto uma vez, e o resultado obtido é o que é reportado. Se ele for consultado e depois seguido de uma modificação do modelo, ele mudou de natureza e tornou-se um conjunto de validação.
Uma escola deseja estimar os resultados de seus estudantes no exame final.
Protocolo falho: o simulado retoma os exercícios da coletânea de treinamento. Os resultados são excelentes e não preveem nada; eles medem a memorização da coletânea.
Protocolo válido: o simulado versa sobre provas inéditas, de mesma natureza e de mesma dificuldade que as do exame final. Os resultados são mais baixos e constituem uma estimativa utilizável.
A diferença entre os dois protocolos não é a dificuldade das provas, mas o fato de elas terem sido, ou não, utilizadas durante a preparação. É a única questão que governa a validade de uma avaliação.
Definição rigorosa
A generalização designa a capacidade de um modelo ajustado de manter um nível de
desempenho dado sobre observações provenientes da mesma distribuição P(X, Y)
que as da amostra de treinamento, mas não observadas durante o
ajuste. Ela se quantifica pela lacuna de generalização
R(f̂) − R̂(f̂): uma lacuna pequena indica que o desempenho medido sobre a
amostra é representativo do desempenho esperado.
Condição de validade
A definição contém uma condição explícita: "provenientes da mesma distribuição". Quando a distribuição dos dados de produção difere da dos dados de treinamento, a garantia não se aplica mais. Esse fenômeno é a deriva, tratada no capítulo 082; a generalização não protege contra ela.
Tradução em linguagem corrente
Generalizar é funcionar em casos jamais encontrados, e não apenas nos que serviram ao aprendizado.
| Erro de treinamento | Erro de generalização | |
|---|---|---|
| Definição | Risco empírico sobre o conjunto de treinamento | Risco esperado sobre a distribuição geradora |
| Notação | R̂(f̂) sobre D_train | R(f̂) |
| Calculável | Sim, diretamente | Não, apenas estimável |
| Estimador prático | — | Erro medido no conjunto de teste |
| O que mede | A qualidade do ajuste aos dados vistos | A qualidade esperada em produção |
| Pode ser nulo | Sim, por um modelo suficientemente expressivo | Não, o erro irredutível o limita |
| Valor decisório | Nulo tomado isoladamente | Único valor decisório do projeto |
A lacuna entre os dois constitui o diagnóstico principal do praticante.
| Erro de treinamento | Erro de teste | Diagnóstico | Tratamento |
|---|---|---|---|
| Elevado | Elevado | Subajuste (underfitting): modelo restrito demais | Enriquecer as variáveis, aumentar a expressividade |
| Baixo | Elevado | Sobreajuste: o modelo memorizou | Regularizar, simplificar, aumentar o volume |
| Baixo | Baixo | Regime satisfatório | Verificar a ausência de vazamento (capítulo 028) |
| Elevado | Baixo | Situação anormal | Verificar o protocolo de divisão |
Um modelo de previsão de demanda é treinado com os dados de janeiro a junho. Ele atinge um erro médio de 3,1 % nesse período. Esse número não apresenta nenhum interesse decisório: ele descreve a capacidade do modelo de reajustar um período cujos valores ele já conhece.
A única pergunta que importa é: qual é o erro em julho?
Julho não foi observado durante o ajuste. O desempenho em julho é a única informação que esclarece o que o modelo produzirá em agosto e em qualquer período futuro. O que vale para uma separação temporal vale para uma separação aleatória, por site, por cliente ou por região. A pergunta é invariante: qual é o desempenho sobre o que não serviu ao ajuste?
Nenhuma dessas técnicas tem finalidade própria. A separação dos dados não existe para respeitar uma convenção; a regularização não existe para produzir modelos mais elegantes. Cada uma existe para tornar o erro de generalização estimável, ou para reduzi-lo.
Um praticante que não relaciona o conjunto de suas escolhas metodológicas à lacuna de generalização aplica receitas.
Um ator conhece integralmente o texto de sua peça. Ele o restitui sem falha, com as entonações acertadas no ensaio: nesse repertório, seu desempenho é perfeito.
Na noite da apresentação, um parceiro pula uma réplica. O ator que memorizou se interrompe: a sequência aprendida não corresponde mais à situação. O ator que compreendeu a situação dramática improvisa uma réplica coerente e prossegue. Os dois eram indistinguíveis no ensaio: obtinham a mesma pontuação no conjunto de treinamento.
| Ator | Sobre o texto conhecido | Sobre a situação imprevista | Modelo correspondente |
|---|---|---|---|
| Aquele que memorizou | Perfeito | Falho | Sobreajuste |
| Aquele que compreendeu | Bom | Bom | Generalização |
Ponto de transposição: a única maneira de distinguir os dois atores é colocá-los diante de uma situação não ensaiada. É exatamente a função do conjunto de teste. Sem essa prova, os dois perfis são indistinguíveis — e o perfil falho obtém até as melhores pontuações aparentes.
Contexto. Um industrial opera 300 máquinas instrumentadas distribuídas em quatro sites, transmitindo continuamente leituras de vibração, de temperatura, de consumo elétrico e de contadores de uso. O serviço de manutenção dispõe de um registro de intervenções cobrindo trinta meses. Uma parada não planejada custa cerca de 18 000 $ em produção perdida; uma intervenção preventiva planejada, cerca de 1 200 $.
| Condição | Verificação efetuada | Status |
|---|---|---|
| Um alvo observável existe no histórico | O registro permite datar cada falha | Satisfeita |
| O histórico é suficiente em volume e em eventos | 30 meses, 300 máquinas, 412 falhas não planejadas | Satisfeita |
| As variáveis estão disponíveis no momento da previsão | Leituras com carimbo de tempo, acessíveis em tempo real | Satisfeita |
| A previsão abre para uma decisão acionável | Uma intervenção preventiva pode ser planejada | Satisfeita |
| O custo do erro é aceitável | Falso positivo 1 200 $, falso negativo 18 000 $ | Satisfeita, com forte assimetria |
A formulação de negócio inicial — "antecipar as panes" — não é explorável em seu estado atual. Quatro formulações candidatas foram instruídas.
| Formulação candidata | Tipo de problema | Defeito eliminatório |
|---|---|---|
| "A máquina está atualmente em pane?" | Classificação sobre estado instantâneo | A variável é diretamente observável e a pane já ocorreu. Nenhuma antecipação, logo nenhuma decisão possível |
| "Qual é a vida útil residual?" | Regressão | Exige a data exata de falha futura para cada observação. As máquinas em serviço não têm data de fim: a amostra é censurada, o que invalida uma regressão ingênua |
| "A máquina cairá em pane algum dia?" | Classificação sem horizonte | Alvo degenerado: a resposta é positiva para todas as máquinas. Prevalência de 100 %, nenhuma informação a aprender |
| "A máquina cairá em pane nos próximos 7 dias?" | Classificação binária com horizonte fixado | Retida. Defeitos residuais conhecidos e gerenciáveis: forte desbalanceamento das classes, sensibilidade à escolha do horizonte |
Alvo retido: panne_7j = 1 se uma falha não planejada ocorre na
máquina nos 7 dias seguintes à data da leitura, 0 senão.
| Horizonte considerado | Consequência |
|---|---|
| 2 dias | Previsões mais exatas, mas inexploráveis: a peça não é entregue a tempo. Nenhum valor de negócio |
| 7 dias | Compatível com a cadeia logística de intervenção. Horizonte retido |
| 30 dias | Sinal precursor fraco demais nesse prazo: a prevalência aumenta, mas a separabilidade cai. Alertas numerosos demais e precoces demais |
Princípio: o horizonte de um alvo preditivo deduz-se do prazo de acionabilidade da decisão, jamais da comodidade estatística.
| Variável | Descrição | Justificativa de negócio |
|---|---|---|
vib_rms_24h | Vibração eficaz média em 24 horas | Indicador direto do desgaste dos rolamentos e do desbalanceamento |
vib_delta_7j | Desvio em relação à média dos 7 dias anteriores | A degradação se sinaliza por uma evolução, não por um nível absoluto próprio de cada máquina |
temp_max_24h | Temperatura máxima da carcaça em 24 horas | Um aquecimento anormal sinaliza uma fricção ou um defeito de lubrificação |
temp_ecart_consigne | Desvio em relação à temperatura nominal do modelo | Normaliza a temperatura entre máquinas de gerações diferentes |
heures_depuis_maintenance | Horas de funcionamento desde a última intervenção | O desgaste é função do tempo de serviço, não do tempo de calendário |
cycles_jour_moyen_7j | Número médio de ciclos diários em 7 dias | Mede a intensidade de solicitação |
conso_elec_ecart | Desvio de consumo em relação à linha de base da máquina | Um sobreconsumo a carga constante indica uma resistência mecânica aumentada |
nb_arrets_courts_30j | Número de microparadas em 30 dias | As microparadas precedem frequentemente as falhas maiores |
age_machine_mois | Idade da máquina | A taxa de falha depende da posição no ciclo de vida |
site | Site de operação | Captura as diferenças de ambiente: temperatura ambiente, qualidade do ar, práticas locais de manutenção |
Ponto de atenção: vib_delta_7j, temp_ecart_consigne e
conso_elec_ecart são variáveis construídas, não leituras brutas. Sua
construção deve ser reprodutível de forma idêntica em produção (capítulo 040).
Uma observação é um par (máquina, data), ou seja, cerca de 270 000 linhas. Taxa de eventos positivos: cerca de 1,1 %.
| machine_id | date | vib_rms_24h | vib_delta_7j | temp_max_24h | heures_depuis_maint. | nb_arrets_courts_30j | site | panne_7j |
|---|---|---|---|---|---|---|---|---|
| M-014 | 2024-03-11 | 2,1 | +0,1 | 64 | 820 | 0 | Nord | 0 |
| M-014 | 2024-03-12 | 2,2 | +0,2 | 65 | 828 | 0 | Nord | 0 |
| M-087 | 2024-05-02 | 5,8 | +2,4 | 81 | 2 340 | 4 | Sud | 1 |
| M-087 | 2024-05-03 | 6,1 | +2,7 | 84 | 2 348 | 5 | Sud | 1 |
| M-201 | 2024-07-19 | 3,4 | +0,3 | 71 | 1 510 | 1 | Est | 0 |
| M-233 | 2024-09-08 | 6,2 | +3,1 | 88 | 2 780 | 7 | Nord | 1 |
Uma árvore de decisão de baixa profundidade ajustada sobre esses dados produz a estrutura a seguir; as probabilidades são as da classe positiva em cada folha.
Leitura: a variável mais discriminante não é o nível de vibração, mas sua variação recente, resultado coerente com a expertise de negócio — cada máquina possui sua assinatura vibratória própria, e é o desvio em relação a essa assinatura que carrega a informação. Essa coerência não constitui uma validação, mas sua ausência teria constituído um sinal de alerta sobre a construção dos dados.
| Armadilha | Manifestação neste caso | Consequência se não tratada | Capítulo |
|---|---|---|---|
| Desbalanceamento das classes | 1,1 % de observações positivas | Um modelo que prevê sempre "sem pane" atinge 98,9 % de exatidão e não detecta nada. A exatidão é inutilizável como métrica | 050 |
| Custo assimétrico dos erros | Falso negativo 18 000 $, falso positivo 1 200 $, razão de 15 para 1 | Um limiar em 0,50 minimiza o número de erros, não seu custo. O limiar deve ser reduzido até o ponto de equilíbrio econômico | 052 e 075 |
| Vazamento de dados | As colunas date_intervention, code_panne e duree_arret só são preenchidas após a falha | Desempenho quase perfeito em validação, colapso em produção. Modo de falha mais frequente nesse tipo de projeto | 028 |
| Sobreajuste | 270 000 linhas, mas 412 eventos reais, e fortes correlações entre leituras sucessivas de uma mesma máquina | O modelo memoriza as assinaturas das máquinas que sofreram uma pane em vez de aprender o mecanismo de degradação | 031 |
| Deriva | Renovação do parque, mudança de fornecedor de peças, modificação das cadências | O desempenho se degrada progressivamente sem alerta, os sensores continuando a emitir valores plausíveis | 082 |
O que acontece
Extrair aleatoriamente 20 % das 270 000 linhas para constituir o conjunto de teste coloca as leituras da máquina M-087 de 2 de maio em treinamento e as de 3 de maio em teste, quando elas são quase idênticas. O modelo é avaliado sobre observações das quais viu quase-réplicas durante o ajuste: o erro de teste torna-se um estimador otimista do erro de generalização, a condição "não observadas" não sendo satisfeita na prática, embora o seja formalmente no nível da linha.
Protocolo correto
A divisão deve reproduzir a situação de produção: o modelo será aplicado a datas posteriores às de seu treinamento, e às vezes a máquinas recém-instaladas.
| Divisão | Pergunta à qual responde |
|---|---|
| Temporal: treinamento em 24 meses, teste nos 6 últimos | O modelo funciona no período futuro? |
| Por máquina: treinamento em 240 máquinas, teste em 60 reservadas | O modelo funciona em uma máquina jamais observada? |
As duas estimativas são úteis e respondem a perguntas distintas (capítulo 026).
O exemplo da seção 4 produziu a = 3 500. É tentador concluir que o
modelo "sabe" que o metro quadrado vale 3 500 $. O modelo não detém nenhuma
noção de metro quadrado, de preço nem de imóvel: ele detém dois números que
minimizam uma média de diferenças sobre quatro observações.
Consequência operacional: uma área de 900 m² produzirá uma estimativa de 3 175 000 $ sem que nenhum mecanismo alerte sobre o absurdo da extrapolação.
Formulação correta: "O modelo ajustou dois parâmetros que minimizam a diferença média em relação aos preços observados na amostra fornecida."
A supervisão qualifica a disponibilidade de rótulos de referência durante o treinamento. Ela não descreve o regime de funcionamento do sistema implantado, que pode ser inteiramente automático. Essa confusão leva a supor um controle humano que não existe, e a não prever as salvaguardas necessárias.
Formulação correta: "O aprendizado é dito supervisionado porque cada observação de treinamento estava acompanhada do valor-alvo a reproduzir. A presença de um operador em produção é uma decisão distinta."
O rótulo é apresentado como a verdade de referência. Ele é, na realidade, o produto de um procedimento — registro, declaração, julgamento, regra — que possui seus vieses, seus pontos cegos e sua taxa de erro própria.
Caso característico: treinar um modelo sobre as fraudes detectadas equivale a aprender a detectar o que o dispositivo atual já detecta; as fraudes que lhe escapam estão rotuladas "não fraudulentas" nos dados.
Formulação correta: "O desempenho do modelo é limitado pela qualidade do procedimento que produziu os rótulos. A primeira etapa do projeto é a instrução desse procedimento."
"Prever as panes", "prever o cancelamento", "prever a fraude" não são alvos, mas intenções. Um alvo explorável contém três elementos: um evento definido sem ambiguidade, um horizonte temporal, e uma data de observação a partir da qual esse horizonte corre. Sem eles, a coluna-alvo não pode ser construída, e duas pessoas trabalhando no mesmo projeto construirão duas versões diferentes.
Formulação correta: "panne_7j vale 1 quando uma falha não
planejada ocorre nos 7 dias seguintes à data da leitura, 0 senão."
A pontuação obtida sobre os dados que serviram ao ajuste é um estimador otimistamente enviesado do risco esperado: o modelo foi selecionado para minimizar precisamente essa quantidade. Uma árvore de decisão não restrita atinge 100 % de exatidão em seus dados de treinamento, quaisquer que sejam os dados; esse número mede apenas sua capacidade de memorização.
Formulação correta: "O erro reportado é o medido em um conjunto de teste constituído de observações que não participaram nem do ajuste dos parâmetros nem da seleção dos hiperparâmetros."
Os parâmetros são determinados pelo algoritmo a partir dos dados; os hiperparâmetros são fixados antes do treinamento e definem o espaço das hipóteses assim como o procedimento de otimização.
Consequência operacional: os hiperparâmetros não podem ser ajustados sobre o conjunto de treinamento, já que governam a capacidade do modelo de se ajustar a ele; tal ajuste leva sistematicamente ao modelo mais expressivo possível, logo ao sobreajuste (capítulo 009).
Formulação correta: "Os hiperparâmetros são selecionados por validação sobre dados distintos dos que servem ao ajuste dos parâmetros."
Uma variável presente no histórico não está necessariamente disponível no momento em que a previsão deverá ser produzida: o registro de manutenção contém a duração de parada, conhecida somente após a pane.
Teste a aplicar sistematicamente: para cada variável candidata, perguntar-se se seu valor será conhecido no instante exato em que o modelo deverá prever em produção. Toda resposta negativa desqualifica a variável. O sintoma é um desempenho anormalmente elevado em validação seguido de um colapso em produção: é o vazamento de dados, tratado no capítulo 028.
Formulação correta: "O conjunto das variáveis retidas está disponível no instante da previsão, o que foi verificado variável por variável junto aos operadores do sistema de origem."
A definição da generalização contém a condição "provenientes da mesma distribuição". Essa condição é verificável no momento da avaliação; ela não é garantida depois. Um modelo validado a 92 % de exatidão pode funcionar a 71 % dezoito meses depois sem que nenhum erro técnico tenha ocorrido e sem que nenhum alerta se dispare.
Formulação correta: "O desempenho medido vale para a distribuição observada no período de avaliação. Um dispositivo de monitoramento da deriva e um procedimento de retreinamento estão previstos (capítulo 082)."
FORMALIZAÇÃO
Dados : D = {(xi, yi)}, i = 1..n, extraídos de P(X, Y) desconhecida e fixa
Hipótese : existe f : X → Y, eventualmente ruidosa
Objetivo : minimizar o risco esperado R(h) = E[L(y, h(x))]
Realidade : minimiza-se o risco empírico R^(h) = (1/n) Σ L(yi, h(xi))
Princípio : minimização do risco empírico (ERM)
O TERMO "SUPERVISIONADO"
Designa a disponibilidade de um rótulo de referência no treinamento.
Não designa nenhuma vigilância humana em execução.
OS RÓTULOS
Seis fontes : histórico natural, ação do usuário, anotação humana,
especialista do domínio, regra de negócio automática, medida instrumental.
Pergunta obrigatória : como o rótulo foi produzido?
Rótulos provenientes de um sistema de regras : o desempenho atinge aí seu teto.
A MECÂNICA
Tentativa -> Medida do erro -> Correção -> Tentativa ...
Parâmetro : ajustado pelo algoritmo, a partir dos dados
Hiperparâmetro : fixado pelo engenheiro, antes do treinamento
Não há compreensão. Há uma minimização iterativa.
OS DOIS TIPOS DE PROBLEMAS
Regressão : Y contínuo -> um valor
Classificação : Y finito -> um score, depois um limiar, depois uma classe
A fronteira de decisão se desloca mudando o limiar,
sem retreinar o modelo.
OS TRÊS REGIMES
Treinamento : y conhecido e utilizado model.fit(X_train, y_train)
Avaliação : y conhecido, oculto model.predict(X_test) depois comparação
Produção : y desconhecido model.predict(x_nouveau)
O OBJETIVO ÚNICO
Lacuna de generalização = risco esperado − risco empírico
Erro de treinamento : sem valor decisório
Erro de teste : única estimativa utilizável
Separação dos dados, validação cruzada, regularização, detecção
do sobreajuste : nenhuma tem finalidade própria.
Todas servem à generalização.Enunciado de síntese
O aprendizado supervisionado consiste em ajustar uma função parametrizada sobre uma amostra de observações rotuladas, minimizando um risco empírico que não é mais que um substituto calculável do risco realmente visado; o valor do modelo nunca se mede sobre as observações que serviram para ajustá-lo, mas sobre aquelas que ele não viu.
Quizzes associados:
004.1-quiz-formalisation.md,
004.2-quiz-donnees-etiquetees.md,
004.3-quiz-mecanique-ajustement.md,
004.4-quiz-regression-chiffree.md,
004.5-quiz-classification-frontiere.md,
004.6-quiz-trois-regimes.md,
004.7-quiz-generalisation.md
Próximo capítulo: 005-dataset-observation.md