Os três paradigmas de aprendizado

35 min
Bloco 0 — Situar o aprendizado supervisionado
Objetivo
saber determinar, diante de um problema qualquer, o paradigma de aprendizado ao qual ele pertence; conhecer a definição rigorosa dos três paradigmas e de suas subfamílias; saber justificar essa classificação por um critério único e defensável.
Duração estimada
35 minutos
Pré-requisitos
capítulos 001 e 002
Quizzes associados
003.1-quiz-critere-classement.md a 003.6-quiz-qualification-probleme.md

1. O critério de classificação: a natureza do sinal de aprendizado

O capítulo 002 estabeleceu a inversão própria do Machine Learning: as regras não são mais escritas, elas são induzidas a partir de observações. Essa indução supõe que um sinal oriente o aprendizado, isto é, que uma informação indique ao algoritmo em que direção corrigir seus parâmetros.

A natureza desse sinal constitui o único critério de classificação dos paradigmas. Ela é determinada por uma pergunta única:

"Dispomos, para as observações passadas, do valor que buscamos prever?"

1.1 As três respostas possíveis

Resposta à perguntaSinal disponívelParadigmaFormulação do problema
Sim — cada observação histórica carrega o valor-alvoUm valor-alvo conhecido, observação por observaçãoAprendizado supervisionadoReproduzir em casos inéditos a associação entrada-saída observada
Não — nenhum valor-alvo está disponívelNenhum sinal externo; apenas a estrutura interna dos dados é explorávelAprendizado não supervisionadoEvidenciar uma organização latente das observações
Não, mas — existe uma avaliação diferida das açõesUm escalar de recompensa emitido pelo ambiente após cada açãoAprendizado por reforçoDeterminar uma estratégia de ação que maximize a recompensa acumulada

Essas três respostas são exaustivas e mutuamente exclusivas para um problema corretamente formulado. Um problema que parece pertencer a dois paradigmas é um problema cuja formulação não foi fechada: a questão a decidir é então "qual é a variável-alvo", não "qual é o paradigma".

DEFINIÇÃO — Sinal de aprendizado e paradigma de aprendizado

Sinal de aprendizado — definição rigorosa

Informação explorada por um algoritmo para avaliar a qualidade da hipótese corrente e dela derivar uma direção de correção de seus parâmetros. Ele assume a forma de um valor-alvo associado a cada observação, de um critério interno de coerência definido apenas sobre os dados, ou de um escalar de recompensa emitido por um ambiente em resposta a uma ação.

Paradigma de aprendizado — definição rigorosa

Classe de problemas definida pela natureza do sinal disponível e, por consequência, pela forma do problema de otimização colocado: minimização de um risco empírico sobre pares rotulados, otimização de um critério interno de estrutura, ou maximização de uma esperança de recompensa acumulada.

Tradução em linguagem corrente

O sinal é o que permite ao algoritmo saber se está errando; o paradigma é a família de problemas definida por aquilo de que dispomos para aprender.

Ponto de atenção

Na ausência de qualquer sinal, não há aprendizado no sentido de Mitchell (1997): sem medida de desempenho P, nenhuma experiência E pode melhorar coisa alguma.

1.2 Taxonomia completa

Os ramos destacados delimitam o perímetro deste curso. Os demais são definidos aqui para permitir o posicionamento, sem serem aprofundados.

1.3 O que não constitui um critério de classificação

A confusão mais custosa, tanto no enquadramento de um projeto quanto em entrevista, consiste em classificar um problema segundo um critério que não é um critério.

Critério invocado erroneamenteContraexemplo imediato
O domínio de aplicaçãoA saúde dá origem a supervisionado (diagnóstico sobre casos rotulados), não supervisionado (tipologia de pacientes) e reforço (dosagem adaptativa)
O tipo de dadosUma imagem alimenta uma classificação supervisionada tanto quanto um agrupamento não supervisionado de fotografias
A arquitetura do modeloUma rede profunda pode ser supervisionada, não supervisionada (autoencoder) ou de reforço
A finalidade de negócio"Entender nossos clientes" traduz-se indiferentemente por uma segmentação ou por uma previsão de cancelamento

Princípio diretor: o paradigma é lido nos dados disponíveis, não no assunto tratado, nem na ferramenta escolhida, nem na ambição do solicitante.


2. O aprendizado supervisionado

2.1 Definição

DEFINIÇÃO — Aprendizado supervisionado (supervised learning)

Definição rigorosa

Seja um espaço de entrada X e um espaço de saída Y. Dispomos de uma amostra de treinamento de n pares

S = { (x_1, y_1), ..., (x_n, y_n) },  x_i ∈ X,  y_i ∈ Y

supostamente provenientes de um sorteio independente e identicamente distribuído segundo uma lei conjunta P(X, Y) desconhecida e fixa. O aprendizado supervisionado consiste em selecionar, em uma classe de hipóteses H, uma função f: X → Y que minimize o risco esperado R(f) = E[ L(f(X), Y) ], onde L é uma função de perda que mede a diferença entre valor previsto e valor observado. Como a lei P é desconhecida, o algoritmo minimiza na prática o risco empírico calculado sobre S, sob restrição de regularização.

Tradução em linguagem corrente

Fornecem-se exemplos cuja resposta correta é conhecida, e pede-se ao algoritmo que construa a função que melhor reproduz essa correspondência, a fim de aplicá-la a casos cuja resposta é desconhecida.

O termo "supervisionado"

Ele remete à presença de um supervisor — operador, processo ou observação posterior — que forneceu o valor correto para cada exemplo, durante a constituição do conjunto de dados e nunca durante o treinamento.

Ponto de atenção

A hipótese de distribuição fixa é estruturante. Quando P(X, Y) evolui entre o treinamento e a operação, o risco empírico deixa de estimar o risco esperado e o desempenho se degrada: fenômeno tratado no capítulo 082.

DEFINIÇÃO — Dado rotulado (labeled data)

Definição rigorosa

Observação para a qual o valor da variável-alvo está preenchido, além das variáveis explicativas, sendo esse valor definido de maneira unívoca e homogênea em todo o conjunto de dados.

Tradução em linguagem corrente

Uma linha da tabela para a qual a resposta já é conhecida.

Proveniência dos rótulos

Observação diferida (o crédito foi reembolsado ou não), anotação humana (um radiologista qualifica uma imagem), registro de sistema (o cliente cancelou) ou medida física (a peça rompeu às 412 horas).

Ponto de atenção

O custo de obtenção dos rótulos é frequentemente o fator limitante de um projeto supervisionado: as variáveis explicativas são abundantes, os rótulos raramente.

2.2 O esquema do aprendizado supervisionado

O rótulo está presente no treinamento e ausente na operação. Um dispositivo em que ele estivesse disponível no momento da previsão não teria nenhuma utilidade preditiva.

2.3 As duas subfamílias

O tipo da variável-alvo determina a subfamília.

ClassificaçãoRegressão
Natureza do alvoCategórica: conjunto finito de modalidadesNumérica contínua
Pergunta feita"A qual classe esta observação pertence?""Qual valor esta grandeza assume?"
Saída do modeloUma classe, geralmente acompanhada de uma probabilidadeUm número real
Exemplo de alvoInadimplência: sim / nãoPreço de venda: 412 500 $
Métricas usuaisExatidão (accuracy), precisão, recall, F1, AUCRMSE, MAE, MAPE, R²
Algoritmos representativosRegressão logística, árvores, florestas aleatórias, gradient boosting, SVMRegressão linear, regressão regularizada, árvores de regressão, gradient boosting
Noção de erroDiscreta: a classe está correta ou nãoContínua: o erro possui uma amplitude
DEFINIÇÃO — Classificação

Definição rigorosa

Problema de aprendizado supervisionado no qual o espaço de saída Y é um conjunto finito de modalidades { c1c_1, ..., ckc_k }. O modelo estima geralmente a probabilidade condicional P(Y = cjc_j | X = x), a classe prevista resultando da aplicação de uma regra de decisão a esse vetor de probabilidades.

Tradução em linguagem corrente

Colocar cada observação em uma das categorias previstas de antemão.

Subtipos: binária (2 modalidades exclusivas), multiclasse (k modalidades exclusivas), multirrótulo (k modalidades cumuláveis), ordinal (k modalidades ordenadas, por exemplo uma classificação de risco de A a E).

Ponto de atenção

As modalidades são definidas antes do treinamento e fazem parte da especificação do problema. Um modelo de classificação não pode produzir uma classe que nunca encontrou.

DEFINIÇÃO — Regressão, e advertência terminológica

Definição rigorosa

Problema de aprendizado supervisionado no qual o espaço de saída Y é um subconjunto dos reais. O modelo estima uma função de regressão, na maioria das vezes a esperança condicional E[Y | X = x], por minimização de uma perda quadrática ou absoluta.

Tradução em linguagem corrente

Estimar um número em vez de uma categoria.

Advertência terminológica

A palavra "regressão" não carrega, em seu uso moderno, nenhum sentido de recuo ou de retorno ao passado. Ela é herdada dos trabalhos de Francis Galton (1886) sobre a transmissão da altura entre gerações, que descreviam uma regressão à média: os filhos de pais muito altos tendiam a ser, em média, menos altos que seus pais. O termo designava um fenômeno estatístico particular; foi em seguida estendido ao método de ajuste empregado para evidenciá-lo, e depois a toda previsão de uma grandeza numérica. Nenhuma inferência deve, portanto, ser tirada da própria palavra: "regressão" significa unicamente que o alvo é um número.

Confusão a não cometer

A regressão logística é um algoritmo de classificação, apesar de seu nome: ela regride o logaritmo da razão de chances sobre as variáveis explicativas e produz uma probabilidade de pertencimento a uma classe.

2.4 Quinze casos de uso empresariais

#DomínioProblema de negócioTipoVariável-alvo
1BancoConcessão de crédito ao consumidorClassificação bináriaInadimplência em 12 meses: sim / não
2BancoDetecção de fraude em transação de cartãoClassificação binária desbalanceadaTransação fraudulenta: sim / não
3BancoEstimativa da perda em caso de inadimplênciaRegressãoMontante não recuperado, em dólares
4SaúdeApoio ao diagnóstico por imagemClassificação multiclassePatologia identificada entre k categorias
5SaúdeAntecipação das reinternaçõesClassificação bináriaReinternação em 30 dias: sim / não
6ImobiliárioAvaliação do valor de um imóvelRegressãoPreço de venda efetivo, em dólares
7Recursos humanosPrevenção da saída voluntáriaClassificação bináriaDemissão em 6 meses: sim / não
8Recursos humanosEstimativa da duração do recrutamentoRegressãoDias entre publicação e assinatura
9Indústria / IoTManutenção preditivaClassificação bináriaPane em 7 dias: sim / não
10Indústria / IoTVida útil residual de um equipamentoRegressãoHoras de funcionamento antes da falha
11MarketingPrevisão de cancelamento (churn)Classificação bináriaRescisão em 90 dias: sim / não
12MarketingValor do tempo de vida do clienteRegressãoMargem acumulada esperada em 24 meses, em dólares
13TransporteEstimativa de duração de trajetoRegressãoDuração efetiva, em minutos
14CibersegurançaFiltragem de e-mails de phishingClassificação bináriaE-mail malicioso: sim / não
15EnergiaPrevisão de carga da redeRegressãoConsumo em H+24, em megawatts

Leitura da tabela: nos quinze casos, um dado histórico carrega a resposta. O crédito foi reembolsado ou não, o imóvel foi vendido a um preço constatado, a peça rompeu em uma hora medida. É essa disponibilidade retrospectiva do alvo que torna o problema supervisionado, não a intenção de prever. A qualificação técnica do caso 7 não prejulga, além disso, sua licitude: as obrigações de não discriminação são tratadas no capítulo 095.

2.5 A analogia do aprendizado com gabarito

ANALOGIA — O aprendizado com gabarito

Um aluno prepara um exame a partir de provas anteriores. Cada prova contém um enunciado e um gabarito. O aluno resolve o enunciado, compara sua produção ao gabarito, identifica a diferença, ajusta seu método. Após um número suficiente de exercícios, ele enfrenta uma prova inédita cujo gabarito ainda não existe.

Situação pedagógicaAprendizado supervisionadoNotação
O enunciado do exercícioAs variáveis explicativas de uma observaçãoxix_i
O gabarito do exercícioO rótulo, valor-alvo conhecidoyiy_i
A coletânea de provas anterioresO conjunto de treinamentoS
O método de resolução do alunoA função aprendidaf
A diferença entre produção e gabaritoA perda em uma observaçãoL(f(xix_i), yiy_i)
A revisão do métodoA atualização dos parâmetrosotimização
O simuladoO conjunto de validação
O exame final, prova inéditaO conjunto de teste, depois a produção
A nota obtida no exame finalO desempenho em generalizaçãoR(f)

Prolongamentos

O aluno que memoriza os gabaritos sem adquirir o método acerta as provas anteriores e falha na prova inédita: é o sobreajuste (overfitting), tratado no capítulo 040. O aluno que dispõe do gabarito durante o exame obtém uma nota excelente que não mede nada: é o vazamento de dados (data leakage), tratado no capítulo 028.

Limite da analogia

O aluno compreende o que faz e transpõe para um domínio vizinho. O modelo estabelece apenas uma correspondência estatística e não transpõe para fora do domínio coberto por seus dados de treinamento.


3. O aprendizado não supervisionado

3.1 Definição

DEFINIÇÃO — Aprendizado não supervisionado (unsupervised learning)

Definição rigorosa

Classe de problemas nos quais dispomos de uma amostra { x1x_1, ..., xnx_n }, xix_i ∈ X, sem variável-alvo associada. O objetivo é estimar uma estrutura da distribuição P(X): partição do espaço das observações, subvariedade de baixa dimensão que aproxima a nuvem de pontos, densidade, ou regularidades de coocorrência. A otimização recai sobre um critério definido exclusivamente a partir dos dados, sem referência a um valor esperado.

Tradução em linguagem corrente

Fornecem-se observações sem nenhuma resposta associada e pede-se ao algoritmo que faça aparecer a organização interna desses dados.

O termo "não supervisionado"

Ele indica a ausência de resposta de referência, não a ausência de intervenção humana: escolha das variáveis, da distância, do número de grupos e da normalização pertencem inteiramente ao analista.

Ponto de atenção

Um algoritmo não supervisionado sempre produz um resultado, inclusive quando os dados não contêm nenhuma estrutura: um particionamento em quatro grupos devolverá quatro grupos sobre uma nuvem perfeitamente uniforme. A produção de um resultado, portanto, nunca atesta a existência de uma estrutura.

3.2 As duas grandes famílias

DEFINIÇÃO — Clustering (particionamento, segmentação)

Definição rigorosa

Problema que consiste em construir uma partição ou um recobrimento de um conjunto de observações em grupos tais que uma medida de similaridade intragrupo seja máxima e a similaridade intergrupos mínima, no sentido de uma distância especificada pelo analista. Um método de particionamento por inércia minimiza assim a soma dos quadrados dos desvios internos:

argmin  Σ      Σ      || x - μ_j ||²
   C   j=1..k  x ∈ C_j

onde μj\mu_j designa o centro do grupo CjC_j.

Tradução em linguagem corrente

Agrupar as observações que se parecem, sem saber de antemão quais grupos existem nem quantos são.

Parâmetros a cargo do analista

Número de grupos, medida de distância, normalização, seleção das variáveis. Cada uma dessas escolhas modifica o resultado; não existe uma partição "verdadeira" que um algoritmo descobriria independentemente delas.

Ponto de atenção

Os grupos produzidos não têm nome. Sua denominação e sua interpretação são um ato de negócio posterior ao algoritmo, jamais uma saída dele.

DEFINIÇÃO — Redução de dimensionalidade (dimensionality reduction)

Definição rigorosa

Problema que consiste em construir uma aplicação g: X → Z, com dim(Z) < dim(X), preservando o melhor possível uma propriedade da distribuição de origem: variância explicada para a análise de componentes principais, estrutura de vizinhança local para os métodos de imersão não linear, capacidade de reconstrução para os autoencoders. O critério otimizado é interno aos dados.

Tradução em linguagem corrente

Representar as mesmas observações com menos variáveis, perdendo o mínimo de informação possível.

Finalidades operacionais: visualização, compressão, remoção de ruído, pré-processamento de um modelo supervisionado, atenuação da maldição da dimensionalidade.

Ponto de atenção

Empregada antes de um modelo supervisionado, a redução de dimensionalidade deve ser ajustada apenas com os dados de treinamento e depois aplicada tal como está aos dados de validação e de teste. Ajustá-la sobre o conjunto de todos os dados constitui um vazamento de dados, tratado no capítulo 028.

3.3 Exemplo com números: segmentação de uma base de clientes

Uma rede varejista dispõe de 12 000 clientes ativos. Nenhuma variável-alvo existe: a diretoria não pede para prever um comportamento, mas para compreender a estrutura de sua base. Quatro variáveis são retidas — frequência de compra anual, tíquete médio, tempo de relacionamento, parcela das compras on-line — e um particionamento em quatro grupos é aplicado após normalização.

Saída bruta do algoritmo

GrupoEfetivoParcelaFrequência anualTíquete médioTempo de relacionamentoParcela on-line
Grupo 14 32036 %1,2 compra38 $8 meses22 %
Grupo 23 60030 %11,4 compras42 $5,2 anos15 %
Grupo 32 88024 %4,1 compras187 $3,4 anos71 %
Grupo 41 20010 %0,4 compra25 $6,1 anos5 %

Os identificadores numéricos são desprovidos de sentido: "Grupo 1" não significa nada e não é ordenado em relação a "Grupo 2".

Interpretação de negócio, posterior ao algoritmo

GrupoDenominação adotada pelo negócioLeituraAção considerada
Grupo 1Novos clientes ocasionaisTempo de relacionamento baixo, engajamento baixoJornada de ativação nos 6 primeiros meses
Grupo 2Frequentadores de proximidadeFrequência elevada, tíquete baixo, canal físicoPrograma de fidelidade, aumento do tíquete
Grupo 3Compradores de alto tíquete on-lineTíquete quatro vezes superior, canal digitalOferta premium, serviço de entrega dedicado
Grupo 4Clientes dormentesTempo de relacionamento elevado, atividade quase nulaCampanha de reativação ou saída do cadastro ativo

Ponto determinante: a segunda coluna não foi produzida pelo algoritmo. Ela foi formulada por responsáveis de negócio examinando as características estatísticas de cada grupo. Um algoritmo de clustering delimita grupos; ele não os nomeia nem os explica.

3.4 A ausência de verdade de referência

É a diferença estrutural mais importante em relação ao aprendizado supervisionado. Cada previsão supervisionada pode ser confrontada com o valor observado: a exatidão é mensurável. Em não supervisionado, não existe nenhuma partição de referência, e a pergunta "esta segmentação está exata?" é mal colocada. A avaliação repousa então sobre duas ordens de critérios.

Ordem de critérioNaturezaExemplosLimite
Critérios internosEstatística, calculado apenas sobre os dadosCoeficiente de silhueta, inércia intraclasse, índices de Davies-Bouldin e de Calinski-HarabaszUma pontuação elevada não atesta a pertinência de negócio
Critérios de utilidade de negócioOperacional, avaliado pelos responsáveis do domínioGrupos interpretáveis, acionáveis, de tamanho explorável, estáveis no tempoSubjetividade, dependência da expertise disponível

Ponto de atenção: uma segmentação com coeficiente de silhueta excelente mas cujos grupos não exigem nenhuma ação é um fracasso operacional; uma partição com pontuação interna medíocre cujos grupos exigem ações diferenciadas e mensuráveis é um sucesso. O critério final é a utilidade.

Consequência sobre a condução do projeto: um projeto não supervisionado não pode ser pilotado por um limiar contratual do tipo "pelo menos 90 % de exatidão", mas por uma revisão de interpretabilidade que associe o negócio.

3.5 Aplicações reais

DomínioAplicaçãoSubfamíliaSaída explorada
VarejoSegmentação da base de clientesClusteringGrupos homogêneos para direcionamento diferenciado
ComércioAnálise da cesta de comprasRegras de associaçãoProdutos frequentemente comprados juntos
SegurosTipologia de perfis de sinistralidadeClusteringGrupos que servem de base a uma precificação
BioinformáticaAgrupamento de perfis de expressão gênicaClusteringSubtipos moleculares candidatos
IndústriaCompressão de sinais de sensoresRedução de dimensionalidadeRepresentação compacta para monitoramento
DocumentaçãoAgrupamento temático de corpusClusteringFamílias de documentos sem nomenclatura prévia
CibersegurançaDetecção de comportamentos atípicosDetecção de anomaliasAlertas a qualificar por um analista
MarketingRedução de um questionário a seus eixos principaisRedução de dimensionalidadeFatores sintéticos de atitude

Observação profissional: o aprendizado não supervisionado intervém mais frequentemente antes de um projeto supervisionado, a título de exploração, do que em produção autônoma. Uma segmentação pode, inclusive, tornar-se uma variável explicativa de um modelo supervisionado posterior.


4. O aprendizado por reforço

4.1 Definição

DEFINIÇÃO — Aprendizado por reforço (reinforcement learning)

Definição rigorosa

Arcabouço de aprendizado no qual um agente interage sequencialmente com um ambiente. A cada passo de tempo t, o agente observa um estado sts_t, escolhe uma ação ata_t segundo uma política π, recebe uma recompensa escalar rt+1r_{t+1} e observa um novo estado st+1s_{t+1}. O problema é na maioria das vezes formalizado como um processo de decisão markoviano (S, A, P, R, γ), com γ ∈ [0, 1[ o fator de desconto. O objetivo é determinar uma política π que maximize a esperança do ganho acumulado descontado:

J(\pi) = \mathbb{E}\left[ \sum_{t \ge 0} \gamma^{t} \, $$r_{t+1}$$ \right]

Referência de síntese: Sutton e Barto, Reinforcement Learning: An Introduction (1998, segunda edição 2018).

Tradução em linguagem corrente

O agente não aprende a partir de respostas corretas fornecidas de antemão, mas por tentativas sucessivas: ele age, o ambiente o penaliza ou o recompensa, e ele ajusta sua estratégia de modo a acumular o máximo de recompensa possível.

O que distingue a recompensa de um rótulo

O rótulo indica a resposta correta, preexiste ao treinamento e diz respeito a uma observação isolada. A recompensa avalia a resposta produzida, é gerada durante a interação, recai sobre uma sequência de ações e depende das ações do próprio modelo.

Ponto de atenção

O caráter diferido da recompensa gera o problema de atribuição de mérito: quando uma recompensa surge ao término de centenas de ações, determinar quais delas contribuíram constitui a dificuldade central do paradigma.

4.2 O laço agente-ambiente

O ciclo se repete até um estado terminal ou indefinidamente. A particularidade estrutural do paradigma aparece aqui: os dados de aprendizado são produzidos pelo próprio agente. Uma política medíocre gera trajetórias medíocres, com as quais o agente deve, no entanto, aprender. Daí o dilema entre exploração e explotação (exploration / exploitation): uma política que nunca explota não acumula nenhuma recompensa; uma política que nunca explora fica presa em um ótimo local. Esse dilema não tem equivalente em aprendizado supervisionado, onde o conjunto de dados é fixo.

4.3 Vocabulário de referência

Termo em portuguêsTermo em inglêsNotaçãoDefiniçãoExemplo: robô de movimentação
AgenteAgentEntidade que decide e ageO controlador do robô
AmbienteEnvironmentSistema com o qual o agente interage, produzindo transições e recompensasO armazém, suas prateleiras, seus obstáculos
EstadoStatests_tDescrição da situação no instante t, suficiente para decidirPosição, carga transportada, nível de bateria
AçãoActionata_tDecisão tomada entre as disponíveisAvançar, girar, pegar, depositar
RecompensaRewardrt+1r_{t+1}Escalar emitido pelo ambiente que avalia a transição+10 pacote depositado, -1 por segundo, -100 colisão
PolíticaPolicyπ(a|s)Regra que associa a cada estado uma ação ou uma distribuição sobre as açõesA estratégia de navegação aprendida

4.4 Aplicações

DomínioAplicaçãoNatureza da recompensaMaturidade
JogosGo, xadrez, videogamesVitória, pontuaçãoDemonstrada, referências acadêmicas maiores
RobóticaLocomoção, preensão, navegaçãoProgressão em direção ao objetivo, penalidade de colisãoOperacional em ambiente controlado
Data centersRegulação do resfriamentoEconomia de energia sob restrição de temperaturaImplantações industriais documentadas
FinançasExecução de ordens, alocação dinâmicaRetorno ajustado ao riscoUso real, fortemente regulamentado
PublicidadeAlocação de exibição, bandits contextuaisClique, conversãoMuito difundida sob a forma de bandits
LogísticaSequenciamento, gestão de estoqueCusto total, nível de serviçoEmergente, geralmente em simulação

Caso particular dos bandits multi-braços (multi-armed bandits): forma simplificada de aprendizado por reforço sem transição de estado, massivamente implantada para a alocação de conteúdos e os testes adaptativos, e principal exposição real das organizações a esse paradigma.

ANALOGIA — A aquisição de uma habilidade motora

Aprender a andar de bicicleta não procede de um gabarito: ninguém pode fornecer, para cada milissegundo, o valor exato do ângulo do guidão e da inclinação do tronco. A instrução "mantenha o equilíbrio" não é um rótulo. O sinal disponível é uma consequência: o aprendiz fica de pé, ou cai. O vínculo entre o gesto errado e sua consequência é diferido em alguns segundos.

Elemento da situaçãoCorrespondência formal
O aprendiz ciclistaO agente
A bicicleta, a estrada, a gravidadeO ambiente
Inclinação, velocidade, posição do guidãoO estado sts_t
Corrigir a trajetória, pedalar, frearA ação ata_t
Metros percorridos sem queda, quedaA recompensa rt+1r_{t+1}
Os reflexos adquiridosA política π
Tentar uma trajetória incomumA exploração
Reproduzir o que funcionouA explotação

O que a analogia evidencia

A habilidade é adquirida por interação e não por memorização de pares pergunta-resposta: ela não pode ser transmitida por uma exposição, e sua aquisição exige um grande número de tentativas, inclusive malsucedidas. Uma criança cai algumas dezenas de vezes; um agente artificial requer correntemente milhões de episódios. Quando cada episódio tem um custo material ou humano, o treinamento em condições reais torna-se impraticável — daí a exigência de um simulador.

4.5 Os quatro obstáculos à adoção em empresas

O aprendizado por reforço ocupa um lugar considerável na comunicação pública da área e um lugar marginal nos portfólios de projetos. Quatro obstáculos explicam essa diferença.

ObstáculoEnunciadoConsequência práticaSituações em que o obstáculo é superado
1. Ambiente simulável requeridoO aprendizado exige interações massivas, inaceitáveis no sistema realÉ preciso um simulador fiel, cuja construção é um projeto à parteJogos, sistemas físicos bem modelados, filas de espera, ambientes digitais
2. Custo computacionalO número de episódios ultrapassa em várias ordens de grandeza o volume de um treinamento supervisionadoOrçamento de computação elevado, prazos longos, iterações lentasProblemas de baixa dimensão, bandits, simulações pouco custosas
3. Especificação da recompensaTraduzir um objetivo de negócio em um escalar é arriscado: o agente otimiza exatamente o que está escritoComportamentos degenerados que maximizam a medida sem servir à intençãoObjetivos com medida direta e não contornável
4. Controlabilidade em produçãoA política explora, evolui e toma decisões sequenciais difíceis de auditarDificuldade de homologação, de rastreabilidade e de garantia de comportamentoDomínios de baixa criticidade, ou dispositivos limitados por regras de segurança externas

Desenvolvimento do obstáculo 3: os comportamentos degenerados

Uma função de recompensa mal especificada leva o agente a maximizar a medida em vez do objetivo que ela representa. A literatura designa esse fenômeno pelo termo reward hacking.

Objetivo visadoRecompensa escritaComportamento degenerado possível
Limpar um cômodoQuantidade de poeira coletadaEspalhar a poeira para coletá-la novamente
Terminar uma corridaPontos acumulados no percursoGirar em círculo em uma zona de pontos sem cruzar a linha
Maximizar o engajamentoDuração da sessãoFavorecer conteúdos polarizantes em detrimento da satisfação
Reduzir o prazo de tratamentoDossiês encerrados por horaEncerrar os dossiês difíceis sem resolvê-los
Evitar colisõesPenalidade em caso de contatoPermanecer imóvel

O agente não otimiza a intenção do projetista, ele otimiza a função de recompensa; toda diferença entre as duas será explorada. Essa constatação encontra a lei de Goodhart: quando uma medida se torna um objetivo, ela deixa de ser uma boa medida.

Ponto de atenção sobre o obstáculo 4: um modelo supervisionado produz uma previsão pontual que um processo de negócio pode filtrar antes da ação; um agente de reforço produz uma política de ação. O ponto de controle humano deve, portanto, ser concebido explicitamente, sob a forma de restrições de segurança externas ao aprendizado.


5. Os paradigmas intermediários

A disponibilidade do sinal admite estados intermediários: rótulos parciais, rótulos fabricados, rótulos presentes mas muito raros. Três configurações decorrem disso.

5.1 O aprendizado semissupervisionado

DEFINIÇÃO — Aprendizado semissupervisionado (semi-supervised learning)

Definição rigorosa

Classe de problemas nos quais a amostra reúne um subconjunto rotulado SlS_l = { (xix_i, yiy_i) } de tamanho l e um subconjunto não rotulado SuS_u = { xjx_j } de tamanho u, com geralmente u >> l. Os métodos exploram a distribuição marginal P(X) estimada sobre SuS_u para restringir a estimativa de P(Y | X) aprendida sobre SlS_l, sob hipóteses de regularidade: continuidade, agrupamento, variedade.

Tradução em linguagem corrente

Dispomos de muitas observações e de poucas respostas conhecidas; a massa não rotulada serve para tirar melhor proveito do pequeno número de rótulos disponíveis.

Ponto de atenção

As hipóteses de regularidade nem sempre são satisfeitas. Quando não o são, a adição de dados não rotulados pode degradar o desempenho em relação a um modelo treinado apenas com os dados rotulados.

Caso de escola: a imagem médica

Um centro hospitalar dispõe de 200 000 exames de imagem arquivados, dos quais apenas 2 000 estão anotados: a anotação mobiliza um radiologista por vários minutos por imagem, e a anotação integral representaria vários anos-homem. A abordagem supervisionada estrita descarta 99 % da informação disponível; a abordagem semissupervisionada aprende a estrutura do espaço das imagens com os 198 000 exames brutos e ajusta a regra de decisão com os 2 000 exames anotados.

5.2 O aprendizado autossupervisionado

DEFINIÇÃO — Aprendizado autossupervisionado (self-supervised learning)

Definição rigorosa

Classe de métodos nos quais a variável-alvo é construída automaticamente a partir da estrutura interna dos dados, sem intervenção de um anotador. Uma tarefa dita pretexto é definida de modo que seu rótulo seja dedutível do dado bruto; o modelo é treinado nessa tarefa por minimização de um risco empírico clássico, e depois a representação obtida é reutilizada para a tarefa-alvo.

Tradução em linguagem corrente

O algoritmo fabrica por si mesmo seus exercícios e seus gabaritos a partir dos dados brutos, o que elimina o custo de anotação.

Precisão determinante

A mecânica de aprendizado permanece estritamente supervisionada: existe um valor-alvo, uma função de perda, uma comparação entre previsão e alvo. Apenas a proveniência do rótulo muda — extraído dos dados em vez de ser fornecido por um operador. O autossupervisionado não é, portanto, um quarto paradigma, mas uma modalidade de obtenção dos rótulos.

Ponto de atenção

A qualidade da representação depende inteiramente da pertinência da tarefa pretexto. Uma tarefa resolvível por um artefato superficial produz uma representação sem valor para a tarefa-alvo.

Caso de escola: o mascaramento de palavras

A partir de um corpus de texto bruto, não anotado, exemplos de treinamento são construídos mascarando palavras e pedindo ao modelo que as restitua.

EtapaConteúdo
Dado bruto"A taxa básica de juros foi elevada em vinte e cinco pontos-base."
Exemplo fabricado (entrada)"A taxa básica de juros foi [MÁSCARA] em vinte e cinco pontos-base."
Rótulo fabricado (alvo)"elevada"
Custo de anotaçãoNulo: o rótulo é a palavra retirada

Esse mecanismo, popularizado pelas arquiteturas do tipo BERT (Devlin et al., 2018) e depois generalizado pelos modelos de linguagem autorregressivos, permite explorar corpus de tamanho muito grande sem anotação humana. A representação obtida é em seguida especializada em uma tarefa supervisionada que dispõe de poucos rótulos.

5.3 A detecção de anomalias

DEFINIÇÃO — Detecção de anomalias (anomaly detection)

Definição rigorosa

Problema que consiste em identificar as observações cuja geração é improvável à luz da distribuição das observações ditas normais. Conforme a disponibilidade de exemplos de anomalias rotulados, ele se formula como uma classificação supervisionada fortemente desbalanceada, como uma estimativa de densidade ou de suporte não supervisionada, ou como uma classificação de uma classe.

Tradução em linguagem corrente

Identificar o que sai do comum, quer disponhamos ou não de exemplos de casos anormais.

Posição taxonômica

A detecção de anomalias está entre dois paradigmas. Ela não constitui uma família adicional: designa uma finalidade de negócio tratável em um ou outro paradigma conforme os dados disponíveis.

Configuração dos dadosParadigma aplicávelMétodos usuaisAvaliação
Histórico de anomalias confirmadas e rotuladas, em proporção muito baixaSupervisionado, em regime de forte desbalanceamentoGradient boosting, florestas aleatórias com reamostragem ou ponderaçãoRecall, precisão, área sob a curva precisão-recall
Nenhuma anomalia rotulada, ou anomalias futuras distintas das anomalias passadasNão supervisionadoIsolation Forest, estimativa de densidade, SVM de uma classe, autoencoderCritérios internos, taxa de alerta, qualificação por um especialista
Algumas anomalias rotuladas e uma massa de observações não qualificadasSemissupervisionadoModelagem da normalidade, depois calibração do limiar nos casos rotuladosPrecisão nos casos confirmados, custo dos falsos positivos

Critério de escolha prático

Se as anomalias a detectar se parecem com as já observadas e rotuladas, o problema é supervisionado. Se as anomalias a detectar são desconhecidas por natureza, o problema é não supervisionado.

Em detecção de fraude bancária, os esquemas conhecidos são tratados em supervisionado, com as técnicas de gestão do desbalanceamento tratadas no capítulo 050; os esquemas novos escapam por construção a um modelo treinado no passado e pertencem a uma abordagem não supervisionada. Os dispositivos em produção combinam frequentemente os dois.


6. Método de qualificação de um problema

6.1 Árvore de decisão

Leitura do ramo "Enquadramento a refazer": a ausência de rótulos não desqualifica o projeto, ela desloca sua primeira etapa. A pergunta passa a ser "como constituir um conjunto rotulado" — anotação, coleta prospectiva, exploração de um registro de sistema — ou "qual objetivo não supervisionado assumir".

6.2 Tabela comparativa dos três paradigmas

CritérioSupervisionadoNão supervisionadoReforço
RótulosRequeridos para cada observação de treinamentoNenhumNenhum; substituídos por um sinal de recompensa
Pergunta feita"Qual é o valor de Y para esta observação?""Qual organização estrutura estas observações?""Qual sequência de ações maximiza o ganho acumulado?"
AnalogiaO aprendizado com gabaritoA triagem de objetos sem nomenclatura préviaA aquisição de uma habilidade motora
Medida de exatidãoDireta: comparação entre previsão e valor observadoImpossível no sentido estrito: nenhuma verdade de referênciaIndireta: recompensa acumulada em episódios
SubtiposClassificação, regressãoClustering, redução de dimensionalidade, regras de associaçãoMétodos baseados em valor, em política, bandits
Algoritmos típicosRegressão linear e logística, árvores, florestas aleatórias, gradient boosting, SVM, redes neuraisk-means, classificação hierárquica, DBSCAN, PCA, UMAP, autoencodersQ-learning, SARSA, gradientes de política, ator-crítico
Frequência em empresasPreponderante: a grande maioria dos modelos em produçãoSignificativa, principalmente em exploração e em preparaçãoMarginal fora de P&D, com a notável exceção dos bandits
ExemploPrever o cancelamento de um cliente em 90 diasSegmentar a base de clientes em grupos homogêneosOtimizar uma política de gestão de estoque em simulação
Cobertura por este cursoObjeto central, do capítulo 004 até o fimPosicionado aqui, não aprofundadoPosicionado aqui, não aprofundado

6.3 Distinguir classificação e clustering

Os dois procedimentos produzem grupos; a semelhança para aí. A confusão entre os dois é uma das mais frequentes em entrevista.

Ponto de comparaçãoClassificaçãoClustering
ParadigmaSupervisionadoNão supervisionado
Os grupos existem antes da análise?Sim, fazem parte da especificaçãoNão, resultam do cálculo
Número de gruposFixado pelo problema de negócioEscolhido pelo analista, frequentemente por exploração
Os grupos têm nome?Sim, um sentido de negócio definido a prioriNão, identificadores arbitrários a interpretar
Dados requeridosObservações rotuladasApenas observações
Pergunta feita"Esta observação pertence à classe A ou B?""Quais grupos emergem destas observações?"
AvaliaçãoExatidão, recall, precisão, F1, AUCSilhueta, inércia, utilidade de negócio
Estabilidade do sentidoEstável: as classes não mudamInstável: outra inicialização ou outro k modifica os grupos
ExemploAtribuir um e-mail a "spam" ou "legítimo"Descobrir quatro perfis em uma base de clientes
Formulação de negócio desencadeadora"Sabemos o que procuramos""Queremos saber o que há"

Teste de discriminação em uma pergunta: a lista dos grupos figura no caderno de especificações? Se sim, trata-se de classificação; senão, de clustering.


7. Erros de raciocínio frequentes

ERRO — Acreditar que se faz aprendizado supervisionado sem dispor de rótulos

Um departamento de marketing pede um modelo que preveja "os clientes de alto potencial". Nenhuma variável com esse nome existe no sistema de informação: a intenção de prever não basta para criar um problema supervisionado. Duas saídas são possíveis, e uma só deve ser escolhida explicitamente: definir um alvo mensurável e verificável no histórico — por exemplo "faturamento dos 12 meses seguintes superior a 5 000 $" — ou assumir uma abordagem exploratória não supervisionada que produza grupos a interpretar.

Formulação correta: "Um problema supervisionado requer uma variável-alvo definida, mensurável e presente no histórico. Enquanto ela não estiver constituída, não há problema supervisionado."

ERRO — Confundir clustering e classificação

Os dois produzem grupos, o que basta para alimentar a confusão. O critério discriminante não é a saída, mas a entrada: as classes preexistem nos dados de treinamento? Uma consequência é regularmente observada: um clustering apresentado como um modelo preditivo, acompanhado de uma pretensa medida de exatidão, a qual é sem objeto na ausência de partição de referência.

Formulação correta: "A classificação atribui uma observação a classes definidas previamente e aprendidas com exemplos rotulados; o clustering constitui grupos a partir apenas das similaridades, sem classes preexistentes nem exatidão mensurável."

ERRO — Considerar o aprendizado não supervisionado como mais simples

A ausência de rótulos alivia a coleta e dá a impressão de um problema menos exigente. É o inverso no plano da validação: sem verdade de referência, o projeto fica privado de critério objetivo de parada, e o número de grupos, a distância e a normalização pertencem a escolhas que nenhuma métrica decide. Um projeto supervisionado se conclui com um desempenho quantificado em um conjunto de teste; um projeto não supervisionado, com uma decisão de aceitação de negócio.

Formulação correta: "O aprendizado não supervisionado é menos exigente em dados rotulados e mais exigente em interpretação: sua dificuldade é deslocada da coleta para a validação."

ERRO — Tratar o Deep Learning como um quarto paradigma

A enumeração "supervisionado, não supervisionado, reforço, Deep Learning" mistura dois planos de classificação. Os três primeiros termos designam paradigmas, definidos pela natureza do sinal de aprendizado; o quarto designa uma classe de modelos, definida por uma arquitetura. Uma rede neural treinada com imagens rotuladas pertence ao supervisionado, um autoencoder ao não supervisionado, uma rede que otimiza uma política por recompensa ao reforço.

Formulação correta: "O Deep Learning é uma classe de modelos mobilizável nos três paradigmas; ele se situa em outro plano de classificação."

ERRO — Usar como rótulo uma variável posterior ao instante de previsão

Para prever o cancelamento em 90 dias, uma equipe retém como variável explicativa o número de ligações ao serviço de cancelamento. O desempenho é excelente em validação e nulo em produção: no momento em que a previsão deve ser produzida, essa ligação ainda não ocorreu. A variável não é preditiva, ela é constitutiva do evento a prever. Essa forma de vazamento de dados, tratada no capítulo 028, não é detectável pelas métricas: ela as melhora.

Regra de controle: para cada variável explicativa, verificar que seu valor estaria efetivamente disponível no instante em que o modelo será consultado em produção.

Formulação correta: "O rótulo é posterior às variáveis explicativas; toda informação contemporânea ou posterior à realização do alvo deve ser excluída do conjunto de treinamento."

ERRO — Deduzir o paradigma do domínio de aplicação

"Saúde é supervisionado" ou "marketing é clustering" são enunciados sem fundamento. A saúde dá origem à previsão de uma reinternação (supervisionado), à identificação de subgrupos de pacientes (não supervisionado) e à adaptação sequencial de um protocolo de dosagem (reforço). O marketing dá origem à previsão de um cancelamento, a uma segmentação e à alocação dinâmica de ofertas por bandits.

Formulação correta: "O paradigma é determinado pela natureza do sinal de aprendizado disponível, jamais pelo setor de atividade."


8. Síntese

O CRITÉRIO ÚNICO
    "Dispomos, para as observações passadas,
      do valor que buscamos prever?"

    Sim ..................................... SUPERVISIONADO
    Não ..................................... NÃO SUPERVISIONADO
    Não, mas uma avaliação diferida
    das ações está disponível ............... REFORÇO

SUBFAMÍLIAS
    Supervisionado     : classificação (alvo categórico)
                         regressão     (alvo numérico)
    Não supervisionado : clustering, redução de dimensionalidade,
                         regras de associação
    Reforço            : métodos baseados em valor ou em política

CONFIGURAÇÕES INTERMEDIÁRIAS
    Semissupervisionado : apenas uma fração das observações está rotulada
    Autossupervisionado : rótulos fabricados a partir dos dados;
                          a mecânica permanece supervisionada
    Anomalias           : supervisionado se as anomalias passadas estão rotuladas,
                          não supervisionado se são desconhecidas por natureza

O QUE NÃO É UM CRITÉRIO DE CLASSIFICAÇÃO
    o domínio, o tipo de dados, o volume,
    a arquitetura do modelo, a finalidade declarada

DISTINÇÃO A JAMAIS PERDER
    Classificação : os grupos existem antes da análise
    Clustering    : os grupos resultam da análise

O QUE CADA PARADIGMA MEDE
    Supervisionado     : uma exatidão, por comparação com o valor observado
    Não supervisionado : uma coesão interna e uma utilidade de negócio
    Reforço            : uma recompensa acumulada em episódios

POSIÇÃO DO DEEP LEARNING
    Classe de modelos mobilizável nos três paradigmas.
    Não é um quarto paradigma.

Enunciado de síntese

Os paradigmas de aprendizado distinguem-se pela natureza do sinal disponível e por nada mais: um valor-alvo conhecido observação por observação define o aprendizado supervisionado, a estrutura interna dos dados por si só define o aprendizado não supervisionado, uma recompensa diferida emitida por um ambiente define o aprendizado por reforço; o domínio, o volume e a arquitetura do modelo não têm efeito sobre essa classificação.


Quizzes associados: 003.1-quiz-critere-classement.md, 003.2-quiz-apprentissage-supervise.md, 003.3-quiz-apprentissage-non-supervise.md, 003.4-quiz-apprentissage-renforcement.md, 003.5-quiz-paradigmes-intermediaires.md, 003.6-quiz-qualification-probleme.md

Próximo capítulo: 004-apprentissage-supervise.md