O capítulo 002 estabeleceu a inversão própria do Machine Learning: as regras não são mais escritas, elas são induzidas a partir de observações. Essa indução supõe que um sinal oriente o aprendizado, isto é, que uma informação indique ao algoritmo em que direção corrigir seus parâmetros.
A natureza desse sinal constitui o único critério de classificação dos paradigmas. Ela é determinada por uma pergunta única:
"Dispomos, para as observações passadas, do valor que buscamos prever?"
| Resposta à pergunta | Sinal disponível | Paradigma | Formulação do problema |
|---|---|---|---|
| Sim — cada observação histórica carrega o valor-alvo | Um valor-alvo conhecido, observação por observação | Aprendizado supervisionado | Reproduzir em casos inéditos a associação entrada-saída observada |
| Não — nenhum valor-alvo está disponível | Nenhum sinal externo; apenas a estrutura interna dos dados é explorável | Aprendizado não supervisionado | Evidenciar uma organização latente das observações |
| Não, mas — existe uma avaliação diferida das ações | Um escalar de recompensa emitido pelo ambiente após cada ação | Aprendizado por reforço | Determinar uma estratégia de ação que maximize a recompensa acumulada |
Essas três respostas são exaustivas e mutuamente exclusivas para um problema corretamente formulado. Um problema que parece pertencer a dois paradigmas é um problema cuja formulação não foi fechada: a questão a decidir é então "qual é a variável-alvo", não "qual é o paradigma".
Sinal de aprendizado — definição rigorosa
Informação explorada por um algoritmo para avaliar a qualidade da hipótese corrente e dela derivar uma direção de correção de seus parâmetros. Ele assume a forma de um valor-alvo associado a cada observação, de um critério interno de coerência definido apenas sobre os dados, ou de um escalar de recompensa emitido por um ambiente em resposta a uma ação.
Paradigma de aprendizado — definição rigorosa
Classe de problemas definida pela natureza do sinal disponível e, por consequência, pela forma do problema de otimização colocado: minimização de um risco empírico sobre pares rotulados, otimização de um critério interno de estrutura, ou maximização de uma esperança de recompensa acumulada.
Tradução em linguagem corrente
O sinal é o que permite ao algoritmo saber se está errando; o paradigma é a família de problemas definida por aquilo de que dispomos para aprender.
Ponto de atenção
Na ausência de qualquer sinal, não há aprendizado no sentido de Mitchell (1997): sem medida de desempenho P, nenhuma experiência E pode melhorar coisa alguma.
Os ramos destacados delimitam o perímetro deste curso. Os demais são definidos aqui para permitir o posicionamento, sem serem aprofundados.
A confusão mais custosa, tanto no enquadramento de um projeto quanto em entrevista, consiste em classificar um problema segundo um critério que não é um critério.
| Critério invocado erroneamente | Contraexemplo imediato |
|---|---|
| O domínio de aplicação | A saúde dá origem a supervisionado (diagnóstico sobre casos rotulados), não supervisionado (tipologia de pacientes) e reforço (dosagem adaptativa) |
| O tipo de dados | Uma imagem alimenta uma classificação supervisionada tanto quanto um agrupamento não supervisionado de fotografias |
| A arquitetura do modelo | Uma rede profunda pode ser supervisionada, não supervisionada (autoencoder) ou de reforço |
| A finalidade de negócio | "Entender nossos clientes" traduz-se indiferentemente por uma segmentação ou por uma previsão de cancelamento |
Princípio diretor: o paradigma é lido nos dados disponíveis, não no assunto tratado, nem na ferramenta escolhida, nem na ambição do solicitante.
Definição rigorosa
Seja um espaço de entrada X e um espaço de saída Y. Dispomos de uma amostra de treinamento de n pares
S = { (x_1, y_1), ..., (x_n, y_n) }, x_i ∈ X, y_i ∈ Ysupostamente provenientes de um sorteio independente e identicamente distribuído segundo uma lei conjunta P(X, Y) desconhecida e fixa. O aprendizado supervisionado consiste em selecionar, em uma classe de hipóteses H, uma função f: X → Y que minimize o risco esperado R(f) = E[ L(f(X), Y) ], onde L é uma função de perda que mede a diferença entre valor previsto e valor observado. Como a lei P é desconhecida, o algoritmo minimiza na prática o risco empírico calculado sobre S, sob restrição de regularização.
Tradução em linguagem corrente
Fornecem-se exemplos cuja resposta correta é conhecida, e pede-se ao algoritmo que construa a função que melhor reproduz essa correspondência, a fim de aplicá-la a casos cuja resposta é desconhecida.
O termo "supervisionado"
Ele remete à presença de um supervisor — operador, processo ou observação posterior — que forneceu o valor correto para cada exemplo, durante a constituição do conjunto de dados e nunca durante o treinamento.
Ponto de atenção
A hipótese de distribuição fixa é estruturante. Quando P(X, Y) evolui entre o treinamento e a operação, o risco empírico deixa de estimar o risco esperado e o desempenho se degrada: fenômeno tratado no capítulo 082.
Definição rigorosa
Observação para a qual o valor da variável-alvo está preenchido, além das variáveis explicativas, sendo esse valor definido de maneira unívoca e homogênea em todo o conjunto de dados.
Tradução em linguagem corrente
Uma linha da tabela para a qual a resposta já é conhecida.
Proveniência dos rótulos
Observação diferida (o crédito foi reembolsado ou não), anotação humana (um radiologista qualifica uma imagem), registro de sistema (o cliente cancelou) ou medida física (a peça rompeu às 412 horas).
Ponto de atenção
O custo de obtenção dos rótulos é frequentemente o fator limitante de um projeto supervisionado: as variáveis explicativas são abundantes, os rótulos raramente.
O rótulo está presente no treinamento e ausente na operação. Um dispositivo em que ele estivesse disponível no momento da previsão não teria nenhuma utilidade preditiva.
O tipo da variável-alvo determina a subfamília.
| Classificação | Regressão | |
|---|---|---|
| Natureza do alvo | Categórica: conjunto finito de modalidades | Numérica contínua |
| Pergunta feita | "A qual classe esta observação pertence?" | "Qual valor esta grandeza assume?" |
| Saída do modelo | Uma classe, geralmente acompanhada de uma probabilidade | Um número real |
| Exemplo de alvo | Inadimplência: sim / não | Preço de venda: 412 500 $ |
| Métricas usuais | Exatidão (accuracy), precisão, recall, F1, AUC | RMSE, MAE, MAPE, R² |
| Algoritmos representativos | Regressão logística, árvores, florestas aleatórias, gradient boosting, SVM | Regressão linear, regressão regularizada, árvores de regressão, gradient boosting |
| Noção de erro | Discreta: a classe está correta ou não | Contínua: o erro possui uma amplitude |
Definição rigorosa
Problema de aprendizado supervisionado no qual o espaço de saída Y é um conjunto finito de modalidades { , ..., }. O modelo estima geralmente a probabilidade condicional P(Y = | X = x), a classe prevista resultando da aplicação de uma regra de decisão a esse vetor de probabilidades.
Tradução em linguagem corrente
Colocar cada observação em uma das categorias previstas de antemão.
Subtipos: binária (2 modalidades exclusivas), multiclasse (k modalidades exclusivas), multirrótulo (k modalidades cumuláveis), ordinal (k modalidades ordenadas, por exemplo uma classificação de risco de A a E).
Ponto de atenção
As modalidades são definidas antes do treinamento e fazem parte da especificação do problema. Um modelo de classificação não pode produzir uma classe que nunca encontrou.
Definição rigorosa
Problema de aprendizado supervisionado no qual o espaço de saída Y é um subconjunto dos reais. O modelo estima uma função de regressão, na maioria das vezes a esperança condicional E[Y | X = x], por minimização de uma perda quadrática ou absoluta.
Tradução em linguagem corrente
Estimar um número em vez de uma categoria.
Advertência terminológica
A palavra "regressão" não carrega, em seu uso moderno, nenhum sentido de recuo ou de retorno ao passado. Ela é herdada dos trabalhos de Francis Galton (1886) sobre a transmissão da altura entre gerações, que descreviam uma regressão à média: os filhos de pais muito altos tendiam a ser, em média, menos altos que seus pais. O termo designava um fenômeno estatístico particular; foi em seguida estendido ao método de ajuste empregado para evidenciá-lo, e depois a toda previsão de uma grandeza numérica. Nenhuma inferência deve, portanto, ser tirada da própria palavra: "regressão" significa unicamente que o alvo é um número.
Confusão a não cometer
A regressão logística é um algoritmo de classificação, apesar de seu nome: ela regride o logaritmo da razão de chances sobre as variáveis explicativas e produz uma probabilidade de pertencimento a uma classe.
| # | Domínio | Problema de negócio | Tipo | Variável-alvo |
|---|---|---|---|---|
| 1 | Banco | Concessão de crédito ao consumidor | Classificação binária | Inadimplência em 12 meses: sim / não |
| 2 | Banco | Detecção de fraude em transação de cartão | Classificação binária desbalanceada | Transação fraudulenta: sim / não |
| 3 | Banco | Estimativa da perda em caso de inadimplência | Regressão | Montante não recuperado, em dólares |
| 4 | Saúde | Apoio ao diagnóstico por imagem | Classificação multiclasse | Patologia identificada entre k categorias |
| 5 | Saúde | Antecipação das reinternações | Classificação binária | Reinternação em 30 dias: sim / não |
| 6 | Imobiliário | Avaliação do valor de um imóvel | Regressão | Preço de venda efetivo, em dólares |
| 7 | Recursos humanos | Prevenção da saída voluntária | Classificação binária | Demissão em 6 meses: sim / não |
| 8 | Recursos humanos | Estimativa da duração do recrutamento | Regressão | Dias entre publicação e assinatura |
| 9 | Indústria / IoT | Manutenção preditiva | Classificação binária | Pane em 7 dias: sim / não |
| 10 | Indústria / IoT | Vida útil residual de um equipamento | Regressão | Horas de funcionamento antes da falha |
| 11 | Marketing | Previsão de cancelamento (churn) | Classificação binária | Rescisão em 90 dias: sim / não |
| 12 | Marketing | Valor do tempo de vida do cliente | Regressão | Margem acumulada esperada em 24 meses, em dólares |
| 13 | Transporte | Estimativa de duração de trajeto | Regressão | Duração efetiva, em minutos |
| 14 | Cibersegurança | Filtragem de e-mails de phishing | Classificação binária | E-mail malicioso: sim / não |
| 15 | Energia | Previsão de carga da rede | Regressão | Consumo em H+24, em megawatts |
Leitura da tabela: nos quinze casos, um dado histórico carrega a resposta. O crédito foi reembolsado ou não, o imóvel foi vendido a um preço constatado, a peça rompeu em uma hora medida. É essa disponibilidade retrospectiva do alvo que torna o problema supervisionado, não a intenção de prever. A qualificação técnica do caso 7 não prejulga, além disso, sua licitude: as obrigações de não discriminação são tratadas no capítulo 095.
Um aluno prepara um exame a partir de provas anteriores. Cada prova contém um enunciado e um gabarito. O aluno resolve o enunciado, compara sua produção ao gabarito, identifica a diferença, ajusta seu método. Após um número suficiente de exercícios, ele enfrenta uma prova inédita cujo gabarito ainda não existe.
| Situação pedagógica | Aprendizado supervisionado | Notação |
|---|---|---|
| O enunciado do exercício | As variáveis explicativas de uma observação | |
| O gabarito do exercício | O rótulo, valor-alvo conhecido | |
| A coletânea de provas anteriores | O conjunto de treinamento | S |
| O método de resolução do aluno | A função aprendida | f |
| A diferença entre produção e gabarito | A perda em uma observação | L(f(), ) |
| A revisão do método | A atualização dos parâmetros | otimização |
| O simulado | O conjunto de validação | — |
| O exame final, prova inédita | O conjunto de teste, depois a produção | — |
| A nota obtida no exame final | O desempenho em generalização | R(f) |
Prolongamentos
O aluno que memoriza os gabaritos sem adquirir o método acerta as provas anteriores e falha na prova inédita: é o sobreajuste (overfitting), tratado no capítulo 040. O aluno que dispõe do gabarito durante o exame obtém uma nota excelente que não mede nada: é o vazamento de dados (data leakage), tratado no capítulo 028.
Limite da analogia
O aluno compreende o que faz e transpõe para um domínio vizinho. O modelo estabelece apenas uma correspondência estatística e não transpõe para fora do domínio coberto por seus dados de treinamento.
Definição rigorosa
Classe de problemas nos quais dispomos de uma amostra { , ..., }, ∈ X, sem variável-alvo associada. O objetivo é estimar uma estrutura da distribuição P(X): partição do espaço das observações, subvariedade de baixa dimensão que aproxima a nuvem de pontos, densidade, ou regularidades de coocorrência. A otimização recai sobre um critério definido exclusivamente a partir dos dados, sem referência a um valor esperado.
Tradução em linguagem corrente
Fornecem-se observações sem nenhuma resposta associada e pede-se ao algoritmo que faça aparecer a organização interna desses dados.
O termo "não supervisionado"
Ele indica a ausência de resposta de referência, não a ausência de intervenção humana: escolha das variáveis, da distância, do número de grupos e da normalização pertencem inteiramente ao analista.
Ponto de atenção
Um algoritmo não supervisionado sempre produz um resultado, inclusive quando os dados não contêm nenhuma estrutura: um particionamento em quatro grupos devolverá quatro grupos sobre uma nuvem perfeitamente uniforme. A produção de um resultado, portanto, nunca atesta a existência de uma estrutura.
Definição rigorosa
Problema que consiste em construir uma partição ou um recobrimento de um conjunto de observações em grupos tais que uma medida de similaridade intragrupo seja máxima e a similaridade intergrupos mínima, no sentido de uma distância especificada pelo analista. Um método de particionamento por inércia minimiza assim a soma dos quadrados dos desvios internos:
argmin Σ Σ || x - μ_j ||²
C j=1..k x ∈ C_jonde designa o centro do grupo .
Tradução em linguagem corrente
Agrupar as observações que se parecem, sem saber de antemão quais grupos existem nem quantos são.
Parâmetros a cargo do analista
Número de grupos, medida de distância, normalização, seleção das variáveis. Cada uma dessas escolhas modifica o resultado; não existe uma partição "verdadeira" que um algoritmo descobriria independentemente delas.
Ponto de atenção
Os grupos produzidos não têm nome. Sua denominação e sua interpretação são um ato de negócio posterior ao algoritmo, jamais uma saída dele.
Definição rigorosa
Problema que consiste em construir uma aplicação g: X → Z, com dim(Z) < dim(X), preservando o melhor possível uma propriedade da distribuição de origem: variância explicada para a análise de componentes principais, estrutura de vizinhança local para os métodos de imersão não linear, capacidade de reconstrução para os autoencoders. O critério otimizado é interno aos dados.
Tradução em linguagem corrente
Representar as mesmas observações com menos variáveis, perdendo o mínimo de informação possível.
Finalidades operacionais: visualização, compressão, remoção de ruído, pré-processamento de um modelo supervisionado, atenuação da maldição da dimensionalidade.
Ponto de atenção
Empregada antes de um modelo supervisionado, a redução de dimensionalidade deve ser ajustada apenas com os dados de treinamento e depois aplicada tal como está aos dados de validação e de teste. Ajustá-la sobre o conjunto de todos os dados constitui um vazamento de dados, tratado no capítulo 028.
Uma rede varejista dispõe de 12 000 clientes ativos. Nenhuma variável-alvo existe: a diretoria não pede para prever um comportamento, mas para compreender a estrutura de sua base. Quatro variáveis são retidas — frequência de compra anual, tíquete médio, tempo de relacionamento, parcela das compras on-line — e um particionamento em quatro grupos é aplicado após normalização.
Saída bruta do algoritmo
| Grupo | Efetivo | Parcela | Frequência anual | Tíquete médio | Tempo de relacionamento | Parcela on-line |
|---|---|---|---|---|---|---|
| Grupo 1 | 4 320 | 36 % | 1,2 compra | 38 $ | 8 meses | 22 % |
| Grupo 2 | 3 600 | 30 % | 11,4 compras | 42 $ | 5,2 anos | 15 % |
| Grupo 3 | 2 880 | 24 % | 4,1 compras | 187 $ | 3,4 anos | 71 % |
| Grupo 4 | 1 200 | 10 % | 0,4 compra | 25 $ | 6,1 anos | 5 % |
Os identificadores numéricos são desprovidos de sentido: "Grupo 1" não significa nada e não é ordenado em relação a "Grupo 2".
Interpretação de negócio, posterior ao algoritmo
| Grupo | Denominação adotada pelo negócio | Leitura | Ação considerada |
|---|---|---|---|
| Grupo 1 | Novos clientes ocasionais | Tempo de relacionamento baixo, engajamento baixo | Jornada de ativação nos 6 primeiros meses |
| Grupo 2 | Frequentadores de proximidade | Frequência elevada, tíquete baixo, canal físico | Programa de fidelidade, aumento do tíquete |
| Grupo 3 | Compradores de alto tíquete on-line | Tíquete quatro vezes superior, canal digital | Oferta premium, serviço de entrega dedicado |
| Grupo 4 | Clientes dormentes | Tempo de relacionamento elevado, atividade quase nula | Campanha de reativação ou saída do cadastro ativo |
Ponto determinante: a segunda coluna não foi produzida pelo algoritmo. Ela foi formulada por responsáveis de negócio examinando as características estatísticas de cada grupo. Um algoritmo de clustering delimita grupos; ele não os nomeia nem os explica.
É a diferença estrutural mais importante em relação ao aprendizado supervisionado. Cada previsão supervisionada pode ser confrontada com o valor observado: a exatidão é mensurável. Em não supervisionado, não existe nenhuma partição de referência, e a pergunta "esta segmentação está exata?" é mal colocada. A avaliação repousa então sobre duas ordens de critérios.
| Ordem de critério | Natureza | Exemplos | Limite |
|---|---|---|---|
| Critérios internos | Estatística, calculado apenas sobre os dados | Coeficiente de silhueta, inércia intraclasse, índices de Davies-Bouldin e de Calinski-Harabasz | Uma pontuação elevada não atesta a pertinência de negócio |
| Critérios de utilidade de negócio | Operacional, avaliado pelos responsáveis do domínio | Grupos interpretáveis, acionáveis, de tamanho explorável, estáveis no tempo | Subjetividade, dependência da expertise disponível |
Ponto de atenção: uma segmentação com coeficiente de silhueta excelente mas cujos grupos não exigem nenhuma ação é um fracasso operacional; uma partição com pontuação interna medíocre cujos grupos exigem ações diferenciadas e mensuráveis é um sucesso. O critério final é a utilidade.
Consequência sobre a condução do projeto: um projeto não supervisionado não pode ser pilotado por um limiar contratual do tipo "pelo menos 90 % de exatidão", mas por uma revisão de interpretabilidade que associe o negócio.
| Domínio | Aplicação | Subfamília | Saída explorada |
|---|---|---|---|
| Varejo | Segmentação da base de clientes | Clustering | Grupos homogêneos para direcionamento diferenciado |
| Comércio | Análise da cesta de compras | Regras de associação | Produtos frequentemente comprados juntos |
| Seguros | Tipologia de perfis de sinistralidade | Clustering | Grupos que servem de base a uma precificação |
| Bioinformática | Agrupamento de perfis de expressão gênica | Clustering | Subtipos moleculares candidatos |
| Indústria | Compressão de sinais de sensores | Redução de dimensionalidade | Representação compacta para monitoramento |
| Documentação | Agrupamento temático de corpus | Clustering | Famílias de documentos sem nomenclatura prévia |
| Cibersegurança | Detecção de comportamentos atípicos | Detecção de anomalias | Alertas a qualificar por um analista |
| Marketing | Redução de um questionário a seus eixos principais | Redução de dimensionalidade | Fatores sintéticos de atitude |
Observação profissional: o aprendizado não supervisionado intervém mais frequentemente antes de um projeto supervisionado, a título de exploração, do que em produção autônoma. Uma segmentação pode, inclusive, tornar-se uma variável explicativa de um modelo supervisionado posterior.
Definição rigorosa
Arcabouço de aprendizado no qual um agente interage sequencialmente com um ambiente. A cada passo de tempo t, o agente observa um estado , escolhe uma ação segundo uma política π, recebe uma recompensa escalar e observa um novo estado . O problema é na maioria das vezes formalizado como um processo de decisão markoviano (S, A, P, R, γ), com γ ∈ [0, 1[ o fator de desconto. O objetivo é determinar uma política π que maximize a esperança do ganho acumulado descontado:
J(\pi) = \mathbb{E}\left[ \sum_{t \ge 0} \gamma^{t} \, $$r_{t+1}$$ \right]Referência de síntese: Sutton e Barto, Reinforcement Learning: An Introduction (1998, segunda edição 2018).
Tradução em linguagem corrente
O agente não aprende a partir de respostas corretas fornecidas de antemão, mas por tentativas sucessivas: ele age, o ambiente o penaliza ou o recompensa, e ele ajusta sua estratégia de modo a acumular o máximo de recompensa possível.
O que distingue a recompensa de um rótulo
O rótulo indica a resposta correta, preexiste ao treinamento e diz respeito a uma observação isolada. A recompensa avalia a resposta produzida, é gerada durante a interação, recai sobre uma sequência de ações e depende das ações do próprio modelo.
Ponto de atenção
O caráter diferido da recompensa gera o problema de atribuição de mérito: quando uma recompensa surge ao término de centenas de ações, determinar quais delas contribuíram constitui a dificuldade central do paradigma.
O ciclo se repete até um estado terminal ou indefinidamente. A particularidade estrutural do paradigma aparece aqui: os dados de aprendizado são produzidos pelo próprio agente. Uma política medíocre gera trajetórias medíocres, com as quais o agente deve, no entanto, aprender. Daí o dilema entre exploração e explotação (exploration / exploitation): uma política que nunca explota não acumula nenhuma recompensa; uma política que nunca explora fica presa em um ótimo local. Esse dilema não tem equivalente em aprendizado supervisionado, onde o conjunto de dados é fixo.
| Termo em português | Termo em inglês | Notação | Definição | Exemplo: robô de movimentação |
|---|---|---|---|---|
| Agente | Agent | — | Entidade que decide e age | O controlador do robô |
| Ambiente | Environment | — | Sistema com o qual o agente interage, produzindo transições e recompensas | O armazém, suas prateleiras, seus obstáculos |
| Estado | State | Descrição da situação no instante t, suficiente para decidir | Posição, carga transportada, nível de bateria | |
| Ação | Action | Decisão tomada entre as disponíveis | Avançar, girar, pegar, depositar | |
| Recompensa | Reward | Escalar emitido pelo ambiente que avalia a transição | +10 pacote depositado, -1 por segundo, -100 colisão | |
| Política | Policy | π(a|s) | Regra que associa a cada estado uma ação ou uma distribuição sobre as ações | A estratégia de navegação aprendida |
| Domínio | Aplicação | Natureza da recompensa | Maturidade |
|---|---|---|---|
| Jogos | Go, xadrez, videogames | Vitória, pontuação | Demonstrada, referências acadêmicas maiores |
| Robótica | Locomoção, preensão, navegação | Progressão em direção ao objetivo, penalidade de colisão | Operacional em ambiente controlado |
| Data centers | Regulação do resfriamento | Economia de energia sob restrição de temperatura | Implantações industriais documentadas |
| Finanças | Execução de ordens, alocação dinâmica | Retorno ajustado ao risco | Uso real, fortemente regulamentado |
| Publicidade | Alocação de exibição, bandits contextuais | Clique, conversão | Muito difundida sob a forma de bandits |
| Logística | Sequenciamento, gestão de estoque | Custo total, nível de serviço | Emergente, geralmente em simulação |
Caso particular dos bandits multi-braços (multi-armed bandits): forma simplificada de aprendizado por reforço sem transição de estado, massivamente implantada para a alocação de conteúdos e os testes adaptativos, e principal exposição real das organizações a esse paradigma.
Aprender a andar de bicicleta não procede de um gabarito: ninguém pode fornecer, para cada milissegundo, o valor exato do ângulo do guidão e da inclinação do tronco. A instrução "mantenha o equilíbrio" não é um rótulo. O sinal disponível é uma consequência: o aprendiz fica de pé, ou cai. O vínculo entre o gesto errado e sua consequência é diferido em alguns segundos.
| Elemento da situação | Correspondência formal |
|---|---|
| O aprendiz ciclista | O agente |
| A bicicleta, a estrada, a gravidade | O ambiente |
| Inclinação, velocidade, posição do guidão | O estado |
| Corrigir a trajetória, pedalar, frear | A ação |
| Metros percorridos sem queda, queda | A recompensa |
| Os reflexos adquiridos | A política π |
| Tentar uma trajetória incomum | A exploração |
| Reproduzir o que funcionou | A explotação |
O que a analogia evidencia
A habilidade é adquirida por interação e não por memorização de pares pergunta-resposta: ela não pode ser transmitida por uma exposição, e sua aquisição exige um grande número de tentativas, inclusive malsucedidas. Uma criança cai algumas dezenas de vezes; um agente artificial requer correntemente milhões de episódios. Quando cada episódio tem um custo material ou humano, o treinamento em condições reais torna-se impraticável — daí a exigência de um simulador.
O aprendizado por reforço ocupa um lugar considerável na comunicação pública da área e um lugar marginal nos portfólios de projetos. Quatro obstáculos explicam essa diferença.
| Obstáculo | Enunciado | Consequência prática | Situações em que o obstáculo é superado |
|---|---|---|---|
| 1. Ambiente simulável requerido | O aprendizado exige interações massivas, inaceitáveis no sistema real | É preciso um simulador fiel, cuja construção é um projeto à parte | Jogos, sistemas físicos bem modelados, filas de espera, ambientes digitais |
| 2. Custo computacional | O número de episódios ultrapassa em várias ordens de grandeza o volume de um treinamento supervisionado | Orçamento de computação elevado, prazos longos, iterações lentas | Problemas de baixa dimensão, bandits, simulações pouco custosas |
| 3. Especificação da recompensa | Traduzir um objetivo de negócio em um escalar é arriscado: o agente otimiza exatamente o que está escrito | Comportamentos degenerados que maximizam a medida sem servir à intenção | Objetivos com medida direta e não contornável |
| 4. Controlabilidade em produção | A política explora, evolui e toma decisões sequenciais difíceis de auditar | Dificuldade de homologação, de rastreabilidade e de garantia de comportamento | Domínios de baixa criticidade, ou dispositivos limitados por regras de segurança externas |
Desenvolvimento do obstáculo 3: os comportamentos degenerados
Uma função de recompensa mal especificada leva o agente a maximizar a medida em vez do objetivo que ela representa. A literatura designa esse fenômeno pelo termo reward hacking.
| Objetivo visado | Recompensa escrita | Comportamento degenerado possível |
|---|---|---|
| Limpar um cômodo | Quantidade de poeira coletada | Espalhar a poeira para coletá-la novamente |
| Terminar uma corrida | Pontos acumulados no percurso | Girar em círculo em uma zona de pontos sem cruzar a linha |
| Maximizar o engajamento | Duração da sessão | Favorecer conteúdos polarizantes em detrimento da satisfação |
| Reduzir o prazo de tratamento | Dossiês encerrados por hora | Encerrar os dossiês difíceis sem resolvê-los |
| Evitar colisões | Penalidade em caso de contato | Permanecer imóvel |
O agente não otimiza a intenção do projetista, ele otimiza a função de recompensa; toda diferença entre as duas será explorada. Essa constatação encontra a lei de Goodhart: quando uma medida se torna um objetivo, ela deixa de ser uma boa medida.
Ponto de atenção sobre o obstáculo 4: um modelo supervisionado produz uma previsão pontual que um processo de negócio pode filtrar antes da ação; um agente de reforço produz uma política de ação. O ponto de controle humano deve, portanto, ser concebido explicitamente, sob a forma de restrições de segurança externas ao aprendizado.
A disponibilidade do sinal admite estados intermediários: rótulos parciais, rótulos fabricados, rótulos presentes mas muito raros. Três configurações decorrem disso.
Definição rigorosa
Classe de problemas nos quais a amostra reúne um subconjunto rotulado = { (, ) } de tamanho l e um subconjunto não rotulado = { } de tamanho u, com geralmente u >> l. Os métodos exploram a distribuição marginal P(X) estimada sobre para restringir a estimativa de P(Y | X) aprendida sobre , sob hipóteses de regularidade: continuidade, agrupamento, variedade.
Tradução em linguagem corrente
Dispomos de muitas observações e de poucas respostas conhecidas; a massa não rotulada serve para tirar melhor proveito do pequeno número de rótulos disponíveis.
Ponto de atenção
As hipóteses de regularidade nem sempre são satisfeitas. Quando não o são, a adição de dados não rotulados pode degradar o desempenho em relação a um modelo treinado apenas com os dados rotulados.
Caso de escola: a imagem médica
Um centro hospitalar dispõe de 200 000 exames de imagem arquivados, dos quais apenas 2 000 estão anotados: a anotação mobiliza um radiologista por vários minutos por imagem, e a anotação integral representaria vários anos-homem. A abordagem supervisionada estrita descarta 99 % da informação disponível; a abordagem semissupervisionada aprende a estrutura do espaço das imagens com os 198 000 exames brutos e ajusta a regra de decisão com os 2 000 exames anotados.
Definição rigorosa
Classe de métodos nos quais a variável-alvo é construída automaticamente a partir da estrutura interna dos dados, sem intervenção de um anotador. Uma tarefa dita pretexto é definida de modo que seu rótulo seja dedutível do dado bruto; o modelo é treinado nessa tarefa por minimização de um risco empírico clássico, e depois a representação obtida é reutilizada para a tarefa-alvo.
Tradução em linguagem corrente
O algoritmo fabrica por si mesmo seus exercícios e seus gabaritos a partir dos dados brutos, o que elimina o custo de anotação.
Precisão determinante
A mecânica de aprendizado permanece estritamente supervisionada: existe um valor-alvo, uma função de perda, uma comparação entre previsão e alvo. Apenas a proveniência do rótulo muda — extraído dos dados em vez de ser fornecido por um operador. O autossupervisionado não é, portanto, um quarto paradigma, mas uma modalidade de obtenção dos rótulos.
Ponto de atenção
A qualidade da representação depende inteiramente da pertinência da tarefa pretexto. Uma tarefa resolvível por um artefato superficial produz uma representação sem valor para a tarefa-alvo.
Caso de escola: o mascaramento de palavras
A partir de um corpus de texto bruto, não anotado, exemplos de treinamento são construídos mascarando palavras e pedindo ao modelo que as restitua.
| Etapa | Conteúdo |
|---|---|
| Dado bruto | "A taxa básica de juros foi elevada em vinte e cinco pontos-base." |
| Exemplo fabricado (entrada) | "A taxa básica de juros foi [MÁSCARA] em vinte e cinco pontos-base." |
| Rótulo fabricado (alvo) | "elevada" |
| Custo de anotação | Nulo: o rótulo é a palavra retirada |
Esse mecanismo, popularizado pelas arquiteturas do tipo BERT (Devlin et al., 2018) e depois generalizado pelos modelos de linguagem autorregressivos, permite explorar corpus de tamanho muito grande sem anotação humana. A representação obtida é em seguida especializada em uma tarefa supervisionada que dispõe de poucos rótulos.
Definição rigorosa
Problema que consiste em identificar as observações cuja geração é improvável à luz da distribuição das observações ditas normais. Conforme a disponibilidade de exemplos de anomalias rotulados, ele se formula como uma classificação supervisionada fortemente desbalanceada, como uma estimativa de densidade ou de suporte não supervisionada, ou como uma classificação de uma classe.
Tradução em linguagem corrente
Identificar o que sai do comum, quer disponhamos ou não de exemplos de casos anormais.
Posição taxonômica
A detecção de anomalias está entre dois paradigmas. Ela não constitui uma família adicional: designa uma finalidade de negócio tratável em um ou outro paradigma conforme os dados disponíveis.
| Configuração dos dados | Paradigma aplicável | Métodos usuais | Avaliação |
|---|---|---|---|
| Histórico de anomalias confirmadas e rotuladas, em proporção muito baixa | Supervisionado, em regime de forte desbalanceamento | Gradient boosting, florestas aleatórias com reamostragem ou ponderação | Recall, precisão, área sob a curva precisão-recall |
| Nenhuma anomalia rotulada, ou anomalias futuras distintas das anomalias passadas | Não supervisionado | Isolation Forest, estimativa de densidade, SVM de uma classe, autoencoder | Critérios internos, taxa de alerta, qualificação por um especialista |
| Algumas anomalias rotuladas e uma massa de observações não qualificadas | Semissupervisionado | Modelagem da normalidade, depois calibração do limiar nos casos rotulados | Precisão nos casos confirmados, custo dos falsos positivos |
Critério de escolha prático
Se as anomalias a detectar se parecem com as já observadas e rotuladas, o problema é supervisionado. Se as anomalias a detectar são desconhecidas por natureza, o problema é não supervisionado.
Em detecção de fraude bancária, os esquemas conhecidos são tratados em supervisionado, com as técnicas de gestão do desbalanceamento tratadas no capítulo 050; os esquemas novos escapam por construção a um modelo treinado no passado e pertencem a uma abordagem não supervisionada. Os dispositivos em produção combinam frequentemente os dois.
Leitura do ramo "Enquadramento a refazer": a ausência de rótulos não desqualifica o projeto, ela desloca sua primeira etapa. A pergunta passa a ser "como constituir um conjunto rotulado" — anotação, coleta prospectiva, exploração de um registro de sistema — ou "qual objetivo não supervisionado assumir".
| Critério | Supervisionado | Não supervisionado | Reforço |
|---|---|---|---|
| Rótulos | Requeridos para cada observação de treinamento | Nenhum | Nenhum; substituídos por um sinal de recompensa |
| Pergunta feita | "Qual é o valor de Y para esta observação?" | "Qual organização estrutura estas observações?" | "Qual sequência de ações maximiza o ganho acumulado?" |
| Analogia | O aprendizado com gabarito | A triagem de objetos sem nomenclatura prévia | A aquisição de uma habilidade motora |
| Medida de exatidão | Direta: comparação entre previsão e valor observado | Impossível no sentido estrito: nenhuma verdade de referência | Indireta: recompensa acumulada em episódios |
| Subtipos | Classificação, regressão | Clustering, redução de dimensionalidade, regras de associação | Métodos baseados em valor, em política, bandits |
| Algoritmos típicos | Regressão linear e logística, árvores, florestas aleatórias, gradient boosting, SVM, redes neurais | k-means, classificação hierárquica, DBSCAN, PCA, UMAP, autoencoders | Q-learning, SARSA, gradientes de política, ator-crítico |
| Frequência em empresas | Preponderante: a grande maioria dos modelos em produção | Significativa, principalmente em exploração e em preparação | Marginal fora de P&D, com a notável exceção dos bandits |
| Exemplo | Prever o cancelamento de um cliente em 90 dias | Segmentar a base de clientes em grupos homogêneos | Otimizar uma política de gestão de estoque em simulação |
| Cobertura por este curso | Objeto central, do capítulo 004 até o fim | Posicionado aqui, não aprofundado | Posicionado aqui, não aprofundado |
Os dois procedimentos produzem grupos; a semelhança para aí. A confusão entre os dois é uma das mais frequentes em entrevista.
| Ponto de comparação | Classificação | Clustering |
|---|---|---|
| Paradigma | Supervisionado | Não supervisionado |
| Os grupos existem antes da análise? | Sim, fazem parte da especificação | Não, resultam do cálculo |
| Número de grupos | Fixado pelo problema de negócio | Escolhido pelo analista, frequentemente por exploração |
| Os grupos têm nome? | Sim, um sentido de negócio definido a priori | Não, identificadores arbitrários a interpretar |
| Dados requeridos | Observações rotuladas | Apenas observações |
| Pergunta feita | "Esta observação pertence à classe A ou B?" | "Quais grupos emergem destas observações?" |
| Avaliação | Exatidão, recall, precisão, F1, AUC | Silhueta, inércia, utilidade de negócio |
| Estabilidade do sentido | Estável: as classes não mudam | Instável: outra inicialização ou outro k modifica os grupos |
| Exemplo | Atribuir um e-mail a "spam" ou "legítimo" | Descobrir quatro perfis em uma base de clientes |
| Formulação de negócio desencadeadora | "Sabemos o que procuramos" | "Queremos saber o que há" |
Teste de discriminação em uma pergunta: a lista dos grupos figura no caderno de especificações? Se sim, trata-se de classificação; senão, de clustering.
Um departamento de marketing pede um modelo que preveja "os clientes de alto potencial". Nenhuma variável com esse nome existe no sistema de informação: a intenção de prever não basta para criar um problema supervisionado. Duas saídas são possíveis, e uma só deve ser escolhida explicitamente: definir um alvo mensurável e verificável no histórico — por exemplo "faturamento dos 12 meses seguintes superior a 5 000 $" — ou assumir uma abordagem exploratória não supervisionada que produza grupos a interpretar.
Formulação correta: "Um problema supervisionado requer uma variável-alvo definida, mensurável e presente no histórico. Enquanto ela não estiver constituída, não há problema supervisionado."
Os dois produzem grupos, o que basta para alimentar a confusão. O critério discriminante não é a saída, mas a entrada: as classes preexistem nos dados de treinamento? Uma consequência é regularmente observada: um clustering apresentado como um modelo preditivo, acompanhado de uma pretensa medida de exatidão, a qual é sem objeto na ausência de partição de referência.
Formulação correta: "A classificação atribui uma observação a classes definidas previamente e aprendidas com exemplos rotulados; o clustering constitui grupos a partir apenas das similaridades, sem classes preexistentes nem exatidão mensurável."
A ausência de rótulos alivia a coleta e dá a impressão de um problema menos exigente. É o inverso no plano da validação: sem verdade de referência, o projeto fica privado de critério objetivo de parada, e o número de grupos, a distância e a normalização pertencem a escolhas que nenhuma métrica decide. Um projeto supervisionado se conclui com um desempenho quantificado em um conjunto de teste; um projeto não supervisionado, com uma decisão de aceitação de negócio.
Formulação correta: "O aprendizado não supervisionado é menos exigente em dados rotulados e mais exigente em interpretação: sua dificuldade é deslocada da coleta para a validação."
A enumeração "supervisionado, não supervisionado, reforço, Deep Learning" mistura dois planos de classificação. Os três primeiros termos designam paradigmas, definidos pela natureza do sinal de aprendizado; o quarto designa uma classe de modelos, definida por uma arquitetura. Uma rede neural treinada com imagens rotuladas pertence ao supervisionado, um autoencoder ao não supervisionado, uma rede que otimiza uma política por recompensa ao reforço.
Formulação correta: "O Deep Learning é uma classe de modelos mobilizável nos três paradigmas; ele se situa em outro plano de classificação."
Para prever o cancelamento em 90 dias, uma equipe retém como variável explicativa o número de ligações ao serviço de cancelamento. O desempenho é excelente em validação e nulo em produção: no momento em que a previsão deve ser produzida, essa ligação ainda não ocorreu. A variável não é preditiva, ela é constitutiva do evento a prever. Essa forma de vazamento de dados, tratada no capítulo 028, não é detectável pelas métricas: ela as melhora.
Regra de controle: para cada variável explicativa, verificar que seu valor estaria efetivamente disponível no instante em que o modelo será consultado em produção.
Formulação correta: "O rótulo é posterior às variáveis explicativas; toda informação contemporânea ou posterior à realização do alvo deve ser excluída do conjunto de treinamento."
"Saúde é supervisionado" ou "marketing é clustering" são enunciados sem fundamento. A saúde dá origem à previsão de uma reinternação (supervisionado), à identificação de subgrupos de pacientes (não supervisionado) e à adaptação sequencial de um protocolo de dosagem (reforço). O marketing dá origem à previsão de um cancelamento, a uma segmentação e à alocação dinâmica de ofertas por bandits.
Formulação correta: "O paradigma é determinado pela natureza do sinal de aprendizado disponível, jamais pelo setor de atividade."
O CRITÉRIO ÚNICO
"Dispomos, para as observações passadas,
do valor que buscamos prever?"
Sim ..................................... SUPERVISIONADO
Não ..................................... NÃO SUPERVISIONADO
Não, mas uma avaliação diferida
das ações está disponível ............... REFORÇO
SUBFAMÍLIAS
Supervisionado : classificação (alvo categórico)
regressão (alvo numérico)
Não supervisionado : clustering, redução de dimensionalidade,
regras de associação
Reforço : métodos baseados em valor ou em política
CONFIGURAÇÕES INTERMEDIÁRIAS
Semissupervisionado : apenas uma fração das observações está rotulada
Autossupervisionado : rótulos fabricados a partir dos dados;
a mecânica permanece supervisionada
Anomalias : supervisionado se as anomalias passadas estão rotuladas,
não supervisionado se são desconhecidas por natureza
O QUE NÃO É UM CRITÉRIO DE CLASSIFICAÇÃO
o domínio, o tipo de dados, o volume,
a arquitetura do modelo, a finalidade declarada
DISTINÇÃO A JAMAIS PERDER
Classificação : os grupos existem antes da análise
Clustering : os grupos resultam da análise
O QUE CADA PARADIGMA MEDE
Supervisionado : uma exatidão, por comparação com o valor observado
Não supervisionado : uma coesão interna e uma utilidade de negócio
Reforço : uma recompensa acumulada em episódios
POSIÇÃO DO DEEP LEARNING
Classe de modelos mobilizável nos três paradigmas.
Não é um quarto paradigma.Enunciado de síntese
Os paradigmas de aprendizado distinguem-se pela natureza do sinal disponível e por nada mais: um valor-alvo conhecido observação por observação define o aprendizado supervisionado, a estrutura interna dos dados por si só define o aprendizado não supervisionado, uma recompensa diferida emitida por um ambiente define o aprendizado por reforço; o domínio, o volume e a arquitetura do modelo não têm efeito sobre essa classificação.
Quizzes associados:
003.1-quiz-critere-classement.md,
003.2-quiz-apprentissage-supervise.md,
003.3-quiz-apprentissage-non-supervise.md,
003.4-quiz-apprentissage-renforcement.md,
003.5-quiz-paradigmes-intermediaires.md,
003.6-quiz-qualification-probleme.md
Próximo capítulo: 004-apprentissage-supervise.md