Inteligência artificial, Machine Learning e Deep Learning

14 min
Bloco 0 — Situar o aprendizado supervisionado
Objetivo
dominar a taxonomia da área, saber definir rigorosamente cada termo e saber posicionar o aprendizado supervisionado nesse conjunto.
Duração estimada
25 minutos
Pré-requisitos
nenhum
Quiz associado
001.1-quiz-ia-ml-deep-learning.md

1. O problema do vocabulário

Os termos a seguir são usados na imprensa e nas redes como se fossem intercambiáveis. Eles não são.

Inteligência artificial · Machine Learning · Deep Learning
Data Science · Big Data · Algoritmo · Rede neural

Enquanto a taxonomia não estiver clara, o restante da área permanece confuso. Este capítulo a fixa definitivamente.


2. A taxonomia geral

Relação de inclusão estrita:

Deep Learning ⊂ Machine Learning ⊂ Inteligência Artificial

Toda técnica de Deep Learning é Machine Learning. Toda técnica de Machine Learning pertence à Inteligência Artificial. As recíprocas são falsas.


3. Inteligência artificial

DEFINIÇÃO — Inteligência artificial (Artificial Intelligence, AI)

Definição rigorosa

Campo da ciência da computação que visa conceber sistemas capazes de realizar tarefas que, executadas por um ser humano, seriam qualificadas como cognitivas: percepção, raciocínio, aprendizado, planejamento, decisão, compreensão da linguagem.

Definição operacional

Um sistema de IA é um sistema que, a partir de entradas provenientes de seu ambiente, produz saídas (previsões, recomendações, decisões, ações) que influenciam esse ambiente, segundo objetivos explícitos ou implícitos definidos por um humano.

Esta segunda formulação é próxima da definição adotada pela OCDE e retomada em vários marcos regulatórios. Ela é útil em contexto profissional porque é verificável.

Tradução em linguagem corrente

Fazer uma máquina executar uma tarefa que, em um humano, exigiria reflexão.

Natureza do conceito

A IA é um objetivo, não uma técnica. Ela agrupa abordagens heterogêneas, algumas das quais não envolvem nenhum aprendizado.

Marco temporal

O termo é cunhado em 1956 na conferência de Dartmouth. A área é, portanto, várias décadas anterior ao Machine Learning aplicado moderno.

3.1 A IA não implica aprendizado

É o contrassenso mais frequente.

TécnicaPrincípioAprendizado
Sistema baseado em regrasUm especialista humano formaliza as regrasNão
Busca em árvoreExploração exaustiva ou heurística do espaço de estadosNão
Lógica formalInferência a partir de axiomas e regras de deduçãoNão
Otimização combinatóriaBusca de um ótimo sob restriçõesNão
Machine LearningIndução de regras a partir de observaçõesSim

Exemplo de IA sem aprendizado — um termostato programável

O sistema decide. Nenhuma regra foi induzida a partir de dados: elas foram escritas por um engenheiro. O comportamento será idêntico daqui a dez anos.

Exemplo de IA sem aprendizado — Deep Blue (1997)

O sistema que venceu Garry Kasparov avaliava cerca de 200 milhões de posições por segundo com a ajuda de uma função de avaliação concebida por humanos e grandes mestres. Ele não aprendia com suas partidas. Ele buscava em um espaço de estados.


4. Machine Learning

DEFINIÇÃO — Machine Learning (aprendizado de máquina)

Definição rigorosa (Tom Mitchell, 1997)

Um programa de computador aprende de uma experiência E, relativamente a uma classe de tarefas T e uma medida de desempenho P, se seu desempenho nas tarefas de T, medido por P, melhora com a experiência E.

Esta definição é a referência acadêmica. Ela tem o mérito de ser operacional: impõe nomear explicitamente os três componentes.

Aplicação da definição a um caso concreto

Detecção de spam:

  • T (tarefa): classificar um e-mail como spam ou não spam
  • E (experiência): um corpus de e-mails previamente rotulados
  • P (desempenho): a proporção de e-mails corretamente classificados

Definição alternativa (Arthur Samuel, 1959)

Campo de estudo que dá aos computadores a capacidade de aprender sem terem sido explicitamente programados para a tarefa considerada.

Tradução em linguagem corrente

Em vez de escrever as regras, fornece-se um grande número de exemplos e o algoritmo induz as regras por si mesmo.

Natureza do conceito

O Machine Learning é uma abordagem dentro da IA. O conceito central é a indução: passar de casos particulares observados a uma regra geral.

4.1 A inversão do paradigma de programação

Entradas fornecidasSaída produzida
Programação clássicaRegras + DadosRespostas
Machine LearningDados + RespostasRegras

Essa inversão é desenvolvida no capítulo 002.

4.2 Ilustração: o limite da abordagem por regras

Tarefa: determinar se uma imagem contém um gato.

Tentativa de formalização por regras:

SE orelhas triangulares E bigodes E pelagem ENTÃO gato

Contraexemplos imediatos:

ContraexemploFalha da regra
Uma raposaSatisfaz as três condições, não é um gato
Um gato de costasBigodes não visíveis
Um gato sphynxAusência de pelagem
Um gato enroladoNenhuma estrutura identificável
Um filhoteProporções diferentes

O número de regras necessárias diverge sem jamais atingir uma cobertura satisfatória. A tarefa pertence à percepção, cujos critérios não são verbalizáveis pelos próprios humanos.

Formulação em Machine Learning

ANALOGIA — A aquisição da linguagem na criança

Nenhum adulto transmite a uma criança de três anos a seguinte definição:

"Um gato é um mamífero quadrúpede da família dos felídeos, caracterizado por orelhas triangulares eretas, vibrissas faciais e pupilas em fenda vertical."

A criança é exposta a centenas de ocorrências acompanhadas de um rótulo verbal: "olha, um gato". Ela acaba rotulando corretamente um indivíduo que nunca viu.

A regra não foi transmitida. Ela foi induzida a partir de exemplos rotulados. É exatamente a estrutura do aprendizado supervisionado.

4.3 Condições de aplicabilidade do Machine Learning

CondiçãoJustificativaIlustração
A regra não é formalizávelOs critérios não são verbalizáveisReconhecimento facial
O número de fatores e interações é elevadoA escrita manual divergeScoring de risco de cliente
O ambiente evoluiAs regras ficam obsoletasDetecção de fraude, spam
A personalização deve ser massivaUma regra por indivíduo é impossívelRecomendação em grande escala
Uma resposta aproximada é aceitávelO modelo produz uma estimativa, nunca uma certezaAvaliação imobiliária
Existe um volume suficiente de dados rotuladosA indução requer observaçõesHistórico de transações

4.4 Contraindicações

SituaçãoRazãoAlternativa
A regra exata é conhecida e estávelO modelo introduziria uma aproximação inútilImplementar a fórmula
A exatidão é uma obrigação legalUma aproximação é juridicamente inadmissívelRegra explícita auditada
O volume de dados é insuficienteA indução não tem fundamento estatísticoExpertise de negócio, coleta prévia
O erro é catastrófico e irrecuperávelNenhum modelo atinge 100 %Supervisão humana obrigatória
Não existe nenhum dado históricoNada a induzirEstudo de mercado, prototipagem

Princípio diretor: o Machine Learning é uma ferramenta de aproximação estatística. Ele só deve ser mobilizado quando a aproximação é aceitável e a formalização direta é impraticável.


5. Deep Learning

DEFINIÇÃO — Deep Learning (aprendizado profundo)

Definição rigorosa

Subconjunto do Machine Learning baseado em redes neurais artificiais com várias camadas de transformação não lineares sucessivas, cada camada produzindo uma representação dos dados em um nível de abstração crescente, sendo essas representações aprendidas e não especificadas manualmente.

O ponto discriminante

O que caracteriza o Deep Learning não é a profundidade em si, mas o aprendizado automático das representações (representation learning). Em Machine Learning clássico, o engenheiro concebe as variáveis explicativas. Em Deep Learning, a rede constrói por si mesma uma hierarquia de representações intermediárias.

Origem do termo "profundo"

O qualificativo remete ao número de camadas empilhadas entre a entrada e a saída, isto é, à profundidade do grafo de computação. Ele não carrega nenhuma conotação qualitativa.

Tradução em linguagem corrente

Uma rede com muitos andares que constrói por si mesma, andar por andar, as características relevantes dos dados.

5.1 A hierarquia de representações

Ponto essencial: nenhuma dessas camadas foi especificada manualmente. A atribuição "camada 1 = contornos" é uma interpretação a posteriori do que a rede aprendeu. É precisamente essa propriedade que torna o Deep Learning poderoso e dificilmente interpretável.

5.2 Comparação Machine Learning clássico / Deep Learning

CritérioML clássicoDeep Learning
Volume de dados requerido10² a 10⁵ observações10⁴ a 10⁷ e além
Recursos de computaçãoCPU padrãoGPU ou aceleradores dedicados
Tipo de dados de predileçãoDados tabulares estruturadosDados não estruturados: imagem, som, texto, vídeo
Engenharia de variáveisA cargo do engenheiroAprendida pela rede
InterpretabilidadeElevada a médiaBaixa sem ferramentas dedicadas
Prazo de implementaçãoMinutos a horasHoras a semanas
Algoritmos representativosRegressão, árvores, florestas aleatórias, gradient boostingCNN, RNN, Transformers

5.3 Posicionamento prático

Constatação estabelecida pela prática industrial e pela literatura comparativa: em dados tabulares, os métodos de ensemble baseados em árvores (gradient boosting, florestas aleatórias) permanecem muito competitivos frente às arquiteturas profundas, oferecendo ao mesmo tempo tempos de treinamento inferiores em várias ordens de grandeza e uma interpretabilidade superior.

O Deep Learning conserva uma vantagem decisiva em dados não estruturados: visão computacional, processamento de sinal de áudio, processamento de linguagem natural, vídeo.

Este curso trata do Machine Learning supervisionado aplicado a dados tabulares, que constitui a maioria dos casos de uso em empresas.

ANALOGIA — Adequação da ferramenta ao problema

Um martelo e uma escavadeira são ambos ferramentas válidas. A escolha não depende da potência intrínseca da ferramenta, mas da adequação à tarefa.

Pregar um prego com uma escavadeira é tecnicamente possível e operacionalmente absurdo: custo de mobilização desproporcional, precisão insuficiente, danos colaterais.

Demolir um prédio com um martelo é impossível, qualquer que seja o esforço.

A competência profissional não consiste em dominar a ferramenta mais poderosa, mas em selecionar a ferramenta adequada ao problema colocado.


6. Data Science, análise de dados, Big Data

DEFINIÇÃO — Data Science (ciência de dados)

Definição rigorosa

Disciplina interdisciplinar que combina estatística, computação e conhecimento do domínio de aplicação, tendo por objeto a extração de conhecimento e o apoio à decisão a partir de dados, ao longo de toda a cadeia: aquisição, preparação, exploração, modelagem, validação, comunicação.

Perímetro

A Data Science engloba o Machine Learning como um de seus componentes, ao lado da preparação dos dados, da análise exploratória, da inferência estatística e da restituição aos tomadores de decisão.

Distribuição empírica do esforço

As pesquisas profissionais situam geralmente entre 50 % e 80 % do tempo de um praticante na aquisição, limpeza e preparação dos dados. A modelagem propriamente dita representa uma fração minoritária da atividade.

DEFINIÇÃO — Análise de dados (Data Analysis)

Definição rigorosa

Conjunto de métodos que visam descrever, resumir e interpretar um conjunto de dados a fim de caracterizar fenômenos observados.

Distinção central

A análise de dados trata principalmente da explicação do passado e da caracterização do presente. A modelagem preditiva trata da estimativa de valores não observados, geralmente futuros.

DEFINIÇÃO — Big Data

Definição rigorosa

Conjunto de dados cujo volume, velocidade ou variedade excedem as capacidades de processamento dos sistemas de gestão de dados convencionais, impondo arquiteturas distribuídas.

As dimensões características

O modelo clássico retém três dimensões, frequentemente estendidas:

  • Volume: a quantidade de dados
  • Velocidade: a taxa de produção e a exigência de processamento
  • Variedade: a heterogeneidade dos formatos
  • Extensões frequentes: Veracidade (confiabilidade), Valor (utilidade de negócio)

Ponto de atenção

Big Data e Machine Learning são noções ortogonais. O Big Data qualifica uma escala e uma arquitetura, não uma finalidade analítica. É possível explorar Big Data sem nenhum modelo preditivo, e construir modelos eficientes com alguns milhares de observações.


7. Os quatro níveis de maturidade analítica

Ilustração em um caso único: uma operadora de telecomunicações constata uma erosão de sua base de clientes.

NívelPerguntaEntregávelFerramental
DescritivoO que aconteceu?"A taxa de cancelamento trimestral está em 8,2 %"Consultas, dashboards
DiagnósticoPor quê?"O cancelamento está concentrado nos planos mensais com mais de dois contatos com o suporte"Segmentação, testes estatísticos
PreditivoO que vai acontecer?"1 240 clientes apresentam uma probabilidade de rescisão superior a 0,70 em 30 dias"Aprendizado supervisionado
PrescritivoO que fazer?"Direcionar 300 clientes com um desconto de 15 %; ganho líquido esperado de 84 000 $"Otimização sob restrições

O aprendizado supervisionado, objeto deste curso, opera no nível preditivo.


8. Posicionamento do aprendizado supervisionado

Ponto de atenção recorrente: o Deep Learning não constitui uma quarta família ao lado do supervisionado, do não supervisionado e do reforço. Trata-se de uma classe de modelos mobilizável nos três paradigmas.


9. Tabela de síntese terminológica

TermoTraduçãoNatureza do conceitoDefinição condensadaIlustração
Inteligência artificialInteligência artificialObjetivoAutomatizar tarefas cognitivasPlanejador de rotas
Machine LearningAprendizado de máquinaAbordagemInduzir regras a partir de dadosFiltragem de e-mails
Deep LearningAprendizado profundoClasse de modelosRedes multicamadas que aprendem suas representaçõesReconhecimento de imagens
Aprendizado supervisionadoParadigmaIndução a partir de exemplos rotuladosEstimativa de preços
Aprendizado não supervisionadoParadigmaDescoberta de estrutura sem rótulosSegmentação de clientes
Aprendizado por reforçoParadigmaOtimização de uma política por recompensaControle robótico
Data ScienceCiência de dadosDisciplinaCadeia completa de valorização dos dadosFunção de negócio
Análise de dadosAtividadeDescrição e interpretação do existenteDashboard
Big DataMegadadosEscala e arquiteturaVolumetria que excede os sistemas convencionaisRegistro de logs massivo
AlgoritmoProcedimentoSequência finita de operações que produz um resultadoRandom Forest
ModeloArtefatoResultado parametrizado da aplicação de um algoritmo aos dadosArquivo serializado

10. Erros de raciocínio frequentes

ERRO — Assimilar IA e Machine Learning

A IA designa um objetivo; o Machine Learning, uma abordagem entre outras para atingi-lo. Um sistema especialista baseado em regras pertence à IA sem pertencer ao Machine Learning.

Formulação correta: "O Machine Learning é uma abordagem da inteligência artificial baseada na indução a partir de dados."

ERRO — Postular uma superioridade geral do Deep Learning

O desempenho relativo depende da natureza dos dados. Em dados tabulares, os métodos de ensemble baseados em árvores permanecem muito competitivos, com um custo computacional e uma opacidade nitidamente menores.

Formulação correta: "A escolha entre Deep Learning e métodos clássicos é determinada pela natureza dos dados, pelo volume disponível, pelas restrições de interpretabilidade e pelo orçamento computacional."

ERRO — Condicionar o Machine Learning ao Big Data

O volume necessário depende da complexidade do fenômeno modelado e do número de variáveis explicativas, não de um limiar absoluto. Muitos modelos em produção se baseiam em alguns milhares de observações.

Formulação correta: "A qualidade e a representatividade dos dados prevalecem sobre o volume bruto."

ERRO — Tratar o Deep Learning como um paradigma de aprendizado

O Deep Learning é uma classe de modelos. Uma rede neural treinada com dados rotulados pertence ao aprendizado supervisionado; um autoencoder pertence ao aprendizado não supervisionado; uma rede otimizada por recompensa pertence ao reforço.

ERRO — Atribuir uma compreensão semântica ao modelo

Um modelo estatístico identifica regularidades em uma representação numérica. Ele não dispõe de nenhuma representação semântica do domínio.

Consequência operacional: os modos de falha de um modelo não coincidem com os de um operador humano. Um modelo pode falhar em casos triviais para um humano, ao mesmo tempo em que acerta em casos difíceis. Essa assimetria deve ser antecipada na concepção das salvaguardas.


11. Síntese

TAXONOMIA
    Deep Learning ⊂ Machine Learning ⊂ Inteligência Artificial

NATUREZA DOS CONCEITOS
    IA              : um objetivo
    Machine Learning: uma abordagem baseada na indução
    Deep Learning   : uma classe de modelos

CRITÉRIO DISCRIMINANTE DO MACHINE LEARNING
    As regras são induzidas a partir de observações,
    não especificadas por um projetista.

CRITÉRIO DISCRIMINANTE DO DEEP LEARNING
    As representações intermediárias são aprendidas,
    não concebidas manualmente.

NÍVEIS ANALÍTICOS
    Descritivo → Diagnóstico → PREDITIVO → Prescritivo
    O aprendizado supervisionado opera no nível preditivo.

DEFINIÇÃO DE REFERÊNCIA (Mitchell, 1997)
    Um programa aprende de uma experiência E relativamente a uma tarefa T
    e uma medida de desempenho P se seu desempenho em T, medido
    por P, melhora com E.

Enunciado de síntese

O Machine Learning consiste em induzir uma regra de decisão a partir de observações em vez de especificá-la explicitamente; o aprendizado supervisionado é o paradigma no qual as observações vêm acompanhadas do valor-alvo a prever.


Quiz e perguntas de entrevista: 001.1-quiz-ia-ml-deep-learning.md

Próximo capítulo: 002-programmation-classique-vs-ml.md