Os termos a seguir são usados na imprensa e nas redes como se fossem intercambiáveis. Eles não são.
Inteligência artificial · Machine Learning · Deep Learning
Data Science · Big Data · Algoritmo · Rede neuralEnquanto a taxonomia não estiver clara, o restante da área permanece confuso. Este capítulo a fixa definitivamente.
Relação de inclusão estrita:
Deep Learning ⊂ Machine Learning ⊂ Inteligência Artificial
Toda técnica de Deep Learning é Machine Learning. Toda técnica de Machine Learning pertence à Inteligência Artificial. As recíprocas são falsas.
Definição rigorosa
Campo da ciência da computação que visa conceber sistemas capazes de realizar tarefas que, executadas por um ser humano, seriam qualificadas como cognitivas: percepção, raciocínio, aprendizado, planejamento, decisão, compreensão da linguagem.
Definição operacional
Um sistema de IA é um sistema que, a partir de entradas provenientes de seu ambiente, produz saídas (previsões, recomendações, decisões, ações) que influenciam esse ambiente, segundo objetivos explícitos ou implícitos definidos por um humano.
Esta segunda formulação é próxima da definição adotada pela OCDE e retomada em vários marcos regulatórios. Ela é útil em contexto profissional porque é verificável.
Tradução em linguagem corrente
Fazer uma máquina executar uma tarefa que, em um humano, exigiria reflexão.
Natureza do conceito
A IA é um objetivo, não uma técnica. Ela agrupa abordagens heterogêneas, algumas das quais não envolvem nenhum aprendizado.
Marco temporal
O termo é cunhado em 1956 na conferência de Dartmouth. A área é, portanto, várias décadas anterior ao Machine Learning aplicado moderno.
É o contrassenso mais frequente.
| Técnica | Princípio | Aprendizado |
|---|---|---|
| Sistema baseado em regras | Um especialista humano formaliza as regras | Não |
| Busca em árvore | Exploração exaustiva ou heurística do espaço de estados | Não |
| Lógica formal | Inferência a partir de axiomas e regras de dedução | Não |
| Otimização combinatória | Busca de um ótimo sob restrições | Não |
| Machine Learning | Indução de regras a partir de observações | Sim |
Exemplo de IA sem aprendizado — um termostato programável
O sistema decide. Nenhuma regra foi induzida a partir de dados: elas foram escritas por um engenheiro. O comportamento será idêntico daqui a dez anos.
Exemplo de IA sem aprendizado — Deep Blue (1997)
O sistema que venceu Garry Kasparov avaliava cerca de 200 milhões de posições por segundo com a ajuda de uma função de avaliação concebida por humanos e grandes mestres. Ele não aprendia com suas partidas. Ele buscava em um espaço de estados.
Definição rigorosa (Tom Mitchell, 1997)
Um programa de computador aprende de uma experiência E, relativamente a uma classe de tarefas T e uma medida de desempenho P, se seu desempenho nas tarefas de T, medido por P, melhora com a experiência E.
Esta definição é a referência acadêmica. Ela tem o mérito de ser operacional: impõe nomear explicitamente os três componentes.
Aplicação da definição a um caso concreto
Detecção de spam:
Definição alternativa (Arthur Samuel, 1959)
Campo de estudo que dá aos computadores a capacidade de aprender sem terem sido explicitamente programados para a tarefa considerada.
Tradução em linguagem corrente
Em vez de escrever as regras, fornece-se um grande número de exemplos e o algoritmo induz as regras por si mesmo.
Natureza do conceito
O Machine Learning é uma abordagem dentro da IA. O conceito central é a indução: passar de casos particulares observados a uma regra geral.
| Entradas fornecidas | Saída produzida | |
|---|---|---|
| Programação clássica | Regras + Dados | Respostas |
| Machine Learning | Dados + Respostas | Regras |
Essa inversão é desenvolvida no capítulo 002.
Tarefa: determinar se uma imagem contém um gato.
Tentativa de formalização por regras:
SE orelhas triangulares E bigodes E pelagem ENTÃO gatoContraexemplos imediatos:
| Contraexemplo | Falha da regra |
|---|---|
| Uma raposa | Satisfaz as três condições, não é um gato |
| Um gato de costas | Bigodes não visíveis |
| Um gato sphynx | Ausência de pelagem |
| Um gato enrolado | Nenhuma estrutura identificável |
| Um filhote | Proporções diferentes |
O número de regras necessárias diverge sem jamais atingir uma cobertura satisfatória. A tarefa pertence à percepção, cujos critérios não são verbalizáveis pelos próprios humanos.
Formulação em Machine Learning
Nenhum adulto transmite a uma criança de três anos a seguinte definição:
"Um gato é um mamífero quadrúpede da família dos felídeos, caracterizado por orelhas triangulares eretas, vibrissas faciais e pupilas em fenda vertical."
A criança é exposta a centenas de ocorrências acompanhadas de um rótulo verbal: "olha, um gato". Ela acaba rotulando corretamente um indivíduo que nunca viu.
A regra não foi transmitida. Ela foi induzida a partir de exemplos rotulados. É exatamente a estrutura do aprendizado supervisionado.
| Condição | Justificativa | Ilustração |
|---|---|---|
| A regra não é formalizável | Os critérios não são verbalizáveis | Reconhecimento facial |
| O número de fatores e interações é elevado | A escrita manual diverge | Scoring de risco de cliente |
| O ambiente evolui | As regras ficam obsoletas | Detecção de fraude, spam |
| A personalização deve ser massiva | Uma regra por indivíduo é impossível | Recomendação em grande escala |
| Uma resposta aproximada é aceitável | O modelo produz uma estimativa, nunca uma certeza | Avaliação imobiliária |
| Existe um volume suficiente de dados rotulados | A indução requer observações | Histórico de transações |
| Situação | Razão | Alternativa |
|---|---|---|
| A regra exata é conhecida e estável | O modelo introduziria uma aproximação inútil | Implementar a fórmula |
| A exatidão é uma obrigação legal | Uma aproximação é juridicamente inadmissível | Regra explícita auditada |
| O volume de dados é insuficiente | A indução não tem fundamento estatístico | Expertise de negócio, coleta prévia |
| O erro é catastrófico e irrecuperável | Nenhum modelo atinge 100 % | Supervisão humana obrigatória |
| Não existe nenhum dado histórico | Nada a induzir | Estudo de mercado, prototipagem |
Princípio diretor: o Machine Learning é uma ferramenta de aproximação estatística. Ele só deve ser mobilizado quando a aproximação é aceitável e a formalização direta é impraticável.
Definição rigorosa
Subconjunto do Machine Learning baseado em redes neurais artificiais com várias camadas de transformação não lineares sucessivas, cada camada produzindo uma representação dos dados em um nível de abstração crescente, sendo essas representações aprendidas e não especificadas manualmente.
O ponto discriminante
O que caracteriza o Deep Learning não é a profundidade em si, mas o aprendizado automático das representações (representation learning). Em Machine Learning clássico, o engenheiro concebe as variáveis explicativas. Em Deep Learning, a rede constrói por si mesma uma hierarquia de representações intermediárias.
Origem do termo "profundo"
O qualificativo remete ao número de camadas empilhadas entre a entrada e a saída, isto é, à profundidade do grafo de computação. Ele não carrega nenhuma conotação qualitativa.
Tradução em linguagem corrente
Uma rede com muitos andares que constrói por si mesma, andar por andar, as características relevantes dos dados.
Ponto essencial: nenhuma dessas camadas foi especificada manualmente. A atribuição "camada 1 = contornos" é uma interpretação a posteriori do que a rede aprendeu. É precisamente essa propriedade que torna o Deep Learning poderoso e dificilmente interpretável.
| Critério | ML clássico | Deep Learning |
|---|---|---|
| Volume de dados requerido | 10² a 10⁵ observações | 10⁴ a 10⁷ e além |
| Recursos de computação | CPU padrão | GPU ou aceleradores dedicados |
| Tipo de dados de predileção | Dados tabulares estruturados | Dados não estruturados: imagem, som, texto, vídeo |
| Engenharia de variáveis | A cargo do engenheiro | Aprendida pela rede |
| Interpretabilidade | Elevada a média | Baixa sem ferramentas dedicadas |
| Prazo de implementação | Minutos a horas | Horas a semanas |
| Algoritmos representativos | Regressão, árvores, florestas aleatórias, gradient boosting | CNN, RNN, Transformers |
Constatação estabelecida pela prática industrial e pela literatura comparativa: em dados tabulares, os métodos de ensemble baseados em árvores (gradient boosting, florestas aleatórias) permanecem muito competitivos frente às arquiteturas profundas, oferecendo ao mesmo tempo tempos de treinamento inferiores em várias ordens de grandeza e uma interpretabilidade superior.
O Deep Learning conserva uma vantagem decisiva em dados não estruturados: visão computacional, processamento de sinal de áudio, processamento de linguagem natural, vídeo.
Este curso trata do Machine Learning supervisionado aplicado a dados tabulares, que constitui a maioria dos casos de uso em empresas.
Um martelo e uma escavadeira são ambos ferramentas válidas. A escolha não depende da potência intrínseca da ferramenta, mas da adequação à tarefa.
Pregar um prego com uma escavadeira é tecnicamente possível e operacionalmente absurdo: custo de mobilização desproporcional, precisão insuficiente, danos colaterais.
Demolir um prédio com um martelo é impossível, qualquer que seja o esforço.
A competência profissional não consiste em dominar a ferramenta mais poderosa, mas em selecionar a ferramenta adequada ao problema colocado.
Definição rigorosa
Disciplina interdisciplinar que combina estatística, computação e conhecimento do domínio de aplicação, tendo por objeto a extração de conhecimento e o apoio à decisão a partir de dados, ao longo de toda a cadeia: aquisição, preparação, exploração, modelagem, validação, comunicação.
Perímetro
A Data Science engloba o Machine Learning como um de seus componentes, ao lado da preparação dos dados, da análise exploratória, da inferência estatística e da restituição aos tomadores de decisão.
Distribuição empírica do esforço
As pesquisas profissionais situam geralmente entre 50 % e 80 % do tempo de um praticante na aquisição, limpeza e preparação dos dados. A modelagem propriamente dita representa uma fração minoritária da atividade.
Definição rigorosa
Conjunto de métodos que visam descrever, resumir e interpretar um conjunto de dados a fim de caracterizar fenômenos observados.
Distinção central
A análise de dados trata principalmente da explicação do passado e da caracterização do presente. A modelagem preditiva trata da estimativa de valores não observados, geralmente futuros.
Definição rigorosa
Conjunto de dados cujo volume, velocidade ou variedade excedem as capacidades de processamento dos sistemas de gestão de dados convencionais, impondo arquiteturas distribuídas.
As dimensões características
O modelo clássico retém três dimensões, frequentemente estendidas:
Ponto de atenção
Big Data e Machine Learning são noções ortogonais. O Big Data qualifica uma escala e uma arquitetura, não uma finalidade analítica. É possível explorar Big Data sem nenhum modelo preditivo, e construir modelos eficientes com alguns milhares de observações.
Ilustração em um caso único: uma operadora de telecomunicações constata uma erosão de sua base de clientes.
| Nível | Pergunta | Entregável | Ferramental |
|---|---|---|---|
| Descritivo | O que aconteceu? | "A taxa de cancelamento trimestral está em 8,2 %" | Consultas, dashboards |
| Diagnóstico | Por quê? | "O cancelamento está concentrado nos planos mensais com mais de dois contatos com o suporte" | Segmentação, testes estatísticos |
| Preditivo | O que vai acontecer? | "1 240 clientes apresentam uma probabilidade de rescisão superior a 0,70 em 30 dias" | Aprendizado supervisionado |
| Prescritivo | O que fazer? | "Direcionar 300 clientes com um desconto de 15 %; ganho líquido esperado de 84 000 $" | Otimização sob restrições |
O aprendizado supervisionado, objeto deste curso, opera no nível preditivo.
Ponto de atenção recorrente: o Deep Learning não constitui uma quarta família ao lado do supervisionado, do não supervisionado e do reforço. Trata-se de uma classe de modelos mobilizável nos três paradigmas.
| Termo | Tradução | Natureza do conceito | Definição condensada | Ilustração |
|---|---|---|---|---|
| Inteligência artificial | Inteligência artificial | Objetivo | Automatizar tarefas cognitivas | Planejador de rotas |
| Machine Learning | Aprendizado de máquina | Abordagem | Induzir regras a partir de dados | Filtragem de e-mails |
| Deep Learning | Aprendizado profundo | Classe de modelos | Redes multicamadas que aprendem suas representações | Reconhecimento de imagens |
| Aprendizado supervisionado | — | Paradigma | Indução a partir de exemplos rotulados | Estimativa de preços |
| Aprendizado não supervisionado | — | Paradigma | Descoberta de estrutura sem rótulos | Segmentação de clientes |
| Aprendizado por reforço | — | Paradigma | Otimização de uma política por recompensa | Controle robótico |
| Data Science | Ciência de dados | Disciplina | Cadeia completa de valorização dos dados | Função de negócio |
| Análise de dados | — | Atividade | Descrição e interpretação do existente | Dashboard |
| Big Data | Megadados | Escala e arquitetura | Volumetria que excede os sistemas convencionais | Registro de logs massivo |
| Algoritmo | — | Procedimento | Sequência finita de operações que produz um resultado | Random Forest |
| Modelo | — | Artefato | Resultado parametrizado da aplicação de um algoritmo aos dados | Arquivo serializado |
A IA designa um objetivo; o Machine Learning, uma abordagem entre outras para atingi-lo. Um sistema especialista baseado em regras pertence à IA sem pertencer ao Machine Learning.
Formulação correta: "O Machine Learning é uma abordagem da inteligência artificial baseada na indução a partir de dados."
O desempenho relativo depende da natureza dos dados. Em dados tabulares, os métodos de ensemble baseados em árvores permanecem muito competitivos, com um custo computacional e uma opacidade nitidamente menores.
Formulação correta: "A escolha entre Deep Learning e métodos clássicos é determinada pela natureza dos dados, pelo volume disponível, pelas restrições de interpretabilidade e pelo orçamento computacional."
O volume necessário depende da complexidade do fenômeno modelado e do número de variáveis explicativas, não de um limiar absoluto. Muitos modelos em produção se baseiam em alguns milhares de observações.
Formulação correta: "A qualidade e a representatividade dos dados prevalecem sobre o volume bruto."
O Deep Learning é uma classe de modelos. Uma rede neural treinada com dados rotulados pertence ao aprendizado supervisionado; um autoencoder pertence ao aprendizado não supervisionado; uma rede otimizada por recompensa pertence ao reforço.
Um modelo estatístico identifica regularidades em uma representação numérica. Ele não dispõe de nenhuma representação semântica do domínio.
Consequência operacional: os modos de falha de um modelo não coincidem com os de um operador humano. Um modelo pode falhar em casos triviais para um humano, ao mesmo tempo em que acerta em casos difíceis. Essa assimetria deve ser antecipada na concepção das salvaguardas.
TAXONOMIA
Deep Learning ⊂ Machine Learning ⊂ Inteligência Artificial
NATUREZA DOS CONCEITOS
IA : um objetivo
Machine Learning: uma abordagem baseada na indução
Deep Learning : uma classe de modelos
CRITÉRIO DISCRIMINANTE DO MACHINE LEARNING
As regras são induzidas a partir de observações,
não especificadas por um projetista.
CRITÉRIO DISCRIMINANTE DO DEEP LEARNING
As representações intermediárias são aprendidas,
não concebidas manualmente.
NÍVEIS ANALÍTICOS
Descritivo → Diagnóstico → PREDITIVO → Prescritivo
O aprendizado supervisionado opera no nível preditivo.
DEFINIÇÃO DE REFERÊNCIA (Mitchell, 1997)
Um programa aprende de uma experiência E relativamente a uma tarefa T
e uma medida de desempenho P se seu desempenho em T, medido
por P, melhora com E.Enunciado de síntese
O Machine Learning consiste em induzir uma regra de decisão a partir de observações em vez de especificá-la explicitamente; o aprendizado supervisionado é o paradigma no qual as observações vêm acompanhadas do valor-alvo a prever.
Quiz e perguntas de entrevista: 001.1-quiz-ia-ml-deep-learning.md
Próximo capítulo: 002-programmation-classique-vs-ml.md