Os quatro enunciados a seguir são frequentemente encontrados em relatórios de projeto. Três estão incorretos.
| Enunciado | Status | Motivo |
|---|---|---|
| « Treinamos um Random Forest com 40 000 observações. » | Aceitável | Elipse admitida: treinar com o algoritmo Random Forest |
| « O algoritmo prevê uma probabilidade de cancelamento de 0,72. » | Incorreto | Um algoritmo não prevê; o modelo produz a predição |
| « Implantamos um XGBoost em produção. » | Incorreto | O que é implantado é um modelo oriundo do XGBoost, não a biblioteca |
| « O algoritmo aprendeu que a antiguidade reduz o risco. » | Incorreto | O algoritmo executa um procedimento; a informação aprendida reside nos parâmetros do modelo |
A diferença não é puramente lexical: o que é versionado, o que é reprodutível, o que deve ser reexecutado quando os dados evoluem e o que é transmitido à operação não são os mesmos objetos conforme se fale do algoritmo ou do modelo (ponto 3).
Definição rigorosa. Sequência finita e não ambígua de operações elementares que permite, a partir de entradas pertencentes a um domínio especificado, produzir uma saída em um número finito de etapas. A caracterização clássica retém cinco propriedades (Knuth, The Art of Computer Programming, 1968): finitude, definição não ambígua de cada etapa, entradas especificadas, saídas especificadas, efetividade das operações.
Tradução em linguagem corrente. Um método escrito de uma vez por todas, descrevendo o que deve ser feito e em que ordem, independentemente dos valores sobre os quais será executado.
Ponto de atenção. Um algoritmo é uma descrição de procedimento: não tem estado, não contém nenhum conhecimento sobre um domínio particular e não muda quando os dados mudam.
Definição rigorosa. Caso particular do anterior: procedimento que, aplicado a um conjunto de dados D = {(x₁, y₁), …, (xₙ, yₙ)} e a uma configuração de hiperparâmetros λ, seleciona um elemento ĥ de um espaço de hipóteses H segundo um critério explícito avaliado sobre D. Formalmente, A : (D, λ) ⟼ ĥ ∈ H.
Tradução em linguagem corrente. O método que, a partir de uma tabela de exemplos já rotulados, fabrica a regra de decisão. Ele descreve como buscar, não o que será encontrado. Três elementos devem ser nomeados para que ele seja especificado: o espaço de hipóteses percorrido (ponto 1.3), o critério avaliado sobre os dados, e a estratégia de busca (ponto 4.2).
Ponto de atenção. O algoritmo é idêntico para todos os projetos que
o empregam: RandomForestClassifier é o mesmo para todos os usuários de uma
versão dada do scikit-learn. O que difere de um projeto para outro é o modelo
produzido, jamais o algoritmo.
Definição rigorosa. Conjunto H de todas as funções candidatas
h : X → Y que o algoritmo é estruturalmente capaz de produzir, X designando
o espaço das variáveis explicativas e Y o da variável-alvo. H é
determinado conjuntamente pela família de funções escolhida e pelos
hiperparâmetros que restringem sua forma: fixar max_depth=3 não modifica o
algoritmo, mas restringe H às árvores de profundidade no máximo 3.
Tradução em linguagem corrente. O conjunto de todas as regras que o método tem o direito de fabricar: ele jamais produzirá uma regra ausente desse conjunto, qualquer que seja a quantidade de dados fornecida. Para uma regressão linear com duas variáveis, H é o conjunto das funções h(x) = β₀ + β₁x₁ + β₂x₂, de cardinalidade infinita mas parametrizado por três reais; nenhum conjunto de dados permitirá produzir nele uma função em escada ou periódica.
Ponto de atenção. Um modelo com baixo desempenho o é por duas razões distintas: a função correta não pertence a H (erro de aproximação, ligado à escolha do algoritmo), ou ela pertence a H sem ter sido encontrada (erro de estimação, ligado aos dados e à otimização) — capítulo 032.
Definição rigorosa (Mitchell, 1980). Conjunto das hipóteses suplementares, não dedutíveis dos dados de treinamento, que um algoritmo mobiliza para preferir certas generalizações a outras entre aquelas compatíveis com os dados observados. Manifesta-se sob duas formas: a restrição do espaço de hipóteses e a preferência dentro de H, por exemplo pela hipótese mais simples a desempenho igual.
Tradução em linguagem corrente. Um conjunto de exemplos jamais determina uma única regra: uma infinidade de regras passa pelos mesmos pontos. O viés indutivo é o conjunto das preferências integradas ao método, que decidem entre essas regras.
Resultado associado (Wolpert, 1996 — No Free Lunch). Em média sobre o conjunto de todos os problemas possíveis, nenhum algoritmo é superior a outro: seu desempenho em um problema dado provém da adequação entre seu viés indutivo e a estrutura real do fenômeno. Escolher um algoritmo equivale portanto a apostar nessa estrutura (capítulo 049).
Ponto de atenção. Um aprendizado sem viés indutivo é impossível: um algoritmo desprovido de toda preferência não poderia afirmar nada sobre uma observação ausente do conjunto de treinamento.
| Algoritmo | Espaço de hipóteses H | Forma de uma hipótese | Viés indutivo principal |
|---|---|---|---|
| Regressão linear | Funções afins de X | Soma ponderada das variáveis | Linearidade e aditividade dos efeitos |
| Regressão logística | Logísticas de funções afins | Sigmoide de uma combinação linear | Fronteira de decisão linear |
| Árvore de decisão (CART) | Partições de X por cortes ortogonais aos eixos | Sequência de testes de limiar, constante por folha | Cortes paralelos aos eixos, preferência por árvores curtas |
| k vizinhos mais próximos | Funções constantes por vizinhança | Voto ou média local | Continuidade local: duas observações próximas têm alvos próximos |
| Naive Bayes | Distribuições condicionais fatoradas | Produto de verossimilhanças por variável | Independência condicional das variáveis dada a classe |
| Perceptron multicamadas | Composições de aplicações afins e de não linearidades | Grafo de cálculo em camadas | Composicionalidade e regularidade das funções representáveis |
Leitura: cada linha descreve uma aposta diferente sobre a estrutura do fenômeno. Um efeito de limiar marcado será mal atendido por uma regressão linear e bem atendido por uma árvore; um fenômeno aditivo e suave, o inverso.
Definição rigorosa. Elemento ĥ ∈ H selecionado pelo algoritmo A ao final de sua execução sobre um conjunto de dados D com hiperparâmetros λ. O modelo é inteiramente especificado por dois componentes: uma estrutura — a forma funcional, fixada por A e λ — e um conjunto de valores de parâmetros ajustado a partir de D.
Definição operacional. Artefato de software que implementa uma função determinística das variáveis explicativas para o espaço de saída, cujo comportamento depende integralmente do conjunto de dados sobre o qual foi ajustado, e que pode ser serializado, versionado, transportado e avaliado independentemente do procedimento que o produziu.
Tradução em linguagem corrente. O resultado do treinamento: uma regra de decisão congelada, em memória ou em arquivo, que responde a uma pergunta precisa para uma observação dada.
Ponto de atenção. O modelo não é o arquivo: este não é senão um
suporte de serialização, do mesmo modo que uma partitura não é a música. Um
mesmo modelo se exporta em joblib, em ONNX ou em PMML sem mudar de natureza.
| Família de modelos | Estrutura fixada pelo algoritmo e λ | Parâmetros ajustados sobre os dados | Ordem de grandeza |
|---|---|---|---|
| Regressão linear com p variáveis | Uma equação afim | p coeficientes e uma constante | p + 1 |
| Regressão logística com p variáveis | Uma equação afim composta com uma logística | p coeficientes e uma constante | p + 1 |
| Árvore de decisão | Uma árvore binária de profundidade limitada | Variável e limiar de cada nó, valor de cada folha | 10¹ a 10³ |
| Floresta aleatória de 200 árvores | 200 árvores agregadas por voto ou média | Todos os parâmetros das 200 árvores | 10⁴ a 10⁷ |
| k vizinhos mais próximos | Uma métrica e um inteiro k | Nenhum no sentido estrito: o conjunto de treinamento é memorizado | n × p valores armazenados |
| Perceptron multicamadas | Número de camadas, larguras, ativações | Pesos e vieses de todas as conexões | 10³ a 10¹¹ |
Ponto de atenção — os k vizinhos mais próximos. Esse algoritmo não produz parâmetros no sentido usual: ele conserva as observações de treinamento e adia todo cálculo para o momento da predição (modelo preguiçoso, lazy learner). A definição do modelo como artefato permanece válida: a estrutura é a regra de voto sobre os k vizinhos, o conteúdo ajustado é o conjunto memorizado (capítulo 040).
A fronteira entre o que é regulado pelo humano e o que é aprendido é objeto do capítulo 009; o princípio aqui é que os hiperparâmetros definem H e que os parâmetros designam o elemento retido em H.
No scikit-learn, os atributos cujo nome termina por um caractere de sublinhado só existem após o treinamento: sua presença é o critério operacional que distingue um algoritmo instanciado de um modelo.
from sklearn.linear_model import LinearRegression
def appris(objet):
return [a for a in dir(objet) if a.endswith("_") and not a.startswith("_")]
estimateur = LinearRegression()
print("Avant fit — hyperparamètres :", estimateur.get_params())
print("Avant fit — attributs appris :", appris(estimateur))
estimateur.fit(X, y)
print("Après fit — attributs appris :", appris(estimateur))Avant fit — hyperparamètres : {'copy_X': True, 'fit_intercept': True,
'n_jobs': None, 'positive': False, 'tol': 1e-06}
Avant fit — attributs appris : []
Après fit — attributs appris : ['coef_', 'feature_names_in_', 'intercept_',
'n_features_in_', 'rank_', 'singular_']Interpretação: antes da chamada, o objeto materializa o algoritmo e o espaço
de hipóteses, com seus hiperparâmetros preenchidos e seu conhecimento nulo. Depois,
coef_ e intercept_ carregam a informação induzida dos dados, e
n_features_in_ assim como feature_names_in_ registram o esquema de entrada esperado
(ponto 5.2). O mesmo objeto desempenha sucessivamente dois papéis: o scikit-learn chama
estimator o objeto tanto antes como depois do fit.
| Critério | Algoritmo de aprendizado | Modelo |
|---|---|---|
| Natureza | Um procedimento | Um artefato |
| Momento de existência | Antes de qualquer dado | Após o treinamento |
| Dependência dos dados | Nula | Total |
| Conteúdo | Instruções | Uma estrutura e valores de parâmetros |
| Determinado por | Uma escolha de projeto humana | Os dados de treinamento |
| Suporte material | Código, uma biblioteca instalada | Um objeto em memória, um arquivo serializado |
| Unicidade | Um algoritmo, numerosos modelos | Um modelo para um treinamento datado |
| O que é versionado | Uma dependência de software (scikit-learn==1.8.0) | Um entregável identificado (modele_attrition_v3.joblib) |
| O que é implantado | Não, salvo para retreinar | Sim |
| Envelhecimento | Por obsolescência da biblioteca | Por deriva da distribuição dos dados (capítulo 082) |
Uma receita é um texto: ela não se come, não vence, permanece idêntica qualquer que seja o número de vezes em que é executada e se fotocopia sem perda. O bolo é um objeto: resulta da execução da receita sobre ingredientes precisos, em um forno regulado de certa maneira, em um dia dado. Dois bolos oriundos da mesma receita diferem se os ingredientes diferem; o bolo se transporta, se data, vence.
| Elemento culinário | Correspondente em aprendizado supervisionado | Justificativa |
|---|---|---|
| A receita escrita | O algoritmo de aprendizado | Procedimento reprodutível, independente de qualquer execução |
| Os ingredientes | O conjunto de dados de treinamento | Matéria-prima consumida pelo procedimento |
| A regulagem do forno e o tempo de cozimento | Os hiperparâmetros | Fixados antes da execução, por um humano, não deduzidos da matéria |
| O ato de assar | O treinamento | Execução do procedimento sobre a matéria-prima |
| O bolo obtido | O modelo | Resultado único, datado, dependente integralmente dos ingredientes |
| Uma fatia servida a um convidado | Uma predição | Uso do resultado sobre um caso particular |
| Enviar a receita a um convidado com fome | Implantar o algoritmo em vez do modelo | O convidado deveria comprar os ingredientes e assar ele mesmo |
| O bolo embalado e entregue | O modelo serializado e implantado | O que é efetivamente transmitido ao consumidor |
| Refazer uma fornada com ingredientes frescos | O retreinamento | Mesma receita, nova matéria, novo resultado |
Limites da analogia. O bolo é um objeto passivo, enquanto o modelo é uma função de entrada para saída (ponto 5.2); uma fatia consumida não está mais disponível, enquanto um modelo produz um número ilimitado de predições sem se esgotar; enfim o bolo vence por alteração física, enquanto o arquivo de um modelo não se degrada — é a distribuição dos dados de produção que se afasta da do treinamento (capítulo 082).
O código a seguir aplica um algoritmo único a dois conjuntos de dados que descrevem o mesmo fenômeno — o preço de um imóvel segundo sua área, seu número de cômodos e sua idade — em dois mercados imobiliários distintos.
Cada conjunto comporta 800 transações descritas por três variáveis explicativas.
import pandas as pd
from sklearn.linear_model import LinearRegression
VARIABLES = ["surface_m2", "nb_pieces", "age_bien"]
lyon, nantes = pd.read_csv("marche_lyon.csv"), pd.read_csv("marche_nantes.csv")
X_lyon, y_lyon = lyon[VARIABLES], lyon["prix"]
X_nantes, y_nantes = nantes[VARIABLES], nantes["prix"]
modele_lyon = LinearRegression().fit(X_lyon, y_lyon)
modele_nantes = LinearRegression().fit(X_nantes, y_nantes)
print("Même classe d'algorithme :", type(modele_lyon) is type(modele_nantes))
for nom, m in [("LYON", modele_lyon), ("NANTES", modele_nantes)]:
print(f"{nom:7s} constante = {m.intercept_:>10,.1f} | " +
" | ".join(f"{v} = {c:,.1f}" for v, c in zip(X_lyon.columns, m.coef_)))
bien = pd.DataFrame([{"surface_m2": 85, "nb_pieces": 4, "age_bien": 12}])
print("Prédiction Lyon :", round(float(modele_lyon.predict(bien)[0]), 1))
print("Prédiction Nantes :", round(float(modele_nantes.predict(bien)[0]), 1))Même classe d'algorithme : True
LYON constante = 43,617.1 | surface_m2 = 3,201.6 | nb_pieces = 8,090.7 | age_bien = -878.3
NANTES constante = 30,521.4 | surface_m2 = 1,904.5 | nb_pieces = 4,658.9 | age_bien = -1,473.9
Prédiction Lyon : 337575.3
Prédiction Nantes : 193349.8Interpretação. Uma única classe de algoritmo foi instanciada, sem modificar nenhum hiperparâmetro. Os dois objetos compartilham o mesmo tipo e a mesma estrutura — uma equação afim com três variáveis — e diferem unicamente pelos valores de seus quatro parâmetros, oriundos integralmente dos dados. A diferença é de natureza de negócio: o modelo de Lyon valoriza o metro quadrado em cerca de 3 200 unidades monetárias, o de Nantes em cerca de 1 900, e o desconto ligado à idade é quase 1,7 vezes mais forte no segundo mercado. Interrogados sobre o mesmo imóvel, eles respondem 337 575 e 193 350: nenhum se engana, eles codificam dois mercados diferentes.
Consequência direta: « usamos uma regressão linear » não identifica um sistema de predição, mas nomeia o viés indutivo escolhido. O sistema é identificado pelo par (modelo, conjunto de treinamento), datado.
O modelo no sentido estrito — estrutura e parâmetros do estimador final — não basta para produzir uma predição em produção. Uma observação bruta deve sofrer exatamente as mesmas transformações que os dados de treinamento: imputação com os mesmos valores de substituição, codificação com as mesmas modalidades de referência, escalonamento com as mesmas médias e desvios-padrão. Essas transformações comportam elas próprias parâmetros ajustados sobre o treinamento: elas fazem parte do que é aprendido e devem ser serializadas com o estimador.
Definição rigorosa. Conversão do estado completo de um objeto em memória — estrutura e valores de parâmetros — em uma sequência de bytes persistente, permitindo sua reconstituição ulterior em um processo distinto com um comportamento funcionalmente idêntico.
Tradução em linguagem corrente. Gravar o modelo em um arquivo de maneira
a poder recarregá-lo mais tarde, em outro lugar, sem ter que retreiná-lo. Os formatos
usuais são joblib e pickle (ecossistema Python, dependentes das versões), ONNX
(interoperável entre linguagens e motores de execução), PMML (padrão XML, famílias
de modelos limitadas) e os formatos nativos de biblioteca, tal como Booster.save_model
para XGBoost e LightGBM.
Ponto de atenção. Um arquivo joblib ou pickle reconstrói objetos Python
arbitrários na leitura: carregá-lo sem dominar sua proveniência equivale a
executar código não verificado. Além disso, a desserialização sob uma versão de
biblioteca diferente não é garantida: a versão deve ser registrada nos
metadados e verificada no carregamento.
import os, joblib, sklearn, numpy as np
from sklearn.compose import ColumnTransformer
from sklearn.ensemble import RandomForestClassifier
from sklearn.impute import SimpleImputer
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import OneHotEncoder, StandardScaler
num = ["anciennete_mois", "facture_mensuelle", "nb_appels_support"]
cat = ["type_forfait"]
pipeline = Pipeline([
("preparation", ColumnTransformer([
("num", Pipeline([("imputation", SimpleImputer(strategy="median")),
("mise_a_echelle", StandardScaler())]), num),
("cat", OneHotEncoder(handle_unknown="ignore"), cat)])),
("modele", RandomForestClassifier(n_estimators=200, max_depth=8,
random_state=42))]).fit(df, y)
artefact = {"pipeline": pipeline, "version_sklearn": sklearn.__version__,
"colonnes_attendues": num + cat, "seuil_decision": 0.42,
"date_entrainement": "2026-08-22"}
joblib.dump(artefact, "modele_attrition_v3.joblib", compress=3)
print("Taille :", round(os.path.getsize("modele_attrition_v3.joblib")/1024, 1), "Ko")
recharge = joblib.load("modele_attrition_v3.joblib")
p_memoire = pipeline.predict_proba(df.head(5))[:, 1]
p_recharge = recharge["pipeline"].predict_proba(df.head(5))[:, 1]
print("Probabilités rechargées :", np.round(p_recharge, 4))
print("Identité stricte :", np.array_equal(p_memoire, p_recharge))
print("Version et seuil :", recharge["version_sklearn"], recharge["seuil_decision"])Taille : 1242.5 Ko
Probabilités rechargées : [0.0678 0.0711 0.0735 0.2408 0.0108]
Identité stricte : True
Version et seuil : 1.8.0 0.42Interpretação. O arquivo pesa 1,2 MB enquanto o conjunto de treinamento comporta apenas alguns milhares de linhas: esse volume é o das 200 árvores, isto é, dos parâmetros aprendidos, e depende da estrutura escolhida, não do volume de dados. O recarregamento restitui probabilidades estritamente idênticas: um modelo é determinístico, e toda variação observada em produção sem retreinamento sinaliza uma diferença nas entradas ou no ambiente de execução, jamais no modelo. Enfim, o artefato não se reduz ao pipeline: o limiar de decisão (capítulo 062) é uma decisão de negócio exterior aos parâmetros, e a versão de biblioteca assim como a lista ordenada das colunas condicionam a validade do carregamento.
Definição rigorosa. Execução do algoritmo A sobre um conjunto de dados D com hiperparâmetros λ, consistindo em selecionar em H a hipótese ĥ que otimiza um critério explícito avaliado sobre D, eventualmente acompanhado de um termo de regularização:
ĥ = argmin sobre h ∈ H de [ (1/n) · Σᵢ L(h(xᵢ), yᵢ) + Ω(h) ]
onde L designa a função de custo e Ω um termo que penaliza a complexidade da hipótese. Esse quadro é o da minimização do risco empírico (Vapnik). A quantidade minimizada é medida sobre a amostra de treinamento, não sobre a população: essa diferença é a origem do sobreajuste (capítulo 031).
Tradução em linguagem corrente. A fase de estudo: o algoritmo percorre os exemplos corrigidos, ajusta seus parâmetros para errar o menos possível sobre esses exemplos, e para quando o critério não melhora mais significativamente.
O que o treinamento não faz. Ele não modifica os hiperparâmetros, que
permanecem tais como fornecidos; ele não acumula as chamadas sucessivas, um segundo fit
sobrescrevendo integralmente o estado anterior salvo recurso a partial_fit ou
warm_start; ele não avalia o modelo produzido, a avaliação exigindo dados
não vistos.
Ponto de atenção. O critério otimizado durante o treinamento (a função de custo) e o critério de avaliação de negócio (a métrica) são distintos e coincidem raramente (capítulo 030).
Modificar um desses três componentes produz um modelo diferente, a conjunto de dados constante.
| Algoritmo | Estratégia de busca em H | Determinismo a dados constantes |
|---|---|---|
| Regressão linear (mínimos quadrados) | Solução analítica ou decomposição matricial | Sim |
| Regressão logística | Otimização numérica convexa iterativa | Sim, a solver e tolerância fixados |
| Árvore de decisão | Busca gulosa, corte ótimo local por nó | Sim se nenhum sorteio aleatório de variáveis |
| Floresta aleatória | Árvores construídas sobre amostras e subespaços sorteados ao acaso | Não, salvo semente fixada |
| Gradient boosting | Adição sequencial de aprendizes que corrigem os resíduos | Não, salvo semente fixada |
| k vizinhos mais próximos | Nenhuma busca: memorização do conjunto de treinamento | Sim |
| Perceptron multicamadas | Descida de gradiente estocástica por retropropagação | Não, salvo semente fixada e execução determinística imposta |
Ponto de atenção: para os algoritmos marcados « Não », dois treinamentos
sucessivos sobre o mesmo conjunto com os mesmos hiperparâmetros produzem dois modelos
diferentes. A fixação de uma semente (random_state) condiciona a reprodutibilidade
do entregável e deve figurar nos metadados.
Definição rigorosa. Avaliação da função ĥ em um ponto x do espaço das variáveis explicativas, produzindo um valor ŷ = ĥ(x) do espaço de saída. A observação x não pertence necessariamente ao conjunto de treinamento; o interesse operacional reside precisamente no caso em que ela não pertence a ele.
Tradução em linguagem corrente. Dar uma resposta para um caso novo, aplicando a regra aprendida. A convenção distingue y, valor real observado, e ŷ, valor produzido pelo modelo; sua diferença é o resíduo (capítulo 066).
Ponto de atenção. O termo não comporta nenhuma conotação temporal. Um modelo que diagnostica uma patologia sobre dados presentes produz uma predição no sentido técnico, embora nenhum futuro esteja em jogo.
Três propriedades caracterizam essa função. Determinismo: duas chamadas com a mesma entrada produzem a mesma saída, o modelo não comportando nenhum elemento aleatório na predição mesmo quando seu treinamento comportava. Ausência de estado: uma predição não modifica o modelo, e a adaptação a dados novos exige um retreinamento, operação distinta. Fechamento sobre seu esquema de entrada: o modelo só aceita entradas conformes ao esquema registrado no treinamento — mesmas variáveis, mesma ordem, mesmos tipos, mesmas modalidades categóricas conhecidas, e transformações aplicadas com os parâmetros aprendidos no treinamento, não recalculados (capítulo 028).
Ponto de atenção: o modo de falha mais custoso não é o erro de execução, que é visível, mas a predição produzida sem erro a partir de uma entrada mal transformada. Um pipeline único serializado, em vez de uma sequência de etapas reproduzidas manualmente em produção, elimina essa classe de falha por construção (capítulos 076 a 079).
| Chamada | Saída produzida | Forma | Disponibilidade |
|---|---|---|---|
predict(X) | Classe predita ou valor numérico | Vetor de comprimento n | Todos os estimadores supervisionados |
predict_proba(X) | Probabilidades estimadas por classe | Matriz n × K, linhas de soma 1 | Classificadores com saída probabilística |
decision_function(X) | Score não limitado, não calibrado | Vetor de comprimento n | Modelos de margem, SVM e modelos lineares |
transform(X) | Representação transformada das entradas | Matriz n × p′ | Transformadores, não estimadores finais |
Ponto de atenção: predict aplica por padrão um limiar de 0,5 sobre a
probabilidade estimada. Esse limiar é uma convenção de implementação, não um ótimo;
sua revisão é uma alavanca importante (capítulos 062 e 029).
Acepção 1 — inferência no sentido do Machine Learning (inference, serving). Operação que consiste em avaliar um modelo treinado sobre dados novos para produzir predições. Sinônimo de predição, o termo se opõe ao treinamento e domina o vocabulário da engenharia de produção: inference server, inference latency, batch inference.
Acepção 2 — inferência no sentido estatístico (statistical inference). Abordagem que consiste em estimar as características de uma população a partir de uma amostra e em quantificar a incerteza associada: estimação pontual, intervalo de confiança, teste de hipótese, significância. Tradição de Fisher, Neyman e Pearson.
Origem da ambiguidade. As duas comunidades empregam a mesma palavra para operações cujos objetos se opõem: uma observação individual de um lado, um parâmetro de população do outro. A distinção é desenvolvida por Breiman (2001, Statistical Modeling: The Two Cultures) e Shmueli (2010, To Explain or to Predict?).
Ponto de atenção. Um modelo muito eficiente em predição não fornece nenhuma garantia inferencial: um coeficiente elevado não estabelece nem a significância do efeito, nem sua direção causal (capítulo 016).
| Critério | Inferência no sentido ML | Inferência no sentido estatístico |
|---|---|---|
| Objeto visado | Uma observação individual | Um parâmetro de população |
| Pergunta feita | Qual valor para este caso preciso? | Qual é o valor de θ na população, e com qual incerteza? |
| Saída produzida | Uma predição ŷ | Uma estimativa, um intervalo de confiança, uma decisão de teste |
| Critério de qualidade | Erro de generalização sobre dados não vistos | Propriedades do estimador: viés, convergência, cobertura |
| Hipóteses mobilizadas | Observações i.i.d., estabilidade da distribuição | Modelo gerador especificado, condições de regularidade |
| Contexto de emprego | Engenharia, produção, MLOps | Estatística, epidemiologia, econometria |
Recomendação de formulação: empregar « produzir uma predição » ou « servir o modelo » para a primeira acepção, e nomear explicitamente « inferência estatística » a segunda.
| Etapa | Entrada consumida | Artefato produzido | Capítulo |
|---|---|---|---|
| Enquadramento | Uma pergunta de negócio | Tarefa T e métrica P explicitadas | 012 |
| Constituição do conjunto de dados | Fontes operacionais | Conjunto de dados rotulado X, y | 005 a 007 |
| Separação | Conjunto completo | Subconjuntos de treinamento, validação, teste | 026, 027 |
| Preparação ajustada | Transformadores ajustados | 022, 023 | |
| Escolha do algoritmo | Natureza do problema e restrições | Espaço H e viés indutivo retidos | 049 |
| Seleção dos hiperparâmetros | Treinamento e validação | Configuração λ retida | 034, 035 |
| Treinamento final | , | Modelo ĥ | 029 |
| Avaliação | , | Medidas de desempenho em generalização | 052 a 075 |
| Serialização | Pipeline completo e metadados | Arquivo de artefato versionado | 081 |
| Serviço | Observações de produção | Predições | 081 |
| Monitoramento | Fluxo de produção | Alertas de deriva, decisão de retreinamento | 082 |
Leitura do ciclo. Dois laços de natureza diferente aparecem. O laço curto, entre seleção dos hiperparâmetros e treinamento, explora vários espaços de hipóteses durante o desenvolvimento. O laço longo, do monitoramento para o conjunto de dados, é acionado pela degradação do desempenho em produção: ele reexecuta o mesmo algoritmo sobre dados atualizados para produzir um novo modelo, versionado distintamente. Retreinar não consiste portanto jamais em modificar o algoritmo, mas em produzir um novo artefato.
O que é implantado é um artefato — estrutura e valores de parâmetros — oriundo da execução do algoritmo Random Forest sobre um conjunto de dados determinado, em uma data determinada. O algoritmo reside na biblioteca instalada.
Formulação correta: « Implantamos o modelo attrition_v3, obtido
por treinamento de uma floresta aleatória sobre os dados de janeiro a junho. »
O algoritmo executa um procedimento de busca e não conserva nada ao final de sua execução; o conhecimento induzido reside nos parâmetros do modelo produzido.
Formulação correta: « O algoritmo selecionou, no espaço de hipóteses, um modelo cujos coeficientes indicam uma associação negativa entre antiguidade e cancelamento. »
Retreinar consiste em reexecutar o mesmo algoritmo, com os mesmos hiperparâmetros, sobre dados atualizados: nenhuma linha de código é modificada. A confusão leva a subestimar o custo real do ciclo de manutenção.
Formulação correta: « O retreinamento mensal produz uma nova versão do modelo sem modificação do código de treinamento. »
As transformações de preparação comportam parâmetros aprendidos sobre os dados de treinamento: medianas de imputação, modalidades de codificação, médias e desvios-padrão. Um estimador serializado sozinho, alimentado por transformações reimplementadas manualmente, produz predições falsas sem erro visível.
Formulação correta: « O artefato serializado é o pipeline completo, do dado bruto à predição, acompanhado de seus metadados. »
O termo designa, segundo a comunidade, a produção de uma predição sobre uma observação ou a estimação de um parâmetro de população acompanhada de uma medida de incerteza: nem o mesmo objeto, nem os mesmos critérios de validade.
Formulação correta: « O servidor de inferência produz predições. As conclusões relativas à população pertenceriam a uma inferência estatística, que esse dispositivo não fornece. »
OS DOIS OBJETOS
ALGORITMO DE APRENDIZADO — um procedimento. A : (D, λ) → ĥ ∈ H
Existe antes dos dados, não contém nenhum conhecimento,
versionado como uma dependência de software.
MODELO — um artefato. Estrutura fixada por A e λ,
parâmetros ajustados sobre D. Só existe após o treinamento,
depende integralmente de D, versionado como um entregável datado.
OS TRÊS COMPONENTES DE UM ALGORITMO DE APRENDIZADO
1. Um espaço de hipóteses H quais regras são candidatas
2. Um critério de otimização como medir sua qualidade sobre D
3. Uma estratégia de busca como percorrer H
VIÉS INDUTIVO (Mitchell, 1980)
As preferências não deduzidas dos dados que permitem escolher
uma generalização entre as compatíveis com D. Sem viés,
nenhuma generalização é possível. No Free Lunch (Wolpert, 1996):
nenhum viés é universalmente superior; escolher um algoritmo
é apostar na forma do fenômeno.
AS DUAS OPERAÇÕES
TREINAMENTO D, λ → ĥ seleção em H
PREDIÇÃO x → ŷ = ĥ(x) avaliação de uma função
O MODELO COMO FUNÇÃO
ENTRADA (variáveis) → [ MODELO ] → SAÍDA (predição)
determinístico · sem estado · fechado sobre seu esquema de entrada
ANALOGIA CULINÁRIA
receita → algoritmo ingredientes → conjunto de treinamento
forno → hiperparâmetros assar → treinamento
bolo → modelo fatia servida → predição
bolo embalado e entregue → artefato serializado implantado
DOIS SENTIDOS DA PALAVRA INFERÊNCIA
Sentido ML produzir uma predição para uma observação
Sentido estatístico estimar um parâmetro de população com
quantificação da incerteza
O QUE É EFETIVAMENTE IMPLANTADO
Não o estimador sozinho, mas o pipeline completo (imputação,
codificação, escalonamento, estimador) e seus metadados:
versão de biblioteca, esquema de entrada, limiar de decisão,
semente aleatória, data, perímetro de validade.
O TESTE DE VOCABULÁRIO
« O procedimento » substitui o termo → o algoritmo.
« O arquivo treinado » substitui → o modelo.Enunciado de síntese
O algoritmo de aprendizado é um procedimento que, a partir de um conjunto de dados e de hiperparâmetros, seleciona em um espaço de hipóteses a regra que otimiza um critério; o modelo é essa regra uma vez selecionada, artefato composto de uma estrutura e de parâmetros ajustados, dependente integralmente dos dados que o produziram; o treinamento é a operação de seleção, a predição é a avaliação da função obtida sobre uma observação nova, e o que é versionado, serializado e implantado em produção não é jamais o algoritmo, mas o modelo acompanhado de seu pipeline de preparação e de seus metadados.
Quizzes associados
008.1-quiz-algorithme-apprentissage.md008.2-quiz-modele-artefact.md008.3-quiz-distinction-production.md008.4-quiz-entrainement.md008.5-quiz-prediction-inference.md008.6-quiz-cycle-complet.mdCapítulo seguinte: 009-parametres-hyperparametres.md