Noções Básicas de Machine Learning
10 exemplos para você começar com ML Clássico - 7 básicos e 3 intermediários.
Busque em todas as páginas da documentação
10 exemplos para você começar com ML Clássico - 7 básicos e 3 intermediários.
uv venv && source .venv/bin/activate
uv pip install "pandas>=2.2" "scikit-learn>=1.5" "numpy>=2.0"Comece todo projeto inspecionando a forma, os tipos de dados e os valores ausentes.
import pandas as pd
from sklearn.datasets import load_iris
iris = load_iris(as_frame=True)
df = iris.frame.assign(species=iris.target_names[iris.target])
print(df.shape, df.dtypes)
print(df.isna().sum())as_frame=True retorna um DataFrame pandas diretamente de conjuntos de dados do sklearn.df.info() e df.describe() antes da modelagem.Relacionado: Conjuntos de Dados e Divisões - divisões de treino/teste/validação
Defina X (entradas) e y (rótulo) explicitamente.
X = df.drop(columns=["species"])
y = df["species"]
feature_names = list(X.columns)Relacionado: Engenharia de Recursos - codificação e dimensionamento
Reserve dados não vistos antes de ajustar qualquer coisa.
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42, stratify=y
)stratify=y preserva as proporções de classe em tarefas de classificação.X_train - nunca no conjunto de dados completo.Relacionado: Conjuntos de Dados e Divisões - validação cruzada
Estabeleça um benchmark simples antes de ajustar modelos complexos.
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score
clf = LogisticRegression(max_iter=1000, random_state=42)
clf.fit(X_train, y_train)
preds = clf.predict(X_test)
print("accuracy:", accuracy_score(y_test, preds))max_iter=1000 evita avisos de convergência em alguns conjuntos de dados.Relacionado: Aprendizado Supervisionado - escolhas de algoritmos
Muitos algoritmos esperam entradas com escala semelhante.
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = scaler.transform(X_test) # ajustado apenas no treinofit aprende a média e o desvio padrão dos dados de treinamento; transform os aplica.fit_transform no conjunto de teste - isso vaza estatísticas.Pipeline para evitar erros manuais.Relacionado: Engenharia de Recursos -
ColumnTransformer
Encadeie pré-processamento e modelo em um único objeto estimável.
from sklearn.pipeline import Pipeline
pipe = Pipeline([
("scaler", StandardScaler()),
("clf", LogisticRegression(max_iter=1000, random_state=42)),
])
pipe.fit(X_train, y_train)
print("pipeline accuracy:", accuracy_score(y_test, pipe.predict(X_test)))Pipeline garante que os dados de teste nunca influenciem as estatísticas de pré-processamento.pipe.predict(X_test) executa o dimensionamento e a classificação em uma única chamada.Relacionado: Pipelines - composição de etapas
Divisões únicas de treino/teste podem ser ruidosas; CV calcula a média de várias dobras.
from sklearn.model_selection import cross_val_score
scores = cross_val_score(pipe, X_train, y_train, cv=5, scoring="accuracy")
print(f"CV mean: {scores.mean():.3f} +/- {scores.std():.3f}")scoring apropriado para o problema (F1, ROC-AUC, etc.).Relacionado: Avaliação de Modelos - métricas e curvas
Colunas numéricas e categóricas mistas precisam de transformações direcionadas.
from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder
num_cols = ["sepal length (cm)", "sepal width (cm)"]
cat_cols = ["petal length (cm)"] # exemplo: tratar uma coluna como categórica
preprocessor = ColumnTransformer([
("num", StandardScaler(), num_cols),
("cat", OneHotEncoder(handle_unknown="ignore"), cat_cols),
])ColumnTransformer aplica diferentes transformações a diferentes grupos de colunas.handle_unknown="ignore" evita falhas em categorias não vistas na inferência.Relacionado: Engenharia de Recursos - padrões completos de codificação
Pesquise combinações de parâmetros dentro da validação cruzada.
from sklearn.model_selection import GridSearchCV
param_grid = {"clf__C": [0.1, 1.0, 10.0]}
search = GridSearchCV(pipe, param_grid, cv=5, scoring="accuracy")
search.fit(X_train, y_train)
print("best params:", search.best_params_)
print("test accuracy:", accuracy_score(y_test, search.predict(X_test)))clf__C).GridSearchCV seleciona os melhores parâmetros pela pontuação CV nos dados de treinamento.Relacionado: Ajuste de Hiperparâmetros - Optuna e busca aleatória
Persista o artefato completo para inferência reproduzível.
import joblib
joblib.dump(pipe, "iris_pipeline.joblib")
loaded = joblib.load("iris_pipeline.joblib")
print(loaded.predict(X_test[:3]))Relacionado: Pipelines - serialização e implantação
Versões da Pilha: Esta página foi escrita para Python 3.14.0 (estável 3.14, manutenção 3.13), FastAPI 0.115+, Django 5.2, Flask 3.1, Pydantic 2, PyTorch 2.6+, pandas 2.2+, Polars 1.x, ruff 0.9+ e uv 0.6+.
Revisado por Chris St. John·Última atualização: 19 de jul. de 2026