Boas Práticas de Machine Learning
Uma lista de verificação de regras para construir modelos clássicos de ML reproduzíveis e livres de vazamentos. Revise-a antes de cada execução de treinamento e durante a revisão de código.
Busque em todas as páginas da documentação
Uma lista de verificação de regras para construir modelos clássicos de ML reproduzíveis e livres de vazamentos. Revise-a antes de cada execução de treinamento e durante a revisão de código.
GroupKFold quando várias linhas compartilham um ID de usuário, paciente ou sessão.OneHotEncoder(handle_unknown="ignore") ou suporte categórico nativo em bibliotecas de boosting.StandardScaler ou modelos baseados em distância.X[colunas_esperadas] antes de predict para evitar desalinhamento silencioso.random_state=42 em divisões, modelos e buscas para experimentos reproduzíveis.joblib.dump(pipe, ...) - não apenas a etapa do classificador.f1, roc_auc ou neg_mean_absolute_error - não a acurácia padrão.pipe.predict(sample) retorna a forma e o dtype esperados.Pipeline e ordem de divisão adequada.random_state, dependências fixadas e rastreamento de experimentos.imblearn.pipeline.Pipeline após a divisão de treino.projeto/
data/ # raw e processado (gitignored ou DVC)
src/train.py # script de treinamento
src/predict.py # ponto de entrada de inferência
models/ # pipelines serializados
tests/ # testes de fumaça de inferênciadef test_pipeline_predicts(sample_row):
pred = pipe.predict(sample_row)
assert pred.shape == (1,)Versões da Stack: Esta página foi escrita para Python 3.14.0 (stable 3.14, maintenance 3.13), FastAPI 0.115+, Django 5.2, Flask 3.1, Pydantic 2, PyTorch 2.6+, pandas 2.2+, Polars 1.x, ruff 0.9+ e uv 0.6+.
Revisado por Chris St. John·Última atualização: 16 de jul. de 2026