Mejores Prácticas de Machine Learning
Una lista de verificación de reglas para construir modelos de ML clásicos reproducibles y sin fugas de datos. Revísala antes de cada ejecución de entrenamiento y durante la revisión del código.
Busca en todas las páginas de la documentación
Una lista de verificación de reglas para construir modelos de ML clásicos reproducibles y sin fugas de datos. Revísala antes de cada ejecución de entrenamiento y durante la revisión del código.
GroupKFold cuando varias filas compartan un ID de usuario, paciente o sesión.OneHotEncoder(handle_unknown="ignore") o el soporte nativo para categóricas en bibliotecas de boosting.StandardScaler o modelos basados en distancia.X[expected_columns] antes de predict para evitar desalineaciones silenciosas.random_state=42 en divisiones, modelos y búsquedas para experimentos reproducibles.joblib.dump(pipe, ...) - no solo el paso del clasificador.f1, roc_auc o neg_mean_absolute_error - no la precisión por defecto.pipe.predict(sample) devuelva la forma y el tipo de datos esperados.Pipeline y el orden de división correcto.random_state, dependencias fijadas y seguimiento de experimentos.imblearn.pipeline.Pipeline después de la división de entrenamiento.proyecto/
data/ # crudos y procesados (gitignored o DVC)
src/train.py # script de entrenamiento
src/predict.py # punto de entrada de inferencia
models/ # pipelines serializados
tests/ # pruebas de humo de inferenciadef test_pipeline_predicts(sample_row):
pred = pipe.predict(sample_row)
assert pred.shape == (1,)Versiones del Stack: Esta página fue escrita para Python 3.14.0 (estable 3.14, mantenimiento 3.13), FastAPI 0.115+, Django 5.2, Flask 3.1, Pydantic 2, PyTorch 2.6+, pandas 2.2+, Polars 1.x, ruff 0.9+, y uv 0.6+.
Revisado por Chris St. John·Última actualización: 16 jul 2026