Conceptos básicos de aprendizaje automático
10 ejemplos para empezar con ML Clásico: 7 básicos y 3 intermedios.
Busca en todas las páginas de la documentación
10 ejemplos para empezar con ML Clásico: 7 básicos y 3 intermedios.
uv venv && source .venv/bin/activate
uv pip install "pandas>=2.2" "scikit-learn>=1.5" "numpy>=2.0"Comience cada proyecto inspeccionando la forma (shape), los tipos de datos (dtypes) y los valores faltantes.
import pandas as pd
from sklearn.datasets import load_iris
iris = load_iris(as_frame=True)
df = iris.frame.assign(species=iris.target_names[iris.target])
print(df.shape, df.dtypes)
print(df.isna().sum())as_frame=True devuelve un DataFrame de pandas directamente desde los conjuntos de datos de sklearn.df.info() y df.describe() antes de modelar.Relacionado: Conjuntos de datos y divisiones - divisiones de entrenamiento/prueba/validación
Defina X (entradas) y y (etiqueta) explícitamente.
X = df.drop(columns=["species"])
y = df["species"]
feature_names = list(X.columns)Relacionado: Ingeniería de características - codificación y escalado
Retenga datos no vistos antes de ajustar nada.
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42, stratify=y
)stratify=y preserva las proporciones de clases en tareas de clasificación.X_train, nunca en el conjunto de datos completo.Relacionado: Conjuntos de datos y divisiones - validación cruzada
Establezca un punto de referencia simple antes de ajustar modelos complejos.
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score
clf = LogisticRegression(max_iter=1000, random_state=42)
clf.fit(X_train, y_train)
preds = clf.predict(X_test)
print("accuracy:", accuracy_score(y_test, preds))max_iter=1000 evita advertencias de convergencia en algunos conjuntos de datos.Relacionado: Aprendizaje supervisado - opciones de algoritmos
Muchos algoritmos esperan entradas escaladas de manera similar.
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = scaler.transform(X_test) # ajustar solo en entrenamientofit aprende la media y la desviación estándar de los datos de entrenamiento; transform las aplica.fit_transform en el conjunto de prueba, eso filtra las estadísticas.Pipeline para evitar errores manuales.Relacionado: Ingeniería de características -
ColumnTransformer
Encadene el preprocesamiento y el modelo en un único objeto estimable.
from sklearn.pipeline import Pipeline
pipe = Pipeline([
("scaler", StandardScaler()),
("clf", LogisticRegression(max_iter=1000, random_state=42)),
])
pipe.fit(X_train, y_train)
print("pipeline accuracy:", accuracy_score(y_test, pipe.predict(X_test)))Pipeline asegura que los datos de prueba nunca influyan en las estadísticas de preprocesamiento.pipe.predict(X_test) realiza el escalado y luego la clasificación en una sola llamada.Relacionado: Pipelines - composición de pasos
Las divisiones únicas de entrenamiento/prueba pueden ser ruidosas; la CV promedia múltiples pliegues (folds).
from sklearn.model_selection import cross_val_score
scores = cross_val_score(pipe, X_train, y_train, cv=5, scoring="accuracy")
print(f"CV mean: {scores.mean():.3f} +/- {scores.std():.3f}")scoring apropiado para el problema (F1, ROC-AUC, etc.).Relacionado: Evaluación de modelos - métricas y curvas
Las columnas numéricas y categóricas mixtas necesitan transformaciones específicas.
from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder
num_cols = ["sepal length (cm)", "sepal width (cm)"]
cat_cols = ["petal length (cm)"] # ejemplo: tratar una columna como categórica
preprocessor = ColumnTransformer([
("num", StandardScaler(), num_cols),
("cat", OneHotEncoder(handle_unknown="ignore"), cat_cols),
])ColumnTransformer aplica diferentes transformaciones a diferentes grupos de columnas.handle_unknown="ignore" evita errores en categorías no vistas durante la inferencia.Relacionado: Ingeniería de características - patrones completos de codificación
Busque combinaciones de parámetros dentro de la validación cruzada.
from sklearn.model_selection import GridSearchCV
param_grid = {"clf__C": [0.1, 1.0, 10.0]}
search = GridSearchCV(pipe, param_grid, cv=5, scoring="accuracy")
search.fit(X_train, y_train)
print("best params:", search.best_params_)
print("test accuracy:", accuracy_score(y_test, search.predict(X_test)))clf__C).GridSearchCV selecciona los mejores parámetros mediante la puntuación CV en los datos de entrenamiento.Relacionado: Ajuste de hiperparámetros - Optuna y búsqueda aleatoria
Persista el artefacto completo para una inferencia reproducible.
import joblib
joblib.dump(pipe, "iris_pipeline.joblib")
loaded = joblib.load("iris_pipeline.joblib")
print(loaded.predict(X_test[:3]))Relacionado: Pipelines - serialización e implementación
Versiones de la pila: Esta página se escribió para Python 3.14.0 (estable 3.14, mantenimiento 3.13), FastAPI 0.115+, Django 5.2, Flask 3.1, Pydantic 2, PyTorch 2.6+, pandas 2.2+, Polars 1.x, ruff 0.9+ y uv 0.6+.
Revisado por Chris St. John·Última actualización: 19 jul 2026