La Pipeline de sklearn encadena pasos de preprocesamiento y estimadores en un único objeto que se ajusta, predice y serializa conjuntamente. Las pipelines son la forma estándar de mantener el entrenamiento y la inferencia reproducibles y sin fugas.
Olvidar incluir el preprocesamiento en la pipeline - scaler.fit(X_train) manual y luego model.fit(X_train_scaled) rompe bajo CV. Solución: envolver ambos en Pipeline.
Prefijo de parámetro de paso incorrecto - n_estimators en lugar de clf__n_estimators en la búsqueda de cuadrícula ignora silenciosamente los parámetros. Solución: usar pipe.get_params().keys() para verificar los nombres.
Guardar solo el modelo - cargar un clasificador desnudo sin el escalador produce predicciones incorrectas. Solución:joblib.dump(pipe, ...) la pipeline completa.
Valor por defecto mutable en FunctionTransformer - las lambdas y cierres pueden no serializarse. Solución: usar funciones a nivel de módulo o sklearn.preprocessing.FunctionTransformer.
Último paso no es un estimador - las pipelines que terminan en un transformador no pueden predict. Solución: terminar con un clasificador/regresor o usar TransformedTargetRegressor.
Desajuste de orden de columnas en la inferencia - columnas de pandas reordenadas entre entrenamiento y servicio. Solución: forzar el orden de las columnas con X[expected_cols] antes de predict.