A engenharia de features transforma colunas brutas em representações que os modelos podem aprender. Codificar categóricas, escalar numéricas e compor transformações com ColumnTransformer são os padrões centrais para ML tabular.
Ajustar em dados completos - calcular média/std ou listas de categorias a partir de linhas de teste vaza informações. Correção: ajustar dentro de um pipeline apenas em folds de treinamento.
Categorias não vistas na inferência - novos valores de categoria travam um OneHotEncoder simples. Correção:handle_unknown="ignore" ou handle_unknown="infrequent_if_exist".
Vazamento de codificação de destino (target encoding) - codificar categorias com a média do destino usando todos os dados infla as pontuações de CV. Correção: usar TargetEncoder dentro de um pipeline com CV adequado.
Escalonamento desnecessário para modelos de árvore - florestas aleatórias e gradient boosting são invariantes à escala. Correção: pular o escalonamento para ensembles de árvores; ainda codificar categóricas.
One-hot de alta cardinalidade - milhares de colunas dummy desaceleram o treinamento e causam overfitting. Correção: hashing (FeatureHasher), codificação de frequência ou embeddings.
Explosão polinomial - PolynomialFeatures(degree=3) em 20 colunas cria milhares de features. Correção: limitar o grau, usar seleção de features ou modo apenas de interação.