Skill de Pipeline de Dados
Construindo e revisando pipelines ETL/ELT - uma Skill de Agente para Python 3.14, pandas 2.2+ e Polars 1.x.
Busque em todas as páginas da documentação
Construindo e revisando pipelines ETL/ELT - uma Skill de Agente para Python 3.14, pandas 2.2+ e Polars 1.x.
Estrutura pipelines em lote: conectores de origem, camada de validação, funções de transformação, saídas particionadas (Parquet/Delta), ganchos de orquestração (Airflow/dbt/Cron) e verificações de qualidade de dados com IDs de execução reproduzíveis.
| Entrada | Por quê |
|---|---|
| Tipo de origem | API, S3 CSV, réplica Postgres, streaming |
| Escolha do motor | ADR pandas vs Polars |
| Granularidade | Eventos em nível de linha vs. agregados diários |
| SLA | Janela de frescor e tempo de inatividade permitido |
| Colunas PII | Requisitos de mascaramento/hash |
extract.py, transform.py, load.py, validate.py)pyproject.toml fixadas com uvs3://bucket/dataset/dt=YYYY-MM-DD/uv run python -m pipeline.run --date 2026-07-08 --env staging
uv run pytest tests/test_transform.py -q
uv run python -m pipeline.validate --date 2026-07-08import pandera.pandas as pa
from pandera.typing import Series
class OrdersSchema(pa.DataFrameModel):
order_id: Series[str] = pa.Field(unique=True)
amount: Series[float] = pa.Field(ge=0)
status: Series[str] = pa.Field(isin=["pending", "paid", "refunded"])
def validate_orders(df):
return OrdersSchema.validate(df, lazy=True)Siga o ADR da equipe - Polars para transformações de nó único grandes; pandas quando integrações de ecossistema dominam.
cron + systemd para um único job; Airflow quando dependências de DAG, backfill e SLAs importam.
Versões do Stack: Esta página foi escrita para Python 3.14.0 (3.14 estável, 3.13 de manutenção), FastAPI 0.115+, Django 5.2, Flask 3.1, Pydantic 2, PyTorch 2.6+, pandas 2.2+, Polars 1.x, ruff 0.9+ e uv 0.6+.
Revisado por Chris St. John·Última atualização: 16 de jul. de 2026