Ingestão que deixa de ser um projeto.

Open source · Apache 2.0

Qualquer uma de 400+ fontes para Parquet no seu bucket, um comando por vez. Sem DAG, sem scheduler para operar, sem YAML para depurar.

pip install dataspoc-pipe

O que o Pipe faz:

Leva o dado de onde ele está para onde você consegue consultá-lo — e depois sai da frente.

O Pipe embrulha o ecossistema Singer em uma CLI só. Você nomeia a fonte, ele descobre o schema, extrai incrementalmente a partir de um bookmark guardado e escreve Parquet particionado no bucket que já é seu. O catálogo que ele mantém é o mesmo que o Lens lê, então a tabela fica consultável assim que aterrissa.

O que você leva

  • 400+ fontes

    O ecossistema de taps Singer — Postgres, MySQL, Stripe, HubSpot, Salesforce, Google Sheets e a cauda longa atrás deles.

  • Incremental por padrão

    Os bookmarks ficam no bucket. Rodar de novo retoma de onde parou, em vez de reprocessar o histórico.

  • Transformações curadas

    Limpa e remodela na entrada, para a camada curada chegar pronta para análise em vez de despejo bruto.

  • Servidor MCP

    dataspoc-pipe mcp deixa um agente adicionar fonte, disparar execução e ler os logs sem API intermediária.

  • Qualquer nuvem

    S3, GCS ou Azure Blob. Armazenamento que você já paga, sob o IAM que você já controla.

Na prática

Instale, adicione uma fonte, execute. O bookmark cuida do resto.

$ pip install dataspoc-pipe
$ dataspoc-pipe add tap-postgres
  Source added. Configure in dataspoc-pipe.yaml
$ dataspoc-pipe run tap-postgres
  Resuming from bookmark: 2026-04-14T08:00:00Z
  Extracted 1,247 new records (3 tables)

Da fonte ao bucket, em um comando.

Ver a documentação