Ingestão que deixa de ser um projeto.
Open source · Apache 2.0
Qualquer uma de 400+ fontes para Parquet no seu bucket, um comando por vez. Sem DAG, sem scheduler para operar, sem YAML para depurar.
pip install dataspoc-pipe O que o Pipe faz:
Leva o dado de onde ele está para onde você consegue consultá-lo — e depois sai da frente.
O Pipe embrulha o ecossistema Singer em uma CLI só. Você nomeia a fonte, ele descobre o schema, extrai incrementalmente a partir de um bookmark guardado e escreve Parquet particionado no bucket que já é seu. O catálogo que ele mantém é o mesmo que o Lens lê, então a tabela fica consultável assim que aterrissa.
O que você leva
-
400+ fontes
O ecossistema de taps Singer — Postgres, MySQL, Stripe, HubSpot, Salesforce, Google Sheets e a cauda longa atrás deles.
-
Incremental por padrão
Os bookmarks ficam no bucket. Rodar de novo retoma de onde parou, em vez de reprocessar o histórico.
-
Transformações curadas
Limpa e remodela na entrada, para a camada curada chegar pronta para análise em vez de despejo bruto.
-
Servidor MCP
dataspoc-pipe mcpdeixa um agente adicionar fonte, disparar execução e ler os logs sem API intermediária. -
Qualquer nuvem
S3, GCS ou Azure Blob. Armazenamento que você já paga, sob o IAM que você já controla.
Na prática
Instale, adicione uma fonte, execute. O bookmark cuida do resto.
$ pip install dataspoc-pipe
$ dataspoc-pipe add tap-postgres
Source added. Configure in dataspoc-pipe.yaml
$ dataspoc-pipe run tap-postgres
Resuming from bookmark: 2026-04-14T08:00:00Z
Extracted 1,247 new records (3 tables)