Ingesta que deja de ser un proyecto.
Código abierto · Apache 2.0
Cualquiera de 400+ fuentes a Parquet en tu bucket, un comando a la vez. Sin DAG, sin scheduler que operar, sin YAML que depurar.
pip install dataspoc-pipe Qué hace Pipe:
Lleva el dato de donde está a donde puedes consultarlo — y después se quita del medio.
Pipe envuelve el ecosistema Singer en una sola CLI. Nombras la fuente, descubre el esquema, extrae incrementalmente desde un bookmark guardado y escribe Parquet particionado en el bucket que ya es tuyo. El catálogo que mantiene es el mismo que lee Lens, así que la tabla queda consultable en cuanto aterriza.
Qué te llevas
-
400+ fuentes
El ecosistema de taps Singer — Postgres, MySQL, Stripe, HubSpot, Salesforce, Google Sheets y la cola larga detrás de ellos.
-
Incremental por defecto
Los bookmarks viven en el bucket. Volver a correr retoma donde quedó, en vez de reprocesar el histórico.
-
Transformaciones curadas
Limpia y remodela en la entrada, para que la capa curada llegue lista para análisis y no como volcado crudo.
-
Servidor MCP
dataspoc-pipe mcpdeja que un agente agregue fuentes, dispare ejecuciones y lea los logs sin API intermedia. -
Cualquier nube
S3, GCS o Azure Blob. Almacenamiento que ya pagas, bajo el IAM que ya controlas.
En la práctica
Instala, agrega una fuente, ejecuta. El bookmark se encarga del resto.
$ pip install dataspoc-pipe
$ dataspoc-pipe add tap-postgres
Source added. Configure in dataspoc-pipe.yaml
$ dataspoc-pipe run tap-postgres
Resuming from bookmark: 2026-04-14T08:00:00Z
Extracted 1,247 new records (3 tables)