Ingesta que deja de ser un proyecto.

Código abierto · Apache 2.0

Cualquiera de 400+ fuentes a Parquet en tu bucket, un comando a la vez. Sin DAG, sin scheduler que operar, sin YAML que depurar.

pip install dataspoc-pipe

Qué hace Pipe:

Lleva el dato de donde está a donde puedes consultarlo — y después se quita del medio.

Pipe envuelve el ecosistema Singer en una sola CLI. Nombras la fuente, descubre el esquema, extrae incrementalmente desde un bookmark guardado y escribe Parquet particionado en el bucket que ya es tuyo. El catálogo que mantiene es el mismo que lee Lens, así que la tabla queda consultable en cuanto aterriza.

Qué te llevas

  • 400+ fuentes

    El ecosistema de taps Singer — Postgres, MySQL, Stripe, HubSpot, Salesforce, Google Sheets y la cola larga detrás de ellos.

  • Incremental por defecto

    Los bookmarks viven en el bucket. Volver a correr retoma donde quedó, en vez de reprocesar el histórico.

  • Transformaciones curadas

    Limpia y remodela en la entrada, para que la capa curada llegue lista para análisis y no como volcado crudo.

  • Servidor MCP

    dataspoc-pipe mcp deja que un agente agregue fuentes, dispare ejecuciones y lea los logs sin API intermedia.

  • Cualquier nube

    S3, GCS o Azure Blob. Almacenamiento que ya pagas, bajo el IAM que ya controlas.

En la práctica

Instala, agrega una fuente, ejecuta. El bookmark se encarga del resto.

$ pip install dataspoc-pipe
$ dataspoc-pipe add tap-postgres
  Source added. Configure in dataspoc-pipe.yaml
$ dataspoc-pipe run tap-postgres
  Resuming from bookmark: 2026-04-14T08:00:00Z
  Extracted 1,247 new records (3 tables)

De la fuente al bucket, en un comando.

Ver la documentación