Tu bucket ya es un warehouse.

Código abierto · Apache 2.0

Lens monta tus archivos Parquet como tablas SQL y te deja consultarlos desde la terminal, desde un notebook, en lenguaje natural o desde un agente de IA — siempre sobre los mismos archivos.

pip install dataspoc-lens

Qué hace Lens:

Una capa de consulta, cuatro puertas de entrada — y ninguna copia de tus datos en otro lado.

Lens apunta DuckDB al Parquet de tu bucket y lo expone como tablas. Ingeniería obtiene un shell SQL, análisis obtiene Jupyter o Marimo, el resto pregunta en lenguaje natural y los agentes se conectan vía MCP. Cada camino lee los mismos archivos, así que nadie discute qué número es el correcto.

Qué te llevas

  • Shell SQL

    DuckDB sobre tu lake, con el catálogo montado. JOINs entre los buckets a los que tienes acceso, sin warehouse en el medio.

  • Pregunta en español

    lens ask escribe el SQL, lo ejecuta y te muestra ambos — la consulta queda auditable, no es una caja negra.

  • Notebooks

    Jupyter y Marimo arrancan con todos los buckets ya montados.

  • Caché local

    Trae las tablas calientes al disco, sigue cuánto envejecieron y actualiza a demanda. La consulta repetida deja de golpear el object storage.

  • Servidor MCP

    list_tables, query(sql) y ask(question) expuestos a Claude, Cursor o cualquier cliente MCP. SQL real sobre filas reales — sin embeddings, sin vector store.

  • SDK de Python

    LensClient para CrewAI, LangGraph, AutoGen o tu propio loop de agente.

En la práctica

Apúntalo a un bucket. Empieza a preguntar.

$ pip install dataspoc-lens
$ dataspoc-lens add-bucket s3://my-data
  3 buckets, 47 tables mounted
$ dataspoc-lens ask "top customers by revenue"
  SELECT customer, SUM(total) FROM ... GROUP BY 1
  Acme Corp leads with $247k, Initech at $189k

La capa de consulta que le faltaba a tu lake.

Ver la documentación