Seu bucket já é um warehouse.

Open source · Apache 2.0

O Lens monta os seus arquivos Parquet como tabelas SQL e deixa você consultá-los do terminal, de um notebook, em linguagem natural ou por um agente de IA — sempre sobre os mesmos arquivos.

pip install dataspoc-lens

O que o Lens faz:

Uma camada de consulta, quatro portas de entrada — e nenhuma cópia dos seus dados em outro lugar.

O Lens aponta o DuckDB para o Parquet do seu bucket e expõe tudo como tabelas. Engenharia ganha um shell SQL, análise ganha Jupyter ou Marimo, o resto pergunta em linguagem natural e os agentes conectam via MCP. Todo caminho lê os mesmos arquivos, então ninguém discute qual número está certo.

O que você leva

  • Shell SQL

    DuckDB sobre o seu lake, com o catálogo montado. JOINs entre os buckets a que você tem acesso, sem warehouse no meio.

  • Pergunte em português

    lens ask escreve o SQL, executa e mostra os dois — a consulta fica auditável, não é caixa-preta.

  • Notebooks

    Jupyter e Marimo sobem com todos os buckets já montados.

  • Cache local

    Traz as tabelas quentes para o disco, acompanha o quanto envelheceram e atualiza sob demanda. Consulta repetida para de bater no object storage.

  • Servidor MCP

    list_tables, query(sql) e ask(question) expostos para Claude, Cursor ou qualquer cliente MCP. SQL de verdade sobre linhas de verdade — sem embeddings, sem vector store.

  • SDK Python

    LensClient para CrewAI, LangGraph, AutoGen ou o seu próprio loop de agente.

Na prática

Aponte para um bucket. Comece a perguntar.

$ pip install dataspoc-lens
$ dataspoc-lens add-bucket s3://my-data
  3 buckets, 47 tables mounted
$ dataspoc-lens ask "top customers by revenue"
  SELECT customer, SUM(total) FROM ... GROUP BY 1
  Acme Corp leads with $247k, Initech at $189k

A camada de consulta que faltava no seu lake.

Ver a documentação