Modelos no lake, predições de volta como tabelas.
Licença comercial
Engenharia de atributos, seleção de modelo, treino e predição rodam direto sobre o Parquet do seu bucket — e a saída volta para o lake, onde o SQL alcança.
dataspoc-lens ml --help O que o ML faz:
Fecha o ciclo entre o dado que você já curou e a decisão que você quer automatizar.
Aponte para uma tabela curada e uma coluna alvo. O ML audita os dados, gera atributos, seleciona e treina um modelo, e escreve os artefatos em ml/models/ no mesmo bucket. As predições vão para ml/predictions/ como Parquet — o que significa que o Lens as descobre sozinho e quem analisa consegue cruzá-las com qualquer outra coisa sem passar por ninguém.
O que você leva
-
Atributos automáticos
Engenharia e seleção de atributos derivadas da tabela curada, não construídas à mão para um modelo só.
-
Treino e avaliação
Seleção de modelo com as métricas escritas ao lado do artefato, para o tradeoff ficar registrado.
-
Explicabilidade
ml explainproduz um relatório do que dirige a predição — para o time que vai ter que defendê-la. -
Predição é dado
A saída é Parquet no bucket. Consultável no Lens, cruzável em SQL, legível por um agente.
-
Monitoramento de drift
Métricas acompanhadas ao longo do tempo, para um modelo degradando ser algo que você descobre antes do negócio.
Na prática
Treine contra uma tabela curada, prediga contra outra.
$ dataspoc-lens ml train \
--table curated.finance.customers \
--target churn \
--output s3://my-lake/ml/models/churn
$ dataspoc-lens ml predict \
--model s3://my-lake/ml/models/churn \
--input curated.finance.new_customers