Modelos en el lake, predicciones de vuelta como tablas.
Licencia comercial
Ingeniería de atributos, selección de modelo, entrenamiento y predicción corren directamente sobre el Parquet de tu bucket — y la salida vuelve al lake, donde el SQL la alcanza.
dataspoc-lens ml --help Qué hace ML:
Cierra el ciclo entre el dato que ya curaste y la decisión que quieres automatizar.
Apúntalo a una tabla curada y una columna objetivo. ML audita los datos, genera atributos, selecciona y entrena un modelo, y escribe los artefactos en ml/models/ en el mismo bucket. Las predicciones van a ml/predictions/ como Parquet — lo que significa que Lens las descubre solo y quien analiza puede cruzarlas con cualquier otra cosa sin pasar por nadie.
Qué te llevas
-
Atributos automáticos
Ingeniería y selección de atributos derivadas de la tabla curada, no construidas a mano para un solo modelo.
-
Entrenamiento y evaluación
Selección de modelo con las métricas escritas junto al artefacto, para que el tradeoff quede registrado.
-
Explicabilidad
ml explainproduce un informe de qué impulsa la predicción — para el equipo que tendrá que defenderla. -
La predicción es dato
La salida es Parquet en el bucket. Consultable en Lens, cruzable en SQL, legible por un agente.
-
Monitoreo de drift
Métricas seguidas en el tiempo, para que un modelo degradándose sea algo que descubres antes que el negocio.
En la práctica
Entrena contra una tabla curada, predice contra otra.
$ dataspoc-lens ml train \
--table curated.finance.customers \
--target churn \
--output s3://my-lake/ml/models/churn
$ dataspoc-lens ml predict \
--model s3://my-lake/ml/models/churn \
--input curated.finance.new_customers