Modelos en el lake, predicciones de vuelta como tablas.

Licencia comercial

Ingeniería de atributos, selección de modelo, entrenamiento y predicción corren directamente sobre el Parquet de tu bucket — y la salida vuelve al lake, donde el SQL la alcanza.

dataspoc-lens ml --help

Qué hace ML:

Cierra el ciclo entre el dato que ya curaste y la decisión que quieres automatizar.

Apúntalo a una tabla curada y una columna objetivo. ML audita los datos, genera atributos, selecciona y entrena un modelo, y escribe los artefactos en ml/models/ en el mismo bucket. Las predicciones van a ml/predictions/ como Parquet — lo que significa que Lens las descubre solo y quien analiza puede cruzarlas con cualquier otra cosa sin pasar por nadie.

Qué te llevas

  • Atributos automáticos

    Ingeniería y selección de atributos derivadas de la tabla curada, no construidas a mano para un solo modelo.

  • Entrenamiento y evaluación

    Selección de modelo con las métricas escritas junto al artefacto, para que el tradeoff quede registrado.

  • Explicabilidad

    ml explain produce un informe de qué impulsa la predicción — para el equipo que tendrá que defenderla.

  • La predicción es dato

    La salida es Parquet en el bucket. Consultable en Lens, cruzable en SQL, legible por un agente.

  • Monitoreo de drift

    Métricas seguidas en el tiempo, para que un modelo degradándose sea algo que descubres antes que el negocio.

En la práctica

Entrena contra una tabla curada, predice contra otra.

$ dataspoc-lens ml train \
    --table curated.finance.customers \
    --target churn \
    --output s3://my-lake/ml/models/churn
$ dataspoc-lens ml predict \
    --model s3://my-lake/ml/models/churn \
    --input curated.finance.new_customers

De la tabla curada al modelo en producción.

Ver la documentación