
Lakehouse y MLOps de churn telco
Plataforma de datos de principio a fin, desarrollada en coautoría, que predice la baja de clientes de una operadora con datos sintéticos usando PySpark, Delta Lake, Unity Catalog y MLflow.
- DatabricksLakehouse
- Asset Bundlesdatabricks.yml
- PipelinesMedallion serverless
- Delta LakeBronze · Silver · Gold
- SparkMLlib
- MLflowTracking + Registry
- Unity CatalogModels + Tables
- LicenseMIT
Problema
Construir un ciclo reproducible de datos y ML para anticipar la fuga de clientes sin ocultar la naturaleza sintética del conjunto de datos.
Arquitectura
Databricks Lakehouse con ingesta incremental, arquitectura Medallion sobre Delta Lake, feature engineering temporal, MLflow, Unity Catalog e inferencia batch monitorizada.
Flujo de datos
Datos sintéticos → Auto Loader → Bronze/Silver/Gold → dataset point-in-time → entrenamiento y registro → inferencia y monitorización simuladas.
Resultados
16,316,445
Filas de entrenamiento
Ver fuente2,042,162
Clientes distintos
Ver fuente33
Variables del modelo
Ver fuente2023-07 → 2024-12
Ventana de entrenamiento
Ver fuenteContribución y autoría
- Coimplementación end-to-end confirmada por Alonso el 2026-09-14
- Experimento MLflow, job de ML de tres tareas y ejecución de simulación asociados a Alonso
- Trabajo compartido en pipeline Medallion, ciclo de modelo y validación diaria
Evidencias
Limitaciones
- • Los datos son sintéticos y el escenario denominado producción es una simulación académica
- • La validación y el despliegue autenticados requieren un workspace Databricks activo
- • La autoría es compartida y se mantiene la atribución de ambos coautores
Stack
https://github.com/alonsomarcosm99/databricks-telco-churn-lakehouse

