Saltar al contenido
Volver a proyectos
Diagrama: SQL Server, CSV y Kafka alimentan Spark, orquestado por Airflow, que escribe capas Bronze, Silver y Gold de Delta Lake sobre MinIO
Data EngineeringProyecto académico aplicado2026

Plataforma de datos Spark, Kafka y Airflow

Procesa datos por lotes y en tiempo real con Spark, Kafka y Airflow y los organiza en capas de calidad creciente (arquitectura Medallion) sobre Delta Lake.

  • Apache Spark4.0.1
  • Delta Lake4.0.0
  • Apache Kafka4.1.1
  • Apache Airflow3.0.6
  • MinIOS3 local
  • SQL Server2022
  • DockerCompose
  • LicenseMIT

Problema

Mantener un catálogo vivo de metadatos combinando fuentes estructuradas, semiestructuradas y eventos en tiempo real.

Arquitectura

SQL Server, CSV y Kafka alimentan jobs Spark que publican capas Bronze, Silver y Gold sobre Delta Lake y MinIO. Airflow orquesta los flujos batch.

Flujo de datos

Fuentes → ingesta batch o streaming → Spark → Delta Lake Medallion → previews Gold verificables.

Resultados

3

Patrones de ingesta

SQL batch incremental, CSV batch y Kafka streaming

Ver fuente

3

Capas de datos

Bronze, Silver y Gold en cada pipeline

Ver fuente

Contribución y autoría

  • Diseño del caso de uso y de la arquitectura Medallion
  • Implementación de los jobs Spark y de los DAGs de Airflow
  • Integración reproducible de Kafka, SQL Server, MinIO y Delta Lake
Alonso Marcos Muñoz · Autor y desarrollador

Evidencias

Arquitectura ejecutiva
Arquitectura ejecutiva
Arquitectura técnica
Arquitectura técnica

Limitaciones

  • • Entorno local reproducible con datos de demostración, no una plataforma empresarial en producción
  • • Las credenciales incluidas son exclusivamente valores locales de desarrollo

Stack

https://github.com/alonsomarcosm99/spark-kafka-airflow-data-platform