# Plataforma de datos Spark, Kafka y Airflow

> Procesa datos por lotes y en tiempo real con Spark, Kafka y Airflow y los organiza en capas de calidad creciente (arquitectura Medallion) sobre Delta Lake.

- Categoría: Data Engineering
- Año / Year: 2026

## Contexto

Mantener un catálogo vivo de metadatos combinando fuentes estructuradas, semiestructuradas y eventos en tiempo real.

## Aspectos destacados

- Diseño del caso de uso y de la arquitectura Medallion
- Implementación de los jobs Spark y de los DAGs de Airflow
- Integración reproducible de Kafka, SQL Server, MinIO y Delta Lake

## Resultados

- Patrones de ingesta: 3. Fuente: docs/ejecucion-y-pruebas.md
- Capas de datos: 3. Fuente: docs/arquitectura-pmd.md

## Tecnologías

Python · Apache Spark · Apache Airflow · Apache Kafka · Delta Lake · MinIO · SQL Server · Docker Compose

## Enlaces verificables

- Página del portfolio: https://alonsomarcosm99.github.io/es/projects/big-data-catalog-batch-streaming/
- Repositorio GitHub: https://github.com/alonsomarcosm99/spark-kafka-airflow-data-platform
- technical_docs: https://alonsomarcosm99.github.io/spark-kafka-airflow-data-platform/
- architecture: https://alonsomarcosm99.github.io/spark-kafka-airflow-data-platform/docs/visualizaciones/arquitectura-ejecutiva.svg
