# Alonso Marcos Muñoz

> Data Engineer · Pipelines, modelado y plataformas. Construyo pipelines, modelos y plataformas de datos con Python y SQL. Aporto experiencia profesional en metadatos públicos y proyectos aplicados con Databricks, Spark, Airflow, Kafka y AWS.

Portfolio canónico / Canonical portfolio: https://alonsomarcosm99.github.io/es/

## Perfil profesional

Soy Ingeniero de Datos en Tragsatec, dentro del proyecto ImpulsaDATA para la Dirección General del Dato. Construyo y opero pipelines ETL con Python y SQL que integran, validan y publican la información de los catálogos de datos de 22 ministerios y organismos públicos.

Cubro el ciclo completo: modelar y transformar datos en PostgreSQL y Oracle, automatizar controles de calidad y desplegar en desarrollo, pruebas y producción. Dentro del proyecto AgoraData lidero el desarrollo de la interfaz web que sirve de front-end a todo el backend y a los procesos Python de ImpulsaDATA, con Java, Spring Boot, Vaadin y PostgreSQL.

El Máster en Big Data y Computación en la Nube me ha dado práctica con Databricks, Spark, Kafka, Airflow y AWS, y la certificación CAPM, método para planificar alcance, riesgos y entregas. En el día a día uso flujos de trabajo agénticos con IA para acelerar el desarrollo, las pruebas y la revisión de código sin perder trazabilidad.

## Experiencia

### Tragsatec — Ingeniero de Datos · ImpulsaDATA

- 2025-10 — actualidad
- Albacete, España

Trabajo en el proyecto ImpulsaDATA / Gestión de la Demanda del Dato Público para la Dirección General del Dato. Mi trabajo se centra en integrar, transformar, validar y publicar la información de los catálogos de datos de 22 ministerios y organismos públicos.

**Contribuciones**

- Desarrollo y mantengo pipelines ETL en Python y SQL que recogen, limpian, validan y publican de forma automática la información de los catálogos de datos de 22 ministerios y organismos públicos.
- Diseño transformaciones, agregaciones y vistas en PostgreSQL y Oracle para que la información llegue estructurada, coherente y lista para consultarse y publicarse.
- Automatizo controles de calidad que comprueban que cada conjunto de datos cumple el estándar europeo de datos abiertos antes de publicarse, para evitar que lleguen errores a los catálogos oficiales.
- Adapto y extiendo CKAN, la plataforma de datos abiertos del proyecto, con un perfil común DCAT-AP-ES para todos los organismos, recolección automática de catálogos (harvesting) y datos geoespaciales.
- Administro OpenMetadata, la plataforma de catálogo y gobierno del dato, en el entorno de pruebas, la uso en producción y la conecto por API con la herramienta de conversión de metadatos del proyecto.
- Preparo y opero los entornos de desarrollo, pruebas, preproducción y producción con Docker, Podman, Git y SSH, con despliegues documentados que el equipo puede repetir y revisar.
- Dentro del proyecto AgoraData lidero el desarrollo de la interfaz web que sirve de front-end a todo el backend y a los procesos Python de ImpulsaDATA, con Java, Spring Boot, Vaadin y PostgreSQL. Coordino y delego seguridad, pruebas, accesibilidad y CI/CD.
- Participo en el refuerzo de seguridad de CKAN (actualizaciones, cifrado TLS, cabeceras y cookies) y verifico cada corrección con pruebas antes de cerrarla.
- Acompaño a perfiles en prácticas y junior, documento las decisiones técnicas y convierto el conocimiento del equipo en guías reutilizables.
- Uso flujos de trabajo agénticos con IA (Claude, Codex y Copilot) en desarrollo, pruebas end-to-end y revisión de código, con reglas y contexto que mantienen la trazabilidad.

**Tecnologías:** Python · SQL · PostgreSQL · Oracle · CKAN · OpenMetadata · DCAT-AP-ES · SHACL · Docker/Podman · Java · Spring Boot · Vaadin

datos.gob.es: https://datos.gob.es/es/catalogo/conjuntos-datos

### Tragsatec — Ingeniero de Datos (Prácticas) · ImpulsaDATA

- 2025-06 — 2025-09
- Albacete, España

Primera etapa en ImpulsaDATA, centrada en diseñar y desarrollar la primera versión de la herramienta de conversión de metadatos del proyecto.

**Contribuciones**

- Diseñé y desarrollé la primera versión de la herramienta de conversión de metadatos del proyecto, un proceso ETL en Python que adapta la información al estándar europeo de datos abiertos y la publica en CKAN.
- Añadí configuración externa, registros de ejecución y documentación para que el equipo pudiera operar, revisar y mantener la herramienta con facilidad.

**Tecnologías:** Python · ETL · JSON-LD · RDF · SHACL · CKAN · Docker · GitLab

datos.gob.es: https://datos.gob.es/es/catalogo/conjuntos-datos

### La Fábrica del Tiempo — Ingeniero de Datos y Automatización (Prácticas)

- 2024-02 — 2024-08
- Albacete, España

Integración de datos y automatización de procesos con Power Platform y Microsoft 365 en una empresa de consultoría y productividad.

**Contribuciones**

- Desarrollé con Power Apps una aplicación interna que centraliza en un único lugar la gestión de procesos e información de la empresa.
- Automaticé con Power Automate la gestión de leads, notificaciones y aprobaciones, conectando SharePoint, el CRM y Microsoft 365, con una mejora de más del 25 % en la eficiencia de los procesos tratados.
- Formé al equipo en las nuevas herramientas y preparé contenido técnico para facilitar su adopción en el trabajo diario.

**Tecnologías:** Power Apps · Power Automate · SharePoint · Microsoft 365 · CRM

### Ayuntamiento de Alcázar de San Juan — Técnico Informático (Prácticas)

- 2019-03 — 2019-06
- Alcázar de San Juan, España

Soporte técnico y mantenimiento informático en un entorno de administración pública.

**Contribuciones**

- Di soporte técnico a los usuarios municipales y resolví incidencias de hardware, software y red en un entorno de administración pública.
- Mantuve equipos e infraestructura básica, apoyé la administración de sistemas y documenté las incidencias para agilizar su seguimiento.

**Tecnologías:** Soporte IT · Sistemas · Redes

## Proyectos públicos

### Lakehouse y MLOps de churn telco (2026)

Plataforma de datos de principio a fin, desarrollada en coautoría, que predice la baja de clientes de una operadora con datos sintéticos usando PySpark, Delta Lake, Unity Catalog y MLflow.

- Detalles en Markdown: https://alonsomarcosm99.github.io/es/projects/telco-churn-mlops-databricks/index.md
- technical_docs: https://alonsomarcosm99.github.io/databricks-telco-churn-lakehouse/
- case_study: https://alonsomarcosm99.github.io/es/projects/telco-churn-mlops-databricks/
- github: https://github.com/alonsomarcosm99/databricks-telco-churn-lakehouse

### Smart Parking Albacete (2026)

Plataforma IoT en la nube que recoge en tiempo real los datos de 40 sensores de aparcamiento simulados y los publica en un panel web, con AWS Lambda, DynamoDB y MQTT.

- Detalles en Markdown: https://alonsomarcosm99.github.io/es/projects/smart-parking-albacete/index.md
- live_demo: https://smart-parking-albacete.streamlit.app/
- case_study: https://alonsomarcosm99.github.io/es/projects/smart-parking-albacete/
- architecture: https://github.com/alonsomarcosm99/smart-parking-albacete/blob/main/memoria/imagenes/diagrama_arquitectura.png
- github: https://github.com/alonsomarcosm99/smart-parking-albacete

### Plataforma de datos Spark, Kafka y Airflow (2026)

Procesa datos por lotes y en tiempo real con Spark, Kafka y Airflow y los organiza en capas de calidad creciente (arquitectura Medallion) sobre Delta Lake.

- Detalles en Markdown: https://alonsomarcosm99.github.io/es/projects/big-data-catalog-batch-streaming/index.md
- technical_docs: https://alonsomarcosm99.github.io/spark-kafka-airflow-data-platform/
- case_study: https://alonsomarcosm99.github.io/es/projects/big-data-catalog-batch-streaming/
- architecture: https://alonsomarcosm99.github.io/spark-kafka-airflow-data-platform/docs/visualizaciones/arquitectura-ejecutiva.svg
- github: https://github.com/alonsomarcosm99/spark-kafka-airflow-data-platform

### OpenMetadata + DCAT-AP-ES (2026)

Catálogo de metadatos en OpenMetadata sobre Kubernetes que descubre datos de PostgreSQL, los sincroniza y los exporta validados al estándar DCAT-AP-ES.

- Detalles en Markdown: https://alonsomarcosm99.github.io/es/projects/tfm-openmetadata-dcat-ap-es/index.md
- live_demo: https://tfm-plataforma-gobierno-dato.vercel.app
- github: https://github.com/alonsomarcosm99/TFM_Alonso_Marcos_Mu-oz

### Gobierno y Calidad del Dato · UNE (2026)

Caso práctico de gobierno del dato con OpenMetadata y Python que aplica las normas UNE 0077-0081 a la catalogación, la calidad y la trazabilidad.

- Detalles en Markdown: https://alonsomarcosm99.github.io/es/projects/gobierno-calidad-dato-openmetadata/index.md
- technical_docs: https://alonsomarcosm99.github.io/TrabajoGobiernoCalidadDatos/
- github: https://github.com/alonsomarcosm99/TrabajoGobiernoCalidadDatos

### Honeypot en AWS con Terraform (2026)

Honeypot SSH con análisis serverless de logs e infraestructura como código.

- Detalles en Markdown: https://alonsomarcosm99.github.io/es/projects/honeypot-aws-terraform/index.md
- technical_docs: https://alonsomarcosm99.github.io/DAMN-TEAMSSN/
- github: https://github.com/alonsomarcosm99/DAMN-TEAMSSN

### Ejecución remota de scripts en R (2025)

Aplicación full stack para ejecutar scripts R mediante una API REST con una instancia dedicada por usuario.

- Detalles en Markdown: https://alonsomarcosm99.github.io/es/projects/tfg-remote-r-scripts/index.md
- technical_docs: https://alonsomarcosm99.github.io/TFG_AlonsoMarcosMu-oz/
- github: https://github.com/alonsomarcosm99/TFG_AlonsoMarcosMu-oz

## Competencias

- **Ingeniería de datos:** Python · ETL / ELT · Modelado de datos · CKAN + extensiones · PostgreSQL · Oracle · Redis · Solr · SQL avanzado · REST APIs · Jinja2
- **Big Data:** Apache Spark · Apache Airflow · Apache Kafka · Delta Lake · MinIO · Databricks · MLflow · Unity Catalog
- **Cloud y DevOps:** AWS · Terraform · Docker / Compose · Podman · Kubernetes · Helm · nginx · Linux / SSH · Git / GitLab / GitHub
- **Gobernanza y calidad del dato:** DCAT-AP-ES · RDF · JSON-LD · SHACL / pySHACL · OpenMetadata · Metadata management · Data lineage · UNE 0077–0081
- **IA aplicada y calidad:** AI harness engineering · Context engineering · Automatización de flujos técnicos · Pruebas end-to-end asistidas · Revisión técnica de código · Documentación reproducible
- **Gestión e idiomas:** PMI / CAPM · Kanban · ADOCC · Español (nativo) · Inglés B2

## Formación

- **Máster Universitario en Big Data y Computación en la Nube** — UCLM · Sept. 2025 – Jul. 2026 · Finalizado · TFM 9,2/10 · https://esi.uclm.es/mubdcn/
- **Grado en Ingeniería Informática · Especialización en Tecnologías de la Información** — UCLM · Sept. 2019 – Jun. 2025 · https://esi.uclm.es/index.php/grado-en-ingenieria-informatica/
- **C.F.G.S. en Administración de Sistemas Informáticos en Red** — IES Juan Bosco · Sept. 2017 – Jun. 2019 · https://iesjuanbosco.es/index.php/departamentos-fp/informatica?set_color=orange

## Certificaciones

- **CAPM** — Project Management Institute. Fundamentos certificados de dirección de proyectos PMI. https://www.pmi.org/certifications/certified-associate-capm
- **First Certificate in English (B2)** — Cambridge English. Competencia profesional acreditada en inglés. https://www.cambridgeenglish.org/es/exams-and-tests/first/

## Contacto y perfiles públicos

- Email: mailto:alonsomarcosm99@gmail.com
- GitHub: https://github.com/alonsomarcosm99
- LinkedIn: https://www.linkedin.com/in/alonsomarcosm99/
- Timeline CV · Manfred: https://www.getmanfred.com/perfil/735337eb-0689-4fa6-8776-0dc0784bfb27
- Perfil profesional · Tecnoempleo: https://www.tecnoempleo.com/alonso-marcos-munoz.mpt
- Email: mailto:alonsomarcosm99@gmail.com
- CV PDF: https://alonsomarcosm99.github.io/cv/CV_Alonso_Marcos_Muñoz_ES.pdf
