Fundamentos Modernos de Data & AI + Ingesta a Escala
Objetivo: Establecer las bases del ecosistema Databricks y la arquitectura Lakehouse, y dominar las técnicas de ingesta batch y streaming con Auto Loader y Spark Structured Streaming.
- Arquitectura Lakehouse vs Data Warehouse
- Clusters y runtime de Databricks
- Notebooks, repos y control de versiones
- Introducción a Delta Lake
- Auto Loader y Structured Streaming
- Fuentes de datos: S3, ADLS, GCS
- Schema evolution y enforcement
- Checkpointing y manejo de errores
Lab práctico: Configurar un workspace Databricks y construir un pipeline de ingesta continua desde S3 hacia una tabla Delta.
Resultado: Entendimiento sólido del entorno Databricks y capacidad de diseñar pipelines de ingesta robustos para datos en movimiento.