Developing Code for Data Processing using Python and SQL
Objetivo: Escribir y optimizar código de producción con las APIs de Spark, Python y SQL.
- Estructura de proyectos Python para Declarative Automation Bundles (antes Databricks Asset Bundles / DABs)
- Gestión de dependencias de terceros: paquetes PyPI, wheels locales y source archives
- UDFs con Pandas/Python UDF, streaming tables vs. materialized views
- AUTO CDC APIs (antes APPLY CHANGES) para simplificar CDC en Lakeflow Spark Declarative Pipelines
- Control flow operators (if/else, for/each) y testing con assertDataFrameEqual/assertSchemaEqual
Lab práctico: Refactorizar un pipeline batch a Lakeflow Spark Declarative Pipelines con AUTO CDC APIs y tests con assertDataFrameEqual.
Resultado: Código de producción idiomático en Python/SQL listo para el bloque de mayor peso del examen.