1. Migration von SQL nach PySpark
Die zentralen SQL-Statements wurde vollständig in PySpark überführt – der Open-Source-Engine, die in Databricks nativ unterstützt wird. Dadurch wurde der Code deutlich flexibler, besser wartbar und konnte einfacher in Pipelines eingebettet werden.
2. Optimierung des Ladeprozesses
Anfangs liefen die Jobs auf einem All-Purpose Cluster, was für erste Tests ausreichend war. In späteren Projektphasen erfolgte die Umstellung auf Job Cluster, die automatisch starten, ausführen und wieder gestoppt werden – eine Maßnahme, die die Kosten spürbar reduzierte.
3. Ausbau zur Multi-Pipeline-Struktur
Jeder Fachbereich hatte eigene Anforderungen – ob Reporting, Planung oder Controlling. Dadurch entwickelte sich aus einem anfänglichen SQL-Skript eine Struktur mit fünf dedizierten ETL-Pipelines, über die sich die Fachbereiche heute mit einem Knopfdruck mit aktuellen Daten versorgen können.
4. Nutzung des Unity-Catalogs
Auch Daten aus Excel- oder CSV-Dateien lassen sich problemlos nutzen: Über den Unity Catalog werden sie in Databricks eingebunden, wo sie mit den integrierten Funktionen verarbeitet und ohne Umwege in bestehende Pipelines integriert werden können. Kundennutzen: Automatisierung, Effizienz und Zukunftssicherheit.