- Modul 1: Architektur & Modern Data Stack
- ELT vs. ETL: Paradigmen, die heute zählen
- Überblick über dlt, dbt, DuckDB, Spark & Kafka
- Rolle von Storage, Compute und Metadaten
Modul 2: Daten laden & vorbereiten (Ingestion & Staging)
- Quellen: APIs, Datenbanken, Flat Files
- Einsatz von dlt zur Datenaufnahme
- Versionierung & Change Tracking
Modul 3: Datenmodellierung & Transformation mit dbt
- Lakehouse & Medallion Modellierung
- Datenqualität, Tests & Dokumentation
- Best Practices für Wiederverwendungsfähigkeit
Modul 4: Datenanalyse & Exploration mit DuckDB
- Lokale Query Engines effizient nutzen
- Performancevorteile gegenüber klassischen Tools
- Analysepipeline entwickeln
Modul 5: Skalierung & Betrieb
- Batch-Verarbeitung mit Apache Spark
- Streaming mit Apache Kafka
- Performance, Monitoring & Kostenoptimierung
Modul 6: Stabiler Betrieb & Takeaways
- Pipeline-Orchestrierung und Deployment
- Logging, Alerting & Fehlermanagement
- Best Practices & Transfer in den eigenen Kontext
Methode
Das Seminar kombiniert Hands-on Labs, Live Coding, Mini-Projekte, technische Impulse, Diskussion realer Anwendungsfälle sowie Best Practices und Troubleshooting-Sessions.Der Fokus liegt klar auf praktischer Umsetzung: Die Teilnehmenden arbeiten mit vorbereiteten Übungen, realitätsnahen Daten und nachvollziehbaren Patterns. Dadurch entsteht eine direkte Verbindung zwischen Schulungsinhalten und typischen Anforderungen aus Data-Engineering-Projekten.