- Einführung in Apache Spark Grundlagen:
- Verortung und Kontext des Frameworks (Vergleich mit Pyspark, Hadoop und Kubernetes)
- Grundlegende Prinzipien der verteilten Datenverarbeitung durch Apache Spark
Erste Schritte in der PySpark-Welt:
- Essenzielle DataFrames-Grundlagen
- Einbindung von JSON- und CSV-Daten
- Einfache Datentransformationen (Projektionen, Filterung, grundlegende Funktionen...)
Weitere Datentransformationen erkunden:
- Gruppierte Aggregationen verstehen
- Sortierung von Daten
- Joins von Datensätzen
UDF - User Defined Functions verwenden:
- Effiziente Nutzung von Pandas UDFs in PySpark
- Einsatzbereiche von UDFs
Datenhaltung und Speicherung:
- Überblick über kompatible Dateiformate
Grundlagen des Maschinellen Lernens:
- Modelltraining und -entwicklung
- Einführung in Regressionsmodelle
- Verwendung von Trainings- und Validierungsdaten
- Bewertungsmetriken für Modellleistungen
- Praktische Übung mit dem Datensatz des NYC Taxis
Vorbereitung der Daten:
- Formatumwandlungen für beschleunigte Verarbeitung
- Integration diverser Datenquellen
Datenexploration:
- Anfängliche einfache Datenanalysen und -visualisierungen
- Datenreduktion durch Aggregation
Modelltraining:
- Maschinelles Lernen mit PySpark umsetzen
Verfeinerung des Modells:
- Bewertung des Modells mittels geeigneter Metriken
- Optimierung durch Integration neuer Eigenschaften
- Austausch von Ideen zur weiteren Verbesserung
-
Methode
Dieses Big Data Seminar legt einen großen Fokus auf praktische Anwendungen. Die Konzepte werden während der Schulung anhand von Folien erklärt und durch Beispiele veranschaulicht. In den Übungseinheiten haben die Teilnehmer:innen die Möglichkeit, das Gelernte mithilfe der Programmiersprache Python in der Cloud mit Jupyter Notebooks umzusetzen. Die Trainer:innen stehen den Teilnehmenden bei verschiedenen Aufgaben zur Seite und begleiten sie bei Fragen.