Webinar

PySpark - Big Data Analytics mit Apache Spark und Python (Inhouse)

Inhalte

  • Einführung in Apache Spark Grundlagen:
    • Verortung und Kontext des Frameworks (Vergleich mit Pyspark, Hadoop und Kubernetes)
    • Grundlegende Prinzipien der verteilten Datenverarbeitung durch Apache Spark
    Erste Schritte in der PySpark-Welt:
    • Essenzielle DataFrames-Grundlagen
    • Einbindung von JSON- und CSV-Daten
    • Einfache Datentransformationen (Projektionen, Filterung, grundlegende Funktionen...)
    Weitere Datentransformationen erkunden:
    • Gruppierte Aggregationen verstehen
    • Sortierung von Daten
    • Joins von Datensätzen
    UDF - User Defined Functions verwenden:
    • Effiziente Nutzung von Pandas UDFs in PySpark
    • Einsatzbereiche von UDFs
    Datenhaltung und Speicherung:
    • Überblick über kompatible Dateiformate
    Grundlagen des Maschinellen Lernens:
    • Modelltraining und -entwicklung
    • Einführung in Regressionsmodelle
    • Verwendung von Trainings- und Validierungsdaten
    • Bewertungsmetriken für Modellleistungen
    • Praktische Übung mit dem Datensatz des NYC Taxis
    Vorbereitung der Daten:
    • Formatumwandlungen für beschleunigte Verarbeitung
    • Integration diverser Datenquellen
    Datenexploration:
    • Anfängliche einfache Datenanalysen und -visualisierungen
    • Datenreduktion durch Aggregation
    Modelltraining:
    • Maschinelles Lernen mit PySpark umsetzen
    Verfeinerung des Modells:
    • Bewertung des Modells mittels geeigneter Metriken
    • Optimierung durch Integration neuer Eigenschaften
    • Austausch von Ideen zur weiteren Verbesserung
    •  

Methode

Dieses Big Data Seminar legt einen großen Fokus auf praktische Anwendungen. Die Konzepte werden während der Schulung anhand von Folien erklärt und durch Beispiele veranschaulicht. In den Übungseinheiten haben die Teilnehmer:innen die Möglichkeit, das Gelernte mithilfe der Programmiersprache Python in der Cloud mit Jupyter Notebooks umzusetzen. Die Trainer:innen stehen den Teilnehmenden bei verschiedenen Aufgaben zur Seite und begleiten sie bei Fragen.

  • Einführung in Apache Spark Grundlagen:
    • Verortung und Kontext des Frameworks (Vergleich mit Pyspark, Hadoop und Kubernetes)
    • Grundlegende Prinzipien der verteilten Datenverarbeitung durch Apache Spark
    Er...
Mehr Informationen

Termine und Orte

Datum Preis

+++ Catalog API +++

SG-Seminar-Nr.: 9520912

Anbieter-Seminar-Nr.: 54450 (Inhouse)

Der Anbieter ist für den Inhalt verantwortlich.

Veranstaltungsinformation

  • Webinar
  • Deutsch
    • Keine
  • Anbieterbewertung   (346)

Ihre Vorteile

mehr erfahren
  • Anbietervergleich von über 1.500 Seminaranbietern
  • Vollständige Veranstaltungsinformationen
  • Schnellbuchung
  • Persönlicher Service
Datum Preis