- Tag 1: Grundlagen, Architektur, Datenaufnahme, SQL
- 1. Einführung in BigQuery
- Übersicht und Ziele: Was ist BigQuery und warum ist es 2026 wichtig?
- Historische Entwicklung und Hauptmerkmale
- Architektur: serverlose Welt mit Trennung von Speicher (Capacitor) und Compute (Dremel)
- Platzierung innerhalb von Google Cloud
- Anwendungs-Bereiche: typische Einsatz-Szenarien für BigQuery im Data Warehousing und Analytics
- Markt-Welt 2026: Wettbewerb mit Snowflake (Cortex AI), Amazon Redshift (Amazon Q), Databricks (MosaicAI), Microsoft Fabric (Copilot)
- BigQuery Editions (Standard, Enterprise, Enterprise Plus) seit 2023 als Preis-Welt
- BigQuery Omni für Multi-Cloud (AWS S3, Azure Blob) als BigQuery-Stärke
- 2. Einrichtung und Konfiguration
- Erste Schritte: Voraussetzungen für die Nutzung von BigQuery, Einrichtung eines Google Cloud-Projekts
- Anlegen eines BigQuery-Datasets und erste Konfigurationen
- Arbeits-Umgebung: Überblick über die BigQuery-Webkonsole, CLI und APIs
- Aktualität: BigQuery Studio als integrierte Werkstatt seit 2024 - SQL, Python, Spark und Notebooks in einer Oberfläche, Versionierung über Git, Vertex AI-Anbindung nativ
- Region-Auswahl mit Daten-Standort-Sicht (Frankfurt, Belgien, Niederlande, Finnland) für DSGVO-Welt
- 3. Datenaufnahme und -speicherung
- Daten-Import: verschiedene Methoden (CSV, JSON, Avro, Parquet, ORC)
- Daten-Quellen: Integration externer Quellen wie Google Sheets, Cloud Storage, Drive
- Daten-Organisation: Tabellen, Datasets und Projekt-Strukturen in BigQuery
- Aktualität: BigLake als Lakehouse-Welt seit 2023, Apache Iceberg Tables seit 2024 für Open Table Format mit Multi-Engine-Zugriff (BigQuery plus Spark plus Trino plus Flink)
- Object Tables für unstrukturierte Daten (Bilder, Videos, Dokumente) mit Anbindung an Cloud Vision API und Document AI
- BigQuery Data Transfer Service für automatisierte Übertragungen
- 4. Grundlegende Abfragen und SQL
- BigQuery-SQL: Einführung in den SQL-Dialekt von BigQuery (Standard SQL)
- Grundlegende Abfragen und Syntax
- Abfrage-Optimierung: erste Schritte zur Optimierung für bessere Performance
- Speicher und Kosten: Überblick über die Speicher-Optionen und Kosten-Modelle (Slots, On-Demand, Editions)
- Aktualität: Gemini Code Assist in BigQuery Studio für KI-gestützte SQL-Erstellung; Natural Language to SQL über Gemini - Fragen auf Deutsch oder Englisch stellen, BigQuery generiert SQL
- Praxis-Übung 1: Einrichtung und erste Abfragen
- Problem: BigQuery-Projekt einrichten und erste Daten-Abfragen durchführen, um die grundlegenden Funktionen und das Abfrage-System zu verstehen
- Lösung: Google-Cloud-Projekt einrichten, BigQuery-Dataset erstellen, Rollen und Berechtigungen zuweisen, Beispiel-Datensatz importieren, grundlegende Abfragen durchführen, optional BigQuery Studio mit Gemini Code Assist nutzen
- Tools: Google Cloud-Konto (Free Tier mit 300 USD Guthaben), BigQuery Studio, Beispiel-Datensatz
- Ergebnis: funktionierendes BigQuery-Projekt mit erfolgreich durchgeführten Abfragen
- Tag 2: Erweiterte SQL, Gemini, Datenmodellierung
- 5. Erweiterte SQL-Funktionen
- Joins und Subqueries: Nutzung von INNER, LEFT, RIGHT, FULL JOIN, Subqueries und Common Table Expressions (CTEs)
- Fenster-Funktionen: Einführung und Anwendung für komplexe Analysen
- User-Defined Functions (UDFs): Erstellung und Nutzung in SQL und JavaScript
- Aktualität: Gemini-LLM-Funktionen in SQL (seit 2024):
- ML.GENERATE_TEXT für Text-Generierung mit Gemini-Modellen
- ML.UNDERSTAND_TEXT für NLP-Aufgaben (Sentiment, Entity Recognition)
- ML.TRANSLATE für Übersetzung in SQL
- ML.GENERATE_EMBEDDING für Vector-Embeddings (text-embedding-004, multilingual-embedding)
- Vector Search mit Cosine Similarity und Euclidean Distance für semantische Suche
- 6. Datenmodellierung und -organisation
- Schema-Design: Best Practices für das Design von Daten-Modellen in BigQuery
- Partitionierung und Clustering zur Optimierung der Abfrage-Performance
- Nested und Repeated Data (BigQuery-spezifische Stärke): STRUCT- und ARRAY-Welten, Denormalisierung versus Normalisierung
- Daten-Pflege: Strategien zur Pflege und Archivierung in BigQuery
- Materialized Views und Continuous Queries für deklarative Aktualisierung
- Aktualität: BigQuery ML-Modelle als Teil der Modellierungs-Welt (CREATE MODEL für Forecasting, Klassifikation, Regression, Anomalie-Erkennung)
- Tag 3: Pipelines, Sicherheit, BI, Schluss-Werkstatt
- 7. Integration und Datenpipelines
- ETL-Prozesse: Aufbau und Verwaltung mit Google Cloud Dataflow und weiteren Werkzeugen
- BigQuery Data Transfer Service: automatisierte Daten-Übertragungen
- Echtzeit-Datenverarbeitung: Implementierung von Echtzeit-Pipelines mit Pub/Sub und Dataflow
- Aktualität: Continuous Queries seit 2024 für SQL-basierte Streaming-Welten - deklarative Alternative zu klassischen Pub/Sub-Dataflow-Pipelines in vielen Welten
- Integration externer ETL-Werkzeuge: dbt, Fivetran, Airbyte
- Datastream für CDC-Welten (Change Data Capture)
- 8. Sicherheit und Berechtigungen
- Zugriffs-Steuerung: Verwaltung von Zugriffs-Rechten und Rollen innerhalb von BigQuery (IAM)
- Daten-Verschlüsselung: Überblick über die Verschlüsselungs-Optionen (Google-managed, Customer-managed Keys, Customer-supplied Keys)
- Compliance: Einhaltung von Datenschutz-Richtlinien und gesetzlichen Anforderungen
- Aktualität: DSGVO mit Daten-Residency in EU-Regionen (Frankfurt, Belgien, Niederlande, Finnland), Sovereign Cloud-Optionen
- EU AI Act seit 2. August 2026 bei Gemini-Funktionen mit Transparenz-Pflicht
- Column-Level Security, Row-Level Security, Dynamic Data Masking
- VPC Service Controls und Private Service Connect
- Praxis-Übung 2: Implementierung einer modernen Datenpipeline mit Gemini
- Problem: Datenpipeline zur Integration und Verarbeitung von Daten aus verschiedenen Quellen aufbauen, mit moderner Welt (Continuous Queries oder Materialized Views) und KI-Anreicherung über Gemini
- Lösung: Daten aus zwei Quellen (CSV in Cloud Storage und Pub/Sub-Stream) in BigQuery integrieren, eine Materialized View oder Continuous Query für deklarative Aktualisierung erstellen, Gemini-LLM-Funktion für Anreicherung der Daten nutzen (z.B. ML.UNDERSTAND_TEXT für Sentiment auf Text-Spalten), Ergebnis in einem BI-Werkzeug visualisieren
- Tools: BigQuery Studio, Pub/Sub als Quelle, Gemini-Anbindung über BigQuery ML, Looker Studio oder Tableau für BI
- Ergebnis: funktionale Datenpipeline mit deklarativer Aktualisierung, Gemini-Anreicherung und BI-Visualisierung
- 9. Datenvisualisierung und Reporting
- Integration mit BI-Werkzeugen: Verbindung von BigQuery mit Looker Studio (vormals Google Data Studio), Looker (Enterprise-BI), Tableau, Power BI
- Erstellung interaktiver Dashboards und Berichte
- Best Practices für Daten-Visualisierung und Dashboard-Design
- Aktualität: Data Canvas in BigQuery Studio mit Gemini für KI-gestütztes Visual Query Building
- Direct Query versus Daten-Import-Welt
- Performance-Optimierung in der BI-Anbindung (BI Engine, Materialized Views, Reservations)
LernzieleJede teilnehmende Person verlässt das Seminar mit einem funktionierenden BigQuery-Projekt aus Praxis-Übung 1, einer modernen Datenpipeline mit deklarativer Aktualisierung und Gemini-Anreicherung aus Praxis-Übung 2, einem Verständnis für die 2024er- und 2026er-Welten (Gemini, BigQuery Studio, BigLake mit Iceberg, Editions, Omni, Object Tables, Vector Search), einer Sicherheits- und Compliance-Sicht mit DSGVO und EU-AI-Act-Bezug sowie konkreten Anwendungs-Ideen für die eigene Daten-Welt.
ZielgruppenDieses Seminar richtet sich an Datenanalysten, Datenwissenschaftler, IT-Administratoren und BI-Experten, die ihre Kenntnisse in der Nutzung von BigQuery erweitern möchten. Grundlegende Kenntnisse in Datenanalyse und SQL sind hilfreich