Kontakt aufnehmen

Schulungsübersicht

Einführung in Apache Airflow

  • Was ist Workflow-Orchestrierung
  • Wichtige Funktionen und Vorteile von Apache Airflow
  • Verbesserungen in Airflow 2.x und Überblick über das Ökosystem

Architektur und Kernkonzepte

  • Scheduler, Webserver und Worker-Prozesse
  • DAGs, Tasks und Operatoren
  • Executors und Backends (Local, Celery, Kubernetes)

Installation und Einrichtung

  • Installation von Airflow in lokalen und Cloud-Umgebungen
  • Konfiguration von Airflow mit verschiedenen Executors
  • Einrichtung von Metadaten-Datenbanken und Verbindungen

Navigation in der Airflow UI und CLI

  • Erkundung der Airflow-Weboberfläche
  • Überwachung von DAG-Läufen, Tasks und Protokollen
  • Verwendung der Airflow-CLI für Verwaltungsaufgaben

Erstellen und Verwalten von DAGs

  • Erstellung von DAGs mit der TaskFlow API
  • Verwendung von Operatoren, Sensoren und Hooks
  • Verwaltung von Abhängigkeiten und Planungsintervallen

Integration von Airflow mit Daten- und Cloud-Diensten

  • Anbindung an Datenbanken, APIs und Nachrichtenschlangen
  • Durchführung von ETL-Pipelines mit Airflow
  • Cloud-Integrationen: AWS-, GCP- und Azure-Operatoren

Überwachung und Observierbarkeit

  • Task-Protokolle und Echtzeit-Überwachung
  • Metriken mit Prometheus und Grafana
  • Alerting und Benachrichtigungen per E-Mail oder Slack

Absicherung von Apache Airflow

  • Rollenbasierte Zugriffskontrolle (RBAC)
  • Authentifizierung mit LDAP, OAuth und SSO
  • Geheimnisverwaltung mit Vault und Cloud-Secret-Store

Skalierung von Apache Airflow

  • Parallelität, Konkurrenz und Task-Warteschlangen
  • Verwendung von CeleryExecutor und KubernetesExecutor
  • Deployment von Airflow auf Kubernetes mit Helm

Best Practices für die Produktion

  • Versionskontrolle und CI/CD für DAGs
  • Testen und Debuggen von DAGs
  • Aufrechterhaltung von Zuverlässigkeit und Leistung bei Skalierung

Fehlersuche und Optimierung

  • Debuggen fehlgeschlagener DAGs und Tasks
  • Optimierung der DAG-Leistung
  • Häufige Fehlerquellen und wie man sie vermeidet

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Erfahrung mit Python-Programmierung
  • Vertrautheit mit Konzepten der Data Engineering oder DevOps
  • Verständnis von ETL oder Workflow-Orchestrierung

Zielgruppe

  • Data Scientists
  • Data Engineers
  • DevOps- und Infrastruktur-Engineers
  • Softwareentwickler
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (7)

Kommende Kurse

Verwandte Kategorien