Kontakt aufnehmen

Schulungsübersicht

Entwurf einer offenen AIOps-Architektur

  • Überblick über die zentralen Bestandteile von Open-AIOps-Pipelines
  • Datenfluss von der Erfassung bis zur Alarmierung
  • Vergleich verschiedener Tools sowie Strategie zur Integration

Datenerfassung und -aggregation

  • Zeitreihendaten mit Prometheus erfassen
  • Protokolle mittels Logstash sowie Beats sammeln
  • Daten zur Verknüpfung aus unterschiedlichen Quellen normalisieren

Erstellung von Beobachtbarkeits-Dashboards

  • Metriken mit Grafana visualisieren
  • Kibana-Dashboards zur Analyse von Logdaten erstellen
  • Elasticsearch-Abfragen nutzen, um wertvolle Betriebserkenntnisse zu gewinnen

Anomalieerkennung und Vorhersage von Störungen

  • Beobachtbarkeitsdaten in Python-Workflows exportieren
  • ML-Modelle zur Ausreißer-Erkennung sowie Prognoseentwicklung trainieren
  • Einsatz der Modelle für Echtzeit-Inferenzen innerhalb der AIOps-Pipeline

Alarmierung und Automatisierung mithilfe offener Tools

  • Erstellung von Prometheus-Alarmregeln sowie Routing per Alertmanager
  • Auslösen von Skripten oder API-Workflows zur automatischen Reaktion
  • Nutzung von Open-Source-Orchestrierungswerkzeugen wie Ansible oder Rundeck

Integrations- und Skalierbarkeitsaspekte

  • Umgehen großer Datenvolumina sowie langfristige Speicherung sicherstellen
  • Sicherheitsmaßnahmen und Zugriffssteuerung in Open-Source-Umgebungen
  • Unabhängige Skalierung der einzelnen Layer: Datenerfassung, Verarbeitung sowie Alarmierung

Praxisbeispiele und Weiterentwicklungsmöglichkeiten

  • Fallstudien: Leistungsoptimierung, Vermeidung von Ausfallzeiten sowie Kostenreduzierung
  • Erweiterung der Pipeline um Tracing-Tools oder Service-Graphen
  • Bewährte Vorgehensweisen für den Betrieb und die Pflege von AIOps-Systemen in Produktion

Zusammenfassung sowie weitere Schritte

Voraussetzungen

  • Erfahrung mit Beobachtbarkeitstools wie Prometheus oder ELK
  • Grundlegende Kenntnisse in Python sowie im Bereich maschinelles Lernen
  • Verständnis von IT-Operationen und Alerting-Prozessen

Zielgruppe

  • Erfahrene Site Reliability Engineers (SREs)
  • Dateningenieure im operativen Umfeld
  • DevOps-Plattformleiter sowie Infrastrukturadministratoren
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien