Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Entwurf einer offenen AIOps-Architektur
- Überblick über die zentralen Bestandteile von Open-AIOps-Pipelines
- Datenfluss von der Erfassung bis zur Alarmierung
- Vergleich verschiedener Tools sowie Strategie zur Integration
Datenerfassung und -aggregation
- Zeitreihendaten mit Prometheus erfassen
- Protokolle mittels Logstash sowie Beats sammeln
- Daten zur Verknüpfung aus unterschiedlichen Quellen normalisieren
Erstellung von Beobachtbarkeits-Dashboards
- Metriken mit Grafana visualisieren
- Kibana-Dashboards zur Analyse von Logdaten erstellen
- Elasticsearch-Abfragen nutzen, um wertvolle Betriebserkenntnisse zu gewinnen
Anomalieerkennung und Vorhersage von Störungen
- Beobachtbarkeitsdaten in Python-Workflows exportieren
- ML-Modelle zur Ausreißer-Erkennung sowie Prognoseentwicklung trainieren
- Einsatz der Modelle für Echtzeit-Inferenzen innerhalb der AIOps-Pipeline
Alarmierung und Automatisierung mithilfe offener Tools
- Erstellung von Prometheus-Alarmregeln sowie Routing per Alertmanager
- Auslösen von Skripten oder API-Workflows zur automatischen Reaktion
- Nutzung von Open-Source-Orchestrierungswerkzeugen wie Ansible oder Rundeck
Integrations- und Skalierbarkeitsaspekte
- Umgehen großer Datenvolumina sowie langfristige Speicherung sicherstellen
- Sicherheitsmaßnahmen und Zugriffssteuerung in Open-Source-Umgebungen
- Unabhängige Skalierung der einzelnen Layer: Datenerfassung, Verarbeitung sowie Alarmierung
Praxisbeispiele und Weiterentwicklungsmöglichkeiten
- Fallstudien: Leistungsoptimierung, Vermeidung von Ausfallzeiten sowie Kostenreduzierung
- Erweiterung der Pipeline um Tracing-Tools oder Service-Graphen
- Bewährte Vorgehensweisen für den Betrieb und die Pflege von AIOps-Systemen in Produktion
Zusammenfassung sowie weitere Schritte
Voraussetzungen
- Erfahrung mit Beobachtbarkeitstools wie Prometheus oder ELK
- Grundlegende Kenntnisse in Python sowie im Bereich maschinelles Lernen
- Verständnis von IT-Operationen und Alerting-Prozessen
Zielgruppe
- Erfahrene Site Reliability Engineers (SREs)
- Dateningenieure im operativen Umfeld
- DevOps-Plattformleiter sowie Infrastrukturadministratoren
14 Stunden