Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
EXO Infrastructure as Code
- Übersicht über EXO-Bereitstellungsmuster: Single-Node, Multi-Node und RDMA-Cluster
- Automatisierte Installation von Abhängigkeiten (Xcode, uv, Node.js, Rust) durch Konfigurationsmanagement
- Nutzung von Nix Flakes für reproduzierbare EXO-Builds und Entwicklerumgebungen
- Schreiben von Ansible-Playbooks oder Shell-Skripts zur automatisierten Bereitstellung von Clustern
Reproduzierbare Builds und CI-Integration
- Pinnen von Abhängigkeiten und Erstellen des Dashboards in CI-Pipelines
- Ausführen von EXO-Rauchen im GitHub Actions oder GitLab CI-Läufern
- Erstellung von Gold-Images und snapshot-basierten Rollback-Workflows für macOS- und Linux-VMs
- Versionierung benutzerdefinierter Model-Cards gemeinsam mit dem Anwendungscode
Cluster-Erkennung und Netzwerkautomatisierung
- Konfigurieren von mDNS und statischem DNS für zuverlässige libp2p-Node-Erkennung
- Automatisierte Erstellung von Netzwerkprofilen und Thunderbolt-Brücken-Verwaltung auf macOS
- Nutzung benutzerdefinierter Namespaces (EXO_LIBP2P_NAMESPACE), um Entwicklungs-, Staging- und Produktionscluster zu trennen
- Firewall-Regeln und Netzwerktrennung für Multi-Tenant-Umgebungen
Speicher- und Modell-Lebenszyklusmanagement
- Gestaltung von EXO_MODELS_DIRS- und EXO_MODELS_READ_ONLY_DIRS-Strategien
- Bereitstellen von NFS- oder SAN-Shares als schreibgeschützte Model-Repositorien für schnelles Provisioning
- Säuberung abgelaufener Caches und Aufbewahrungsrichtlinien für versionierte Gewichte
- Automatisierte Vorbereitung des Modellvorabdownloads und Gesundheitschecks vor Rolling Updates
Überwachung und Alerting
- Senden von EXO-Logs an zentrale Logging-Systeme (ELK, Loki oder Splunk)
- Erstellen von Grafana-Dashboards basierend auf EXO_TRACING_ENABLED-Ausgaben
- Alerting bei Änderungen der Cluster-Mitgliedschaft, OOM-Ereignissen und Anstieg der Inferenz-Latenz
- Korrelation von macmon-Hardware-Telemetrie mit Modellergebnisregressionen
Aktualisierung, Rollback und Disaster Recovery
- Staging von EXO-Binärupdates in einem Canary-Node vor der rollout across alle Nodes
- Modell-Rollback: Umschalten zwischen quantisierten Versionen ohne erneuten Download
- Sichern und Wiederherstellen des Cluster-Zustands, benutzerdefinierter Namespaces und zwischengespeicherter Gewichte
- Dokumentieren von Recovery-Runbooks für Szenarien eines kompletten Cluster-Wiederaufbaus
Sicherheitshärting und Compliance
- Aktivieren von TLS an der Reverse-Proxy-Ebene (nginx, traefik) für Dashboard und API
- Implementierung von API-Rate-Limiting und IP-Whitelisting für EXO-Endpoints
- Trennung der Cluster durch VLANs und Zero-Trust-Netzwerkrichtlinien
- Überprüfung des Zugriffs und Pflegen eines Inventars bereitgestellter Modelle und Versionen
Voraussetzungen
- Erfahrung mit DevOps-Praktiken (CI/CD, IaC, Container-Orchestrierung)
- Vertrautheit mit macOS- oder Linux-Systemadministration und Paketverwaltung
- Verständnis von Netzwerk-, DNS- und Speicher Konzepten
Zielgruppe
- DevOps-Ingenieure
- Infrastrukturarchitekten
- SREs, die für On-Premise-KI-Arbeitslasten verantwortlich sind
21 Stunden
Erfahrungsberichte (2)
Craig war extrem engagiert im Training und hat stets darauf geachtet, dass wir aufmerksam sind. Er passte die Beispiele an unsere täglichen Aktivitäten an und gab immer eine Antwort, wenn danach gefragt wurde, auch wenn die Information nicht im Präsentationsmaterial enthalten war.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Kurs - DevOps Foundation®
Maschinelle Übersetzung
Hoher Einsatz und Fachwissen des Trainers
Jacek - Softsystem
Kurs - DevOps Engineering Foundation (DOEF)®
Maschinelle Übersetzung