Kontakt aufnehmen

Schulungsübersicht

EXO Infrastructure as Code

  • Übersicht über EXO-Bereitstellungsmuster: Single-Node, Multi-Node und RDMA-Cluster
  • Automatisierte Installation von Abhängigkeiten (Xcode, uv, Node.js, Rust) durch Konfigurationsmanagement
  • Nutzung von Nix Flakes für reproduzierbare EXO-Builds und Entwicklerumgebungen
  • Schreiben von Ansible-Playbooks oder Shell-Skripts zur automatisierten Bereitstellung von Clustern

Reproduzierbare Builds und CI-Integration

  • Pinnen von Abhängigkeiten und Erstellen des Dashboards in CI-Pipelines
  • Ausführen von EXO-Rauchen im GitHub Actions oder GitLab CI-Läufern
  • Erstellung von Gold-Images und snapshot-basierten Rollback-Workflows für macOS- und Linux-VMs
  • Versionierung benutzerdefinierter Model-Cards gemeinsam mit dem Anwendungscode

Cluster-Erkennung und Netzwerkautomatisierung

  • Konfigurieren von mDNS und statischem DNS für zuverlässige libp2p-Node-Erkennung
  • Automatisierte Erstellung von Netzwerkprofilen und Thunderbolt-Brücken-Verwaltung auf macOS
  • Nutzung benutzerdefinierter Namespaces (EXO_LIBP2P_NAMESPACE), um Entwicklungs-, Staging- und Produktionscluster zu trennen
  • Firewall-Regeln und Netzwerktrennung für Multi-Tenant-Umgebungen

Speicher- und Modell-Lebenszyklusmanagement

  • Gestaltung von EXO_MODELS_DIRS- und EXO_MODELS_READ_ONLY_DIRS-Strategien
  • Bereitstellen von NFS- oder SAN-Shares als schreibgeschützte Model-Repositorien für schnelles Provisioning
  • Säuberung abgelaufener Caches und Aufbewahrungsrichtlinien für versionierte Gewichte
  • Automatisierte Vorbereitung des Modellvorabdownloads und Gesundheitschecks vor Rolling Updates

Überwachung und Alerting

  • Senden von EXO-Logs an zentrale Logging-Systeme (ELK, Loki oder Splunk)
  • Erstellen von Grafana-Dashboards basierend auf EXO_TRACING_ENABLED-Ausgaben
  • Alerting bei Änderungen der Cluster-Mitgliedschaft, OOM-Ereignissen und Anstieg der Inferenz-Latenz
  • Korrelation von macmon-Hardware-Telemetrie mit Modellergebnisregressionen

Aktualisierung, Rollback und Disaster Recovery

  • Staging von EXO-Binärupdates in einem Canary-Node vor der rollout across alle Nodes
  • Modell-Rollback: Umschalten zwischen quantisierten Versionen ohne erneuten Download
  • Sichern und Wiederherstellen des Cluster-Zustands, benutzerdefinierter Namespaces und zwischengespeicherter Gewichte
  • Dokumentieren von Recovery-Runbooks für Szenarien eines kompletten Cluster-Wiederaufbaus

Sicherheitshärting und Compliance

  • Aktivieren von TLS an der Reverse-Proxy-Ebene (nginx, traefik) für Dashboard und API
  • Implementierung von API-Rate-Limiting und IP-Whitelisting für EXO-Endpoints
  • Trennung der Cluster durch VLANs und Zero-Trust-Netzwerkrichtlinien
  • Überprüfung des Zugriffs und Pflegen eines Inventars bereitgestellter Modelle und Versionen

Voraussetzungen

  • Erfahrung mit DevOps-Praktiken (CI/CD, IaC, Container-Orchestrierung)
  • Vertrautheit mit macOS- oder Linux-Systemadministration und Paketverwaltung
  • Verständnis von Netzwerk-, DNS- und Speicher Konzepten

Zielgruppe

  • DevOps-Ingenieure
  • Infrastrukturarchitekten
  • SREs, die für On-Premise-KI-Arbeitslasten verantwortlich sind
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (2)

Kommende Kurse

Verwandte Kategorien