Kontakt aufnehmen

Schulungsübersicht

Einführung in EXO und lokales AI-Clustering

  • Übersicht des EXO-Frameworks und des exo-explore-Ökosystems
  • Vergleich zentralisierter Cloud-Inferenz mit verteilter lokaler Inferenz
  • Architektur: libp2p-Gerätediscovery, MLX-Backend, Dashboard und API-Schichten
  • Hardwareanforderungen: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, gemeinsam genutzter Speicher

EXO auf macOS installieren

  • Einrichten von Xcode, Metal ToolChain und macOS-Voraussetzungen
  • Installieren von uv, Node.js, Rust nightly toolchain
  • Installieren des gepinnten macmon-Forks zur Überwachung von Apple Silicon
  • Klonen des Repositorys und Erstellen des Dashboards mit npm
  • Ausführen von EXO aus der Quelle und Überprüfen des Dashboards unter localhost:52415

EXO auf Linux installieren

  • Installieren von Abhängigkeiten über apt oder Homebrew auf Linux
  • Konfigurieren von uv, Node.js 18+ und Rust nightly
  • Erstellen des Dashboards und Ausführen von EXO im reinen CPU-Modus
  • Verzeichnisstruktur: XDG Base Directory-Pfade für Konfiguration, Daten, Cache und Protokolle

Automatische Gerätediscovery und Clusterbildung

  • Verstehen der libp2p-basierten Auto-Discovery über lokale Netzwerke
  • Konfigurieren benutzerdefinierter Namespaces mit EXO_LIBP2P_NAMESPACE für Cluster-Isolation
  • Überprüfen der Knotenmitgliedschaft in der Dashboard-Clusteransicht
  • Behandeln von Discovery-Fehlern und Netzwerksegmentierungsproblemen

Aktivieren von RDMA über Thunderbolt 5

  • RDMA-Architektur und der Anspruch einer Reduzierung der Latenz um 99 Prozent
  • Aktivieren von RDMA im macOS Recovery-Modus mit rdma_ctl
  • Kabelanforderungen und Port-Topologie-Einschränkungen am Mac Studio
  • Abgleich der macOS-Versionen über alle Cluster-Knoten hinweg
  • Fehlersuche bei RDMA-Discovery und DHCP-Konfiguration

Bereitstellung von Frontier Models

  • Nutzen des Dashboards zum Laden und Sharden von DeepSeek v3.1, Qwen3-235B und Llama-Familienmodellen
  • Vorschau der Instanzplatzierungen über das /instance/previews API-Endpunkt
  • Erstellen von Model-Instanzen mit Pipeline- oder Tensor-Parallel-Sharding
  • Konfigurieren benutzerdefinierter Model-Cards vom HuggingFace Hub

Überwachung und Fehlerbehebung

  • Lesen von EXO-Protokollen und Verstehen verteilter Traces
  • Interpretieren der Cluster-Gesundheit in der Dashboard-Clusteransicht
  • Diagnostizieren von Worker-Knotenausfällen und Wiederverbindungsverhalten
  • Nutzen von EXO_TRACING_ENABLED für die Analyse von Leistungsengpässen

Cluster-Wartung und Updates

  • Aktualisieren der EXO-Binärrdateien und Verfahren zum Neuerstellen des Dashboards
  • Migrieren von Model-Caches und Verwalten vorher heruntergeladener Modelle über NFS
  • Graceful Entfernen von Knoten und Lastausgleich

Voraussetzungen

  • Grundlegendes Verständnis von Netzwerkfundiamenten (IP, Subnetting, Firewalls)
  • Erfahrung in der macOS- oder Linux-Befehlszeilenadministration
  • Vertrautheit mit Python-Paketverwaltung (pip/uv) und Node.js-Tooling

Zielgruppe

  • Systemadministratoren
  • DevOps-Ingenieure
  • AI-Infrastrukturarchitekten, die für On-Premise-LLM-Bereitstellungen verantwortlich sind
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien