Kontakt aufnehmen
 Dauer 21 Stunden

Schulungsübersicht

Einführung ins Skalieren von Ollama

  • Ollama-Architektur und Überlegungen zur Skalierung
  • Häufige Engpässe bei Mehrbenutzer-Deployment
  • Best Practices für die Infrastruktur-Vorbereitung

Ressourcenzuweisung und GPU-Optimierung

  • Strategien für effiziente CPU/GPU-Nutzung
  • Erwägungen zu Speicher und Bandbreite
  • Ressourcenbeschränkungen auf Container-Ebene

Deployment mit Containern und Kubernetes

  • Containerisierung von Ollama mit Docker
  • Ausführung von Ollama in Kubernetes-Clustern
  • Lastverteilung und Service-Discovery

Autoscaling und Batching

  • Gestaltung von Autoscaling-Politiken für Ollama
  • Batch-Inferenz-Techniken zur Optimierung des Durchsatzes
  • Abwägung zwischen Latenz und Durchsatz

Latenz-Optimierung

  • Profiling der Inferenz-Leistung
  • Caching-Strategien und Modell-Warm-up
  • Reduzierung von I/O- und Kommunikations-Overhead

Monitoring und Beobachtbarkeit

  • Integration von Prometheus für Metriken
  • Aufbau von Dashboards mit Grafana
  • Alerting und Incident Response für Ollama-Infrastruktur

Kostenmanagement und Skalierungsstrategien

  • Kostenbewusste GPU-Zuweisung
  • Erwägungen zum Cloud- vs. On-Premise-Deployment
  • Strategien für nachhaltiges Skalieren

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Erfahrung in der Linux-Systemadministration
  • Verständnis von Containerisierung und Orchestrierung
  • Vertrautheit mit dem Deployment von Machine-Learning-Modellen

Zielgruppe

  • DevOps-Ingenieure
  • ML-Infrastrukturteams
  • Site-Reliability-Ingenieure (SREs)

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien