Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 21 Stunden
Schulungsübersicht
Einführung ins Skalieren von Ollama
- Ollama-Architektur und Überlegungen zur Skalierung
- Häufige Engpässe bei Mehrbenutzer-Deployment
- Best Practices für die Infrastruktur-Vorbereitung
Ressourcenzuweisung und GPU-Optimierung
- Strategien für effiziente CPU/GPU-Nutzung
- Erwägungen zu Speicher und Bandbreite
- Ressourcenbeschränkungen auf Container-Ebene
Deployment mit Containern und Kubernetes
- Containerisierung von Ollama mit Docker
- Ausführung von Ollama in Kubernetes-Clustern
- Lastverteilung und Service-Discovery
Autoscaling und Batching
- Gestaltung von Autoscaling-Politiken für Ollama
- Batch-Inferenz-Techniken zur Optimierung des Durchsatzes
- Abwägung zwischen Latenz und Durchsatz
Latenz-Optimierung
- Profiling der Inferenz-Leistung
- Caching-Strategien und Modell-Warm-up
- Reduzierung von I/O- und Kommunikations-Overhead
Monitoring und Beobachtbarkeit
- Integration von Prometheus für Metriken
- Aufbau von Dashboards mit Grafana
- Alerting und Incident Response für Ollama-Infrastruktur
Kostenmanagement und Skalierungsstrategien
- Kostenbewusste GPU-Zuweisung
- Erwägungen zum Cloud- vs. On-Premise-Deployment
- Strategien für nachhaltiges Skalieren
Zusammenfassung und nächste Schritte
Voraussetzungen
- Erfahrung in der Linux-Systemadministration
- Verständnis von Containerisierung und Orchestrierung
- Vertrautheit mit dem Deployment von Machine-Learning-Modellen
Zielgruppe
- DevOps-Ingenieure
- ML-Infrastrukturteams
- Site-Reliability-Ingenieure (SREs)