Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Grundlagen der Produktionsbereitstellung mit Tencent Hunyuan
- Überblick über typische Einsatzszenarien von Tencent Hunyuan-Modellen in der Produktion
- Eigenschaften großer Modelle sowie MoE-Modelle im produktiven Einsatz
- Häufige Engpässe bei Latenz, Durchsatz und Kosten
- Definition relevanter Service-Ziele für Inferenzanwendungen
Bereitstellungsarchitektur und Inferenzablauf
- Kernkomponenten einer Produktions-Inferenzumgebung
- Auswahl der geeigneten Bereitstellung: Containerisierung, On-Premise oder Cloud-Modelle
- Grundsätze zum Laden von Modellen, Anfragerouting und GPU-Zuweisung
- Entwurf einer zuverlässigen und betrieblich einfachen Lösung
Praktische Optimierung der Latenz
- Einsatz optimierter Inferenzeinheiten wie TensorRT bei Bedarf
- Konzepte rund um KV-Cache und praktische Tuning-Methoden dafür
- Minderung der Start-, Aufwärm- und Reaktionszeit von Systemen
- Bestimmung des Zeitpunkts für das erste Token sowie Messung der Geschwindigkeit bei Tokenerzeugung
Durchsatz, Batching-Verfahren und GPU-Auslastung
- Methoden zur kontinuierlichen oder sequentiellen Anfragenverarbeitung in Batches
- Steuerung von Parallelität sowie Queue-Verhalten
- Erhöhung der GPU-Auslastung ohne Beeinträchtigung des Nutzererlebnisses
- Bewältigung komplexer Aufgaben wie langen Kontexten oder gemischten Anfragetypen
Quantisierung und Kostenkontrolle
- Gründe, warum Quantisierung für produktive Server-Umgebungen von Bedeutung ist
- Praktische Abwägungen zwischen FP16, INT8 sowie anderen gängigen Präzisionsstufen
- Ausgleich zwischen Modellqualität, Latenz und Infrastrukturkosten
- Erstellen einer einfachen Checkliste für Kosteneinsparungen
Betrieb, Überwachung und Qualitätsprüfung
- Automatische Skalierung von Inferenzdiensten basierend auf aktuellen Anforderungen
- Erfassung von Latenzwerten, Durchsatz, Cache-Status sowie GPU-Betriebsdaten
- Grundsätze des Logging, Alarmweiterleitens und Reaktionsprozesses bei Störungen
- Analyse vorhandener Referenzbereitstellungen sowie Ausarbeitung von Verbesserungsplänen
Voraussetzungen
- Grundsätzliche Kenntnisse über die Bereitstellung von großen Sprachmodellen sowie Inferenzprozesse
- Erfahrung mit Containern, Cloud- oder lokalen Infrastrukturen sowie API-basierten Diensten
- Grundkenntnisse in Python oder systemnaher Ingenieursarbeit
Zielgruppe
- Machine-Learning-Ingenieure, die LLMs produktiv einsetzen möchten
- Plattformingenieure, die für GPU-basierte Inferenzdienste verantwortlich sind
- Lösungsarchitekten, die skalierbare Plattformen für das Bereitstellen von KI-Modellen planen