Kontakt aufnehmen

Schulungsübersicht

Grundlagen der Produktionsbereitstellung mit Tencent Hunyuan

  • Überblick über typische Einsatzszenarien von Tencent Hunyuan-Modellen in der Produktion
  • Eigenschaften großer Modelle sowie MoE-Modelle im produktiven Einsatz
  • Häufige Engpässe bei Latenz, Durchsatz und Kosten
  • Definition relevanter Service-Ziele für Inferenzanwendungen

Bereitstellungsarchitektur und Inferenzablauf

  • Kernkomponenten einer Produktions-Inferenzumgebung
  • Auswahl der geeigneten Bereitstellung: Containerisierung, On-Premise oder Cloud-Modelle
  • Grundsätze zum Laden von Modellen, Anfragerouting und GPU-Zuweisung
  • Entwurf einer zuverlässigen und betrieblich einfachen Lösung

Praktische Optimierung der Latenz

  • Einsatz optimierter Inferenzeinheiten wie TensorRT bei Bedarf
  • Konzepte rund um KV-Cache und praktische Tuning-Methoden dafür
  • Minderung der Start-, Aufwärm- und Reaktionszeit von Systemen
  • Bestimmung des Zeitpunkts für das erste Token sowie Messung der Geschwindigkeit bei Tokenerzeugung

Durchsatz, Batching-Verfahren und GPU-Auslastung

  • Methoden zur kontinuierlichen oder sequentiellen Anfragenverarbeitung in Batches
  • Steuerung von Parallelität sowie Queue-Verhalten
  • Erhöhung der GPU-Auslastung ohne Beeinträchtigung des Nutzererlebnisses
  • Bewältigung komplexer Aufgaben wie langen Kontexten oder gemischten Anfragetypen

Quantisierung und Kostenkontrolle

  • Gründe, warum Quantisierung für produktive Server-Umgebungen von Bedeutung ist
  • Praktische Abwägungen zwischen FP16, INT8 sowie anderen gängigen Präzisionsstufen
  • Ausgleich zwischen Modellqualität, Latenz und Infrastrukturkosten
  • Erstellen einer einfachen Checkliste für Kosteneinsparungen

Betrieb, Überwachung und Qualitätsprüfung

  • Automatische Skalierung von Inferenzdiensten basierend auf aktuellen Anforderungen
  • Erfassung von Latenzwerten, Durchsatz, Cache-Status sowie GPU-Betriebsdaten
  • Grundsätze des Logging, Alarmweiterleitens und Reaktionsprozesses bei Störungen
  • Analyse vorhandener Referenzbereitstellungen sowie Ausarbeitung von Verbesserungsplänen

Voraussetzungen

  • Grundsätzliche Kenntnisse über die Bereitstellung von großen Sprachmodellen sowie Inferenzprozesse
  • Erfahrung mit Containern, Cloud- oder lokalen Infrastrukturen sowie API-basierten Diensten
  • Grundkenntnisse in Python oder systemnaher Ingenieursarbeit

Zielgruppe

  • Machine-Learning-Ingenieure, die LLMs produktiv einsetzen möchten
  • Plattformingenieure, die für GPU-basierte Inferenzdienste verantwortlich sind
  • Lösungsarchitekten, die skalierbare Plattformen für das Bereitstellen von KI-Modellen planen
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien