Kontakt aufnehmen

Schulungsübersicht

KI-Souveränität und lokale Bereitstellung von LLMs

  • Risiken von Cloud-LLMs: Datenspeicherung, Training mit Eingaben, fremde Rechtsprechung.
  • Ollama-Architektur: Modelserving-Server, Registry und OpenAI-kompatible API.
  • Vergleich mit vLLM, llama.cpp und Text Generation Inference.
  • Modelllizenzen: Bedingungen für Llama, Mistral, Qwen und Gemma.

Installation und Hardware-Einrichtung

  • Ollama-Installation auf Linux mit CUDA- und ROCm-Unterstützung.
  • Fallback-Lösungen nur für CPUs und AVX/AVX2-Optimierung.
  • Docker-Bereitstellung und persistente Volume-Zuordnung.
  • Multi-GPU-Einrichtung und VRAM-Zuteilungsstrategien.

Modellverwaltung

  • Modelle aus dem Ollama-Registry ziehen: ollama pull llama3.
  • GGUF-Modelle von HuggingFace und TheBloke importieren.
  • Quantisierungsstufen: Abwägungen zwischen Q4_K_M, Q5_K_M und Q8_0.
  • Modellwechsel und Grenzen beim gleichzeitigen Laden von Modellen.

Benutzerdefinierte Modelfiles

  • Schreiben der Modelfile-Syntax: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Optimierung von Temperature, top_p und repeat_penalty.
  • System-Prompt-Engineering für rollenspezifisches Verhalten.
  • Erstellen und Veröffentlichen benutzerdefinierter Modelle im lokalen Registry.

API-Integration

  • OpenAI-kompatibles /v1/chat/completions-Endpunkt.
  • Streaming-Antworten und JSON-Modus.
  • Integration mit LangChain, LlamaIndex und benutzerdefinierten Anwendungen.
  • Authentifizierung und Rate Limiting über einen Reverse Proxy.

Leistungsoptimierung

  • Kontextfenstergröße und KV-Cache-Verwaltung.
  • Batch-Inferenz und parallele Anforderungsverarbeitung.
  • Allokation von CPU-Threads und NUMA-Bewusstsein.
  • Überwachung der GPU-Auslastung und Speicherdynamik.

Sicherheit und Compliance

  • Netzwerkisolierung für Modelserving-Endpunkte.
  • Eingabe-Filterung und Ausgabemoderations-Pipelines.
  • Audit-Logging von Prompts und Vervollständigungen.
  • Nachweis der Modellherkunft und Hash-Überprüfung.

Voraussetzungen

  • Fortgeschrittene Kenntnisse in Linux- und Container-Verwaltung.
  • Grundlegendes Verständnis von Machine Learning und Transformer-Modellen auf hohem Niveau.
  • Vertrautheit mit REST-APIs und JSON.

Zielgruppe

  • KI-Ingenieure und Entwickler, die Cloud-LLM-APIs ersetzen möchten.
  • Organisationen mit strengen Datenschutzanforderungen, die die Nutzung von Cloud-Modellen verhindern.
  • Teams in Regierung und Verteidigung, die isoliert laufende (air-gapped) LLMs benötigen.
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien