Kontakt aufnehmen

Schulungsübersicht

Einführung in die multimodale KI

  • Was ist multimodale KI?
  • Wesentliche Herausforderungen und Anwendungsbereiche
  • Überblick über führende multimodale Modelle

Textverarbeitung und Verständnis natürlicher Sprache

  • Nutzung von Large Language Models für textbasierte KI-Agenten
  • Grundlagen des Prompt-Engineerings für multimodale Aufgaben
  • Feinabstimmung von Textmodellen für spezifische Anwendungsbereiche

Bildverarbeitung und -generierung

  • Verarbeitung von Bildern durch KI: Klassifizierung, Beschreibung sowie Objekterkennung
  • Erzeugung von Bildern mithilfe von Diffusionsmodellen wie Stable Diffusion oder DALLE
  • Integration von Bilddaten in textbasierte Modelle

Sprach- und Audioverarbeitung

  • Spracherkennung mithilfe von Whisper ASR
  • Techniken zur Synthese von Text zu Sprache (Text-to-Speech)
  • Verbesserung der Interaktion mit sprachbasierten KI-Systemen

Integration multimodaler Eingabedaten

  • Aufbau von KI-Pipelines zur Verarbeitung verschiedener Datentypen
  • Methoden zur Kombination von Text-, Bild- und Sprachdaten
  • Praktische Anwendungen multimodaler KI-Agenten

Einsatz multimodaler KI-Agenten

  • Entwicklung von API-basierten Lösungen mit multimodaler KI
  • Optimierung der Modelle hinsichtlich Leistung und Skalierbarkeit
  • Empfehlungen für die erfolgreiche Produktionsbereitstellung multimodaler KI-Systeme

Ethik und zukünftige Entwicklungen

  • Verzerrungen und Fairness in multimodalen KI-Modellen
  • Datenschutzaspekte im Umgang mit multimodalen Daten
  • Zukünftige Trends in der Entwicklung multimodaler KI

Zusammenfassung und weitere Schritte

Voraussetzungen

  • Grundkenntnisse in den Grundlagen des maschinellen Lernens
  • Erfahrung mit der Programmiersprache Python
  • Vertrautheit mit Deep-Learning-Frameworks (z. B. TensorFlow, PyTorch)

Zielgruppe

  • KI-Entwickler
  • Forscher
  • Multimedia-Ingenieure
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien