Kontakt aufnehmen
 Dauer 14 Stunden

Schulungsübersicht

Einführung in die Multimodalität von Gemini 3

  • Fähigkeiten im Bereich Text, Bilder, Audio und Video
  • Modellauswahl und Übersicht der Endpunkte
  • Wesentliche Konzepte des multimodalen Schlussfolgerns

Arbeiten mit Text und strukturierten Eingaben

  • Prompting-Strategien für die Textgenerierung
  • Metadaten, Kontextfenster und Embeddings
  • Textbasierte Orchestrierung multimodaler Aufgaben

Bildverständnis und visuelle Arbeitsabläufe

  • Bildanalyse und -interpretation mit Gemini 3
  • Erstellung von visuellen Suche- und Tagging-Tools
  • Aufbau von Bild-zu-Text- und Text-zu-Bild-Interaktionen

Verarbeitung von Audioeingaben

  • Workflows für Spracherkennung und Transkription
  • Erkennung und Interpretation von Audioereignissen
  • Integration von Audio mit Text- und Bildeingaben

Video-Intelligenz und Szenenanalyse

  • Frame-für-Frame- und kontinuierliches Video-Schlussfolgern
  • Erstellung von Tools für Zusammenfassung und Hervorhebungs-Extraktion
  • Video-basierte Automatisierung und Inhalts-Workflows

Gestaltung multimodaler Anwendungsfachitekturen

  • Kombinierung mehrerer Eingabetypen in einer einzelnen Pipeline
  • Überlegungen zu Latenz, Kosten und Rechenleistung
  • Best Practices für skalierbare multimodale Systeme

Prototyping multimodaler Anwendungen

  • Praktische Erstellung multimodaler Prototypen
  • Schnelle Iteration durch Prompt Engineering
  • Testen und Feinabstimmen von Benutzererlebnis-Flows

Einführung multimodaler Lösungen

  • Deploy-Strategien und Umgebungs setup
  • Überwachung der Leistung im Realbetrieb
  • Überlegungen zu Sicherheit und Compliance

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Verständnis moderner KI-Konzepte
  • Erfahrung mit Python oder JavaScript
  • Kenntnisse mit REST-APIs

Zielgruppe

  • Gestalter
  • Inhaltsentwickler
  • Technische Produktteams

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien