Kontakt aufnehmen

Schulungsübersicht

Einführung in die Multimodalität von Gemini 3

  • Fähigkeiten im Umgang mit Text, Bildern, Audio und Video
  • Auswahl des geeigneten Modells sowie Überblick über verfügbare Endpunkte
  • Grundlegende Konzepte der multimodalen Vernunftsfolgerung

Arbeit mit Text und strukturierten Daten

  • Strategien zur Formulierung von Prompts für Texterzeugungen
  • Umgang mit Metadaten, Kontextfenstern sowie Vektorrepräsentationen
  • Gestaltung textbasierter Prozesse für multimodale Aufgaben

Verständnis von Bildern und visuelle Arbeitsabläufe

  • Analyse sowie Interpretation von Bildern mittels Gemini 3
  • Entwicklung von Werkzeugen zur visuellen Suche und Kategorisierung
  • Gestaltung interaktiver Mechanismen zwischen Bild- und Textinhalten

Verarbeitung akustischer Eingaben

  • Workflows zur Spracherkennung sowie Transkription
  • Identifikation und Interpretation von Audiowahrnehmungen
  • Zusammenführung von Audio-, Text- und Bilddaten in gemeinsamen Verarbeitungsprozessen

Videoanalysen und Szeneninterpretation

  • Analyse von Videodaten auf Einzelbildebene sowie kontinuierliche Verarbeitung
  • Erstellung von Werkzeugen zur automatischen Zusammenfassung oder Extraktion relevanter Szenen
  • Gestaltung automatisierter Videoverarbeitungs- und Content-Arbeitsabläufe

Entwurf von Architekturen für mehrmodale Anwendungen

  • Kombination verschiedenster Eingabetypen innerhalb einzelner Prozessketten
  • Berücksichtigung von Latenz, Kosten sowie Rechenbedarf bei der Planung
  • Richtlinien für die Erstellung skalierbarer mehrmodaler Systeme

Entwicklung von Prototypen mehrmodaler Anwendungen

  • Praktische Umsetzung von mehrmodalen Prototypen unter Anleitung
  • Schnelle Entwicklung durch gezielte Prompt-Optimierungen
  • Prüfung sowie Verbesserung der gesamten Nutzererfahrung im Verlauf des Entwurfsprozesses

Deployment mehrmodaler Lösungen

  • Strategien zur Produktivstellung sowie Einrichtung geeigneter Umgebungen
  • Überwachung der tatsächlichen Systemleistung im Live-Betrieb
  • Aspekte bezüglich Datenschutz und gesetzlicher Konformität

Abschlussdiskussion und Ausblick auf zukünftige Entwicklungen

Voraussetzungen

  • Grundlegendes Verständnis aktueller KI-Konzepte
  • Erfahrung mit Python oder JavaScript
  • Kenntnisse im Umgang mit REST-APIs

Zielgruppe

  • Designer
  • Inhaltsschaffende
  • Technische Produktteams
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien