Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Einführung in die Multimodalität von Gemini 3
- Fähigkeiten im Bereich Text, Bilder, Audio und Video
- Modellauswahl und Übersicht der Endpunkte
- Wesentliche Konzepte des multimodalen Schlussfolgerns
Arbeiten mit Text und strukturierten Eingaben
- Prompting-Strategien für die Textgenerierung
- Metadaten, Kontextfenster und Embeddings
- Textbasierte Orchestrierung multimodaler Aufgaben
Bildverständnis und visuelle Arbeitsabläufe
- Bildanalyse und -interpretation mit Gemini 3
- Erstellung von visuellen Suche- und Tagging-Tools
- Aufbau von Bild-zu-Text- und Text-zu-Bild-Interaktionen
Verarbeitung von Audioeingaben
- Workflows für Spracherkennung und Transkription
- Erkennung und Interpretation von Audioereignissen
- Integration von Audio mit Text- und Bildeingaben
Video-Intelligenz und Szenenanalyse
- Frame-für-Frame- und kontinuierliches Video-Schlussfolgern
- Erstellung von Tools für Zusammenfassung und Hervorhebungs-Extraktion
- Video-basierte Automatisierung und Inhalts-Workflows
Gestaltung multimodaler Anwendungsfachitekturen
- Kombinierung mehrerer Eingabetypen in einer einzelnen Pipeline
- Überlegungen zu Latenz, Kosten und Rechenleistung
- Best Practices für skalierbare multimodale Systeme
Prototyping multimodaler Anwendungen
- Praktische Erstellung multimodaler Prototypen
- Schnelle Iteration durch Prompt Engineering
- Testen und Feinabstimmen von Benutzererlebnis-Flows
Einführung multimodaler Lösungen
- Deploy-Strategien und Umgebungs setup
- Überwachung der Leistung im Realbetrieb
- Überlegungen zu Sicherheit und Compliance
Zusammenfassung und nächste Schritte
Voraussetzungen
- Verständnis moderner KI-Konzepte
- Erfahrung mit Python oder JavaScript
- Kenntnisse mit REST-APIs
Zielgruppe
- Gestalter
- Inhaltsentwickler
- Technische Produktteams
Erfahrungsberichte (1)
Fluss, Vibe und Thema der Präsentation
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kurs - Google Gemini AI for Data Analysis
Maschinelle Übersetzung