Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in Mistral Multimodal-Modelle
- Überblick über Mistral Medium und multimodale Fähigkeiten
- OCR-/Dokumentenmodelle und Use Cases
- Integration in Open-Source-Ökosysteme
OCR- und Vision-Pipelines
- OCR-Grundlagen mit Mistral-Modellen
- Vorverarbeitung von Bildern und gescannten Dokumenten
- Extraktion strukturierten Textes aus Bildern
Dokumentenverständnis
- Gestaltung von NLP-Pipelines für Dokumente
- Erkennung von Entitäten, Zusammenfassungen und Klassifizierung
- Quermodale Verknüpfung von Text- und Vision-Daten
Suche und Wissensanwendungen
- Vision-Text-Suchsysteme
- Aufbau semantischer Suche basierend auf OCR-Ergebnissen
- Unternehmensweite Dokumentenarchive
Unterstützende und interaktive Anwendungen
- UI-Design für multimodale Assistenten
- Barrierefreie Anwendungen (z. B. Vision-to-Text)
- Praktische Produktivitätstools
Performance und Optimierung
- Skalierung multimodaler Pipelines
- Optimierung der Inferenzleistung
- Bewertung des Kompromisses zwischen Genauigkeit und Effizienz
Fallstudien und zukünftige Entwicklung
- Branchenweite Anwendungen von multimodaler KI
- Forschungstrends in OCR und Dokumenten-KI
- Gesellschaftlich verantwortliche KI-Aspekte bei Vision-Text-Aufgaben
Zusammenfassung und weitere Schritte
Voraussetzungen
- Grundverständnis der Konzepte der natürlichen Sprachverarbeitung (NLP)
- Erfahrung mit Python und ML-Frameworks
- Vertrautheit mit den Grundlagen der Computer Vision
Zielgruppe
- Produktteams
- ML-Forscher
- Anwendungsingenieure für ML
14 Stunden