Kontakt aufnehmen

Schulungsübersicht

Einführung in Mistral Multimodal-Modelle

  • Überblick über Mistral Medium und multimodale Fähigkeiten
  • OCR-/Dokumentenmodelle und Use Cases
  • Integration in Open-Source-Ökosysteme

OCR- und Vision-Pipelines

  • OCR-Grundlagen mit Mistral-Modellen
  • Vorverarbeitung von Bildern und gescannten Dokumenten
  • Extraktion strukturierten Textes aus Bildern

Dokumentenverständnis

  • Gestaltung von NLP-Pipelines für Dokumente
  • Erkennung von Entitäten, Zusammenfassungen und Klassifizierung
  • Quermodale Verknüpfung von Text- und Vision-Daten

Suche und Wissensanwendungen

  • Vision-Text-Suchsysteme
  • Aufbau semantischer Suche basierend auf OCR-Ergebnissen
  • Unternehmensweite Dokumentenarchive

Unterstützende und interaktive Anwendungen

  • UI-Design für multimodale Assistenten
  • Barrierefreie Anwendungen (z. B. Vision-to-Text)
  • Praktische Produktivitätstools

Performance und Optimierung

  • Skalierung multimodaler Pipelines
  • Optimierung der Inferenzleistung
  • Bewertung des Kompromisses zwischen Genauigkeit und Effizienz

Fallstudien und zukünftige Entwicklung

  • Branchenweite Anwendungen von multimodaler KI
  • Forschungstrends in OCR und Dokumenten-KI
  • Gesellschaftlich verantwortliche KI-Aspekte bei Vision-Text-Aufgaben

Zusammenfassung und weitere Schritte

Voraussetzungen

  • Grundverständnis der Konzepte der natürlichen Sprachverarbeitung (NLP)
  • Erfahrung mit Python und ML-Frameworks
  • Vertrautheit mit den Grundlagen der Computer Vision

Zielgruppe

  • Produktteams
  • ML-Forscher
  • Anwendungsingenieure für ML
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien