Kontakt aufnehmen
 Dauer 21 Stunden

Schulungsübersicht

Einführung in die multimodale KI und Ollama

  • Überblick über multimodales Lernen
  • Zentrale Herausforderungen bei der Integration von Vision und Sprache
  • Fähigkeiten und Architektur von Ollama

Einrichtung der Ollama-Umgebung

  • Installation und Konfiguration von Ollama
  • Arbeit mit der lokalen Modellbereitstellung
  • Integration von Ollama mit Python und Jupyter

Arbeiten mit multimodalen Eingaben

  • Integration von Text und Bild
  • Einarbeitung von Audio und strukturierten Daten
  • Gestaltung von Preprocessing-Pipelines

Anwendungen des Dokumentenverständnisses

  • Extraktion strukturierter Informationen aus PDFs und Bildern
  • Kombination von OCR mit Sprachmodellen
  • Aufbau intelligenter Workflows für die Dokumentenanalyse

Visuelles Beantworten von Fragen (VQA)

  • Einrichtung von VQA-Datensätzen und Benchmarks
  • Training und Evaluierung multimodaler Modelle
  • Entwicklung interaktiver VQA-Anwendungen

Gestaltung multimodaler Agenten

  • Prinzipien der Agentengestaltung mit multimodaler Schlussfolgerung
  • Kombination von Wahrnehmung, Sprache und Aktion
  • Bereitstellung von Agenten für reale Anwendungsfälle

Fortgeschrittene Integration und Optimierung

  • Feinabstimmung multimodaler Modelle mit Ollama
  • Optimierung der Inferenzleistung
  • Überlegungen zur Skalierbarkeit und Bereitstellung

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Fundierte Kenntnisse der Konzepte des maschinellen Lernens
  • Erfahrung mit Deep-Learning-Frameworks wie PyTorch oder TensorFlow
  • Vertrautheit mit Natural Language Processing (NLP) und Computer Vision

Zielgruppe

  • Machine-Learning-Engineers
  • KI-Forscher
  • Produktentwickler, die Vision- und Text-Workflows integrieren

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien