Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 21 Stunden
Schulungsübersicht
Einführung in die multimodale KI und Ollama
- Überblick über multimodales Lernen
- Zentrale Herausforderungen bei der Integration von Vision und Sprache
- Fähigkeiten und Architektur von Ollama
Einrichtung der Ollama-Umgebung
- Installation und Konfiguration von Ollama
- Arbeit mit der lokalen Modellbereitstellung
- Integration von Ollama mit Python und Jupyter
Arbeiten mit multimodalen Eingaben
- Integration von Text und Bild
- Einarbeitung von Audio und strukturierten Daten
- Gestaltung von Preprocessing-Pipelines
Anwendungen des Dokumentenverständnisses
- Extraktion strukturierter Informationen aus PDFs und Bildern
- Kombination von OCR mit Sprachmodellen
- Aufbau intelligenter Workflows für die Dokumentenanalyse
Visuelles Beantworten von Fragen (VQA)
- Einrichtung von VQA-Datensätzen und Benchmarks
- Training und Evaluierung multimodaler Modelle
- Entwicklung interaktiver VQA-Anwendungen
Gestaltung multimodaler Agenten
- Prinzipien der Agentengestaltung mit multimodaler Schlussfolgerung
- Kombination von Wahrnehmung, Sprache und Aktion
- Bereitstellung von Agenten für reale Anwendungsfälle
Fortgeschrittene Integration und Optimierung
- Feinabstimmung multimodaler Modelle mit Ollama
- Optimierung der Inferenzleistung
- Überlegungen zur Skalierbarkeit und Bereitstellung
Zusammenfassung und nächste Schritte
Voraussetzungen
- Fundierte Kenntnisse der Konzepte des maschinellen Lernens
- Erfahrung mit Deep-Learning-Frameworks wie PyTorch oder TensorFlow
- Vertrautheit mit Natural Language Processing (NLP) und Computer Vision
Zielgruppe
- Machine-Learning-Engineers
- KI-Forscher
- Produktentwickler, die Vision- und Text-Workflows integrieren