Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Übersicht über Technologien der Spracherkennung
- Geschichte und Entwicklung der Spracherkennung
- Akustikmodelle, Sprachmodelle sowie Dekodierungsverfahren
- Moderne Architekturen: RNNs, Transformer-Modelle sowie Whisper
Audio-Vorverarbeitung und Grundlagen der Transkription
- Umgang mit Audiodateiformaten sowie Abtastraten
- Reinigung, Kürzung sowie Aufteilung von Audioaufnahmen
- Erzeugung von Text aus Audio: Echtzeitverarbeitung vs. Batch-Verfahren
Praktische Anwendung mit Whisper und weiteren APIs
- Installation sowie Nutzung von OpenAI Whisper
- Aufrufen von Cloud-APIs (Google, Azure) zur Transkription
- Vergleich hinsichtlich Leistungsfähigkeit, Latenz sowie Kosten
Umgang mit mehreren Sprachen, Akzenten und Fachbegriffen
- Arbeiten mit verschiedenen Sprachen und Aussprachvariationen
- Nutzung von benutzerdefinierten Wörterbüchern sowie Erhöhung der Störgeräuschtoleranz
- Umgang mit rechtlichen, medizinischen oder fachtechnischen Fachbegriffen
Formatierung und Integration der Ausgabedaten
- Hinzufügen von Zeitstempeln, Satzzeichen sowie Sprecherkennzeichnungen
- Export in gängige Formate wie Text-, SRT- oder JSON-Dateien
- Einbindung der erstellten Transkripte in Anwendungen oder Datenbanken
Praxisübungen zu typischen Anwendungsfällen
- Transkription von Besprechungen, Interviews oder Podcasts
- Entwicklung von Systemen zur Umsetzung von Sprachbefehlen in Text
- Erstellung von Echtzeit-Untertiteln für Video- und Audioinhalte
Bewertung, Grenzen sowie ethische Aspekte der Spracherkennung
- Messgrößen zur Genauigkeit sowie Vergleich von Modellen
- Bias-Probleme und Fairness in sprachbasierten Systemen
- Aspekte bezüglich Datenschutz und gesetzlicher Compliance
Zusammenfassung sowie weitere Schritte
Voraussetzungen
- Grundkenntnisse über allgemeine Konzepte der KI und des maschinellen Lernens
- Vertrautheit mit gängigen Audio- oder Mediendateiformaten sowie -werkzeugen
Zielgruppe
- Datenwissenschaftler und KI-Ingenieure, die mit Sprachdaten arbeiten
- Softwareentwickler, die Anwendungen zur Transkription entwickeln
- Unternehmen, die Spracherkennung zur Automatisierung nutzen möchten
14 Stunden