Kontakt aufnehmen

Schulungsübersicht

Übersicht über Technologien der Spracherkennung

  • Geschichte und Entwicklung der Spracherkennung
  • Akustikmodelle, Sprachmodelle sowie Dekodierungsverfahren
  • Moderne Architekturen: RNNs, Transformer-Modelle sowie Whisper

Audio-Vorverarbeitung und Grundlagen der Transkription

  • Umgang mit Audiodateiformaten sowie Abtastraten
  • Reinigung, Kürzung sowie Aufteilung von Audioaufnahmen
  • Erzeugung von Text aus Audio: Echtzeitverarbeitung vs. Batch-Verfahren

Praktische Anwendung mit Whisper und weiteren APIs

  • Installation sowie Nutzung von OpenAI Whisper
  • Aufrufen von Cloud-APIs (Google, Azure) zur Transkription
  • Vergleich hinsichtlich Leistungsfähigkeit, Latenz sowie Kosten

Umgang mit mehreren Sprachen, Akzenten und Fachbegriffen

  • Arbeiten mit verschiedenen Sprachen und Aussprachvariationen
  • Nutzung von benutzerdefinierten Wörterbüchern sowie Erhöhung der Störgeräuschtoleranz
  • Umgang mit rechtlichen, medizinischen oder fachtechnischen Fachbegriffen

Formatierung und Integration der Ausgabedaten

  • Hinzufügen von Zeitstempeln, Satzzeichen sowie Sprecherkennzeichnungen
  • Export in gängige Formate wie Text-, SRT- oder JSON-Dateien
  • Einbindung der erstellten Transkripte in Anwendungen oder Datenbanken

Praxisübungen zu typischen Anwendungsfällen

  • Transkription von Besprechungen, Interviews oder Podcasts
  • Entwicklung von Systemen zur Umsetzung von Sprachbefehlen in Text
  • Erstellung von Echtzeit-Untertiteln für Video- und Audioinhalte

Bewertung, Grenzen sowie ethische Aspekte der Spracherkennung

  • Messgrößen zur Genauigkeit sowie Vergleich von Modellen
  • Bias-Probleme und Fairness in sprachbasierten Systemen
  • Aspekte bezüglich Datenschutz und gesetzlicher Compliance

Zusammenfassung sowie weitere Schritte

Voraussetzungen

  • Grundkenntnisse über allgemeine Konzepte der KI und des maschinellen Lernens
  • Vertrautheit mit gängigen Audio- oder Mediendateiformaten sowie -werkzeugen

Zielgruppe

  • Datenwissenschaftler und KI-Ingenieure, die mit Sprachdaten arbeiten
  • Softwareentwickler, die Anwendungen zur Transkription entwickeln
  • Unternehmen, die Spracherkennung zur Automatisierung nutzen möchten
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien