Kontakt aufnehmen
 Dauer 14 Stunden

Schulungsübersicht

Überblick über Technologien zur Spracherkennung

  • Geschichte und Entwicklung der Spracherkennung
  • Akustische Modelle, Sprachmodelle und Decodierung
  • Moderne Architekturen: RNNs, Transformer und Whisper

Audio-Preprocessing und Grundlagen der Transkription

  • Umgang mit Audioformaten und Abtausraten
  • Bereinigung, Zuschnitt und Segmentierung von Audio
  • Generierung von Text aus Audio: Echtzeit vs. Stapelverarbeitung (Batch)

Praxisübungen mit Whisper und anderen APIs

  • Installation und Nutzung von OpenAI Whisper
  • Aufruf von Cloud-APIs (Google, Azure) zur Transkription
  • Vergleich von Leistung, Latenz und Kosten

Sprache, Akzente und Domänenanpassung

  • Arbeit mit mehreren Sprachen und Akzenten
  • Benutzerdefinierte Vokabulare und Geräuschtoleranz
  • Verarbeitung von juristischer, medizinischer oder technischer Sprache

Ausgabeformatierung und Integration

  • Hinzufügen von Zeitstempeln, Interpunktion und Sprechervermerkungen
  • Export in Text-, SRT- oder JSON-Formate
  • Integration von Transkriptionen in Apps oder Datenbanken

Labor-Übungen zur Implementierung von Use Cases

  • Transkription von Meetings, Interviews oder Podcasts
  • Voice-to-Text-Befehlsysteme
  • Echtzeit-Untertitel für Video-/Audio-Streams

Bewertung, Einschränkungen und Ethik

  • Präzisionsmetriken und Benchmarking von Modellen
  • Verzerrung und Fairness in Sprachmodellen
  • Überlegungen zur Datensicherheit und Compliance

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Verständnis der allgemeinen Konzepte von KI und Machine Learning
  • Vertrautheit mit Audio- oder Mediadateiformaten und den dazugehörigen Werkzeugen

Zielgruppe

  • Data Scientists und KI-Ingenieure, die mit Sprachdaten arbeiten
  • Softwareentwickler, die transkriptionsbasierte Anwendungen erstellen
  • Organisationen, die Spracherkennung für die Automatisierung erforschen

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien