Kontakt aufnehmen

Schulungsübersicht

Einführung in die Sprachsynthese sowie die Stimmenklonung

  • Überblick über Text-to-Speech (TTS) sowie neuronale Verfahren zur Stimmenerzeugung
  • Unterschiede zwischen Stimmenklonung und reiner Sprachgenerierung: Anwendungsgebiete und Grenzen
  • Wichtige Modelle: Tacotron, WaveNet, FastSpeech sowie VITS

Arbeiten mit kommerziellen Plattformen

  • Nutzung von ElevenLabs und Resemble AI
  • Erstellung, Klonierung sowie Bearbeitung von Stimmen
  • API-Zugriff sowie Implementierung verschiedener Text-to-Speech-Workflows

Entwicklung mittels Open-Source-Werkzeugen

  • Installation und Konfiguration von Coqui TTS
  • Training eigener Stimmmodelle sowie Verwaltung zugehöriger Datensätze
  • Kontrollierte Erzeugung von Sprache – mit Einfluss auf Tonhöhe, Geschwindigkeit oder Ausdrucksstärke

Aufbereitung der Daten und Verwaltung von Stimmdatensätzen

  • Sammeln sowie Bereinigen geeigneter Audiodateien
  • Segmentierung, Beschriftung sowie zeitliche Abstimmung der Transkripte
  • Rechtmäßige und ethische Aspekte bei der Verwendung von Stimmdaten

Integration in praktische Anwendungen

  • Einbindung von TTS-Technologie in Webseiten sowie Softwareapplikationen
  • Gestaltung intelligenter IVR-Systeme sowie interaktiver Bot-Konzepte
  • Erstellung realistischer Dialogsequenzen für Videos und Spiele

Bewertung von Qualität und Natürlichkeit

  • MOS-Tests (Mean Opinion Score) sowie Prüfungen zur Verständlichkeit
  • Kontrolle über Ausdrucksstärke, Stimmungswirkung und Melodik der generierten Sprache
  • Vergleich verschiedener Parameter wie Reaktionszeit, Fidelity sowie Realismus

Ethik, gesetzliche Vorgaben sowie Leitlinien zur Nutzung

  • Risiken durch Deepfakes und verantwortungsvolles Einsatzverhalten
  • Aspekte wie Einwilligung, Kennzeichnung von Urheberrechten sowie rechtliche Rahmenbedingungen
  • Relevante regulatorische Bestimmungen sowie interne Unternehmensrichtlinien

Zusammenfassung und Ausblick auf weiterführende Möglichkeiten

Voraussetzungen

  • Grundverständnis der grundlegenden Prinzipien des maschinellen Lernens
  • Vertrautheit mit gängigen Audio-Dateiformaten sowie Editierwerkzeugen
  • Basale Programmierkenntnisse in Python

Zielgruppe

  • KI-Entwickler sowie Ingenieure, die sich mit der Sprachsynthese beschäftigen
  • Content-Ersteller und Medientechnologen, die neue Möglichkeiten der Stimmengenerierung erkunden wollen
  • Forschungs- und Entwicklungsteams, die personalisierte oder dynamische Audiosysteme entwickeln
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien