Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in die Sprachsynthese sowie die Stimmenklonung
- Überblick über Text-to-Speech (TTS) sowie neuronale Verfahren zur Stimmenerzeugung
- Unterschiede zwischen Stimmenklonung und reiner Sprachgenerierung: Anwendungsgebiete und Grenzen
- Wichtige Modelle: Tacotron, WaveNet, FastSpeech sowie VITS
Arbeiten mit kommerziellen Plattformen
- Nutzung von ElevenLabs und Resemble AI
- Erstellung, Klonierung sowie Bearbeitung von Stimmen
- API-Zugriff sowie Implementierung verschiedener Text-to-Speech-Workflows
Entwicklung mittels Open-Source-Werkzeugen
- Installation und Konfiguration von Coqui TTS
- Training eigener Stimmmodelle sowie Verwaltung zugehöriger Datensätze
- Kontrollierte Erzeugung von Sprache – mit Einfluss auf Tonhöhe, Geschwindigkeit oder Ausdrucksstärke
Aufbereitung der Daten und Verwaltung von Stimmdatensätzen
- Sammeln sowie Bereinigen geeigneter Audiodateien
- Segmentierung, Beschriftung sowie zeitliche Abstimmung der Transkripte
- Rechtmäßige und ethische Aspekte bei der Verwendung von Stimmdaten
Integration in praktische Anwendungen
- Einbindung von TTS-Technologie in Webseiten sowie Softwareapplikationen
- Gestaltung intelligenter IVR-Systeme sowie interaktiver Bot-Konzepte
- Erstellung realistischer Dialogsequenzen für Videos und Spiele
Bewertung von Qualität und Natürlichkeit
- MOS-Tests (Mean Opinion Score) sowie Prüfungen zur Verständlichkeit
- Kontrolle über Ausdrucksstärke, Stimmungswirkung und Melodik der generierten Sprache
- Vergleich verschiedener Parameter wie Reaktionszeit, Fidelity sowie Realismus
Ethik, gesetzliche Vorgaben sowie Leitlinien zur Nutzung
- Risiken durch Deepfakes und verantwortungsvolles Einsatzverhalten
- Aspekte wie Einwilligung, Kennzeichnung von Urheberrechten sowie rechtliche Rahmenbedingungen
- Relevante regulatorische Bestimmungen sowie interne Unternehmensrichtlinien
Zusammenfassung und Ausblick auf weiterführende Möglichkeiten
Voraussetzungen
- Grundverständnis der grundlegenden Prinzipien des maschinellen Lernens
- Vertrautheit mit gängigen Audio-Dateiformaten sowie Editierwerkzeugen
- Basale Programmierkenntnisse in Python
Zielgruppe
- KI-Entwickler sowie Ingenieure, die sich mit der Sprachsynthese beschäftigen
- Content-Ersteller und Medientechnologen, die neue Möglichkeiten der Stimmengenerierung erkunden wollen
- Forschungs- und Entwicklungsteams, die personalisierte oder dynamische Audiosysteme entwickeln
14 Stunden