Das branchen-wiki
wissen von a-z

Voice Cloning

Voice Cloning bezeichnet die digitale Nachbildung einer menschlichen Stimme mithilfe künstlicher Intelligenz. Auf Grundlage vorhandener Sprachaufnahmen kann ein KI-System eine synthetische Stimme erzeugen, die Klangfarbe, Sprechweise, Betonung und andere charakteristische Merkmale einer bestimmten Person imitiert.

Die erzeugte KI-Stimme kann anschließend neue Texte sprechen, ohne dass die betreffende Person jeden Satz selbst aufnehmen muss. Voice Cloning wird unter anderem für Werbung, Film, Social Media, Erklärvideos, E-Learning, Games und mehrsprachige Contentproduktionen eingesetzt.

Wie funktioniert Voice Cloning?

Für das Klonen einer Stimme benötigt ein KI-System Sprachaufnahmen der jeweiligen Person. Je nach eingesetzter Technologie können bereits kurze Aufnahmen ausreichen. Für besonders natürliche und vielseitig einsetzbare Ergebnisse werden häufig umfangreichere Sprachproben benötigt.

Das System analysiert unter anderem:

* Klangfarbe und Tonhöhe

* Aussprache und Sprechtempo

* Betonung und Sprachrhythmus

* Pausen und Atemverhalten

* emotionale Ausdrucksweisen

* sprachliche Besonderheiten

Aus diesen Merkmalen wird ein digitales Stimmmodell erstellt. Anschließend können geschriebene Texte in Sprache umgewandelt und mit der nachgebildeten Stimme ausgegeben werden.

Nicht jede künstlich erzeugte Stimme ist automatisch ein Voice Clone. Generische KI-Stimmen sind nicht zwingend einer bestimmten Person zuzuordnen. Beim Voice Cloning wird dagegen gezielt eine individuelle Stimme nachgebildet.

Wo werden geklonte Stimmen eingesetzt?

Voice Cloning kann Produktionsabläufe beschleunigen und die Erstellung verschiedener Sprachversionen erleichtern. Typische Einsatzbereiche sind:

* Werbespots und Social Ads

* Image- und Unternehmensfilme

* Erklärvideos und Tutorials

* E-Learning und Schulungsfilme

* Podcasts und Hörformate

* Games und interaktive Anwendungen

* digitale Avatare

* Film- und Serienproduktionen

* mehrsprachige Versionen von Videoinhalten

* nachträgliche Textänderungen in bestehenden Produktionen

Besonders interessant ist die Technologie für internationale Kampagnen. Eine Stimme kann unter bestimmten Voraussetzungen in mehreren Sprachen eingesetzt werden, während ihr ursprünglicher Charakter weitgehend erhalten bleibt.

Unterschied zwischen Voice Cloning und Voice-over

Bei einem klassischen Voice-over spricht ein Mensch den gewünschten Text für die jeweilige Produktion ein. Jede neue Sprachfassung, Textänderung oder Ergänzung muss normalerweise erneut aufgenommen werden.

Beim Voice Cloning wird zunächst ein digitales Modell der Stimme erstellt. Dieses kann anschließend neue Texte synthetisch wiedergeben. Trotzdem können professionelle Sprachaufnahmen weiterhin notwendig sein – beispielsweise als Ausgangsmaterial, zur Qualitätskontrolle oder für besonders emotionale Passagen.

Voice Cloning ersetzt daher nicht automatisch menschliche Sprecherinnen und Sprecher. Vielmehr entsteht ein zusätzlicher Produktionsweg, der je nach Format, Qualitätsanspruch und rechtlichen Vereinbarungen eingesetzt werden kann.

Voice Cloning beim Casting und bei der Besetzung

Wird eine Stimme für eine wiederkehrende Rolle, eine Kampagne oder verschiedene Sprachfassungen benötigt, kann Voice Cloning bereits beim Casting berücksichtigt werden. Neben dem Aussehen und der schauspielerischen Leistung wird dann auch geprüft, ob Stimme, Aussprache und Ausdruck zur Produktion passen.

Bei der Besetzung können unter anderem folgende Kriterien wichtig sein:

* angenehme und gut verständliche Stimme

* deutliche Aussprache

* Fähigkeit zu unterschiedlichen Betonungen

* gleichbleibende Sprechqualität

* passende Stimmfarbe für Marke oder Rolle

* Erfahrung mit Sprachaufnahmen

* Bereitschaft zur vereinbarten KI-Nutzung

Gerade bei längerfristigen Kampagnen sollten Produktionsfirmen frühzeitig festlegen, ob ausschließlich die Originalaufnahmen oder auch ein digitales Stimmmodell verwendet werden soll. Eine allgemeine Zustimmung zu Dreharbeiten oder Sprachaufnahmen sollte nicht automatisch als Zustimmung zum Voice Cloning verstanden werden.

Einwilligung und Nutzungsrechte

Die Stimme ist ein persönliches und wirtschaftlich relevantes Merkmal. Deshalb sollte die Erstellung und Verwendung eines Voice Clones ausdrücklich und nachvollziehbar vereinbart werden.

In einer entsprechenden Vereinbarung sollten möglichst konkrete Angaben enthalten sein zu:

* Zweck der Stimmaufnahme

* Erstellung und Training des Stimmmodells

* erlaubten Medien und Plattformen

* Nutzungsdauer

* geografischem Nutzungsgebiet

* Sprachen und Sprachfassungen

* erlaubten Textarten und Themen

* nachträglichen Textänderungen

* Weitergabe an Dienstleister oder Auftraggeber

* Speicherung und Löschung der Sprachdaten

* Verwendung für andere Produktionen

* Ausschluss bestimmter Aussagen oder Einsatzbereiche

Eine zeitlich und inhaltlich unbegrenzte Erlaubnis kann für Sprecherinnen, Schauspieler und Darsteller weitreichende Folgen haben. Umfang und Vergütung sollten deshalb vor der Aufnahme transparent festgelegt werden.

Auch allgemeine Verwertungsrechte oder ein klassisches Buyout erfassen die Herstellung eines digitalen Stimmklons nicht zwangsläufig eindeutig. Die KI-Nutzung sollte deshalb gesondert benannt werden.

Vergütung bei KI-generierten Stimmen

Für Voice-Cloning-Projekte gibt es kein allgemeingültiges Vergütungsmodell. Die Bezahlung kann sich aus mehreren Bestandteilen zusammensetzen:

* Gage für das Casting oder die Sprachaufnahme

* Vergütung für die Erstellung des Stimmmodells

* Nutzungsvergütung für definierte Medien und Zeiträume

* zusätzliche Vergütung für weitere Sprachfassungen

* Verlängerung bei fortgesetzter Nutzung

* Vergütung für neue Kampagnen oder nachträglich erzeugte Inhalte

Je umfangreicher die Nutzungsmöglichkeiten sind, desto wichtiger wird eine getrennte Betrachtung von Aufnahmeleistung und KI-Nutzungsrechten. Ein Voice Clone, der über Jahre für unterschiedliche Inhalte eingesetzt werden darf, besitzt einen anderen wirtschaftlichen Umfang als eine einzelne, zeitlich begrenzte Sprachfassung.

Muss eine KI-Stimme gekennzeichnet werden?

Für KI-generierte oder manipulierte Inhalte können abhängig von Art und Verwendung gesetzliche Transparenz- und Kennzeichnungspflichten gelten. Seit August 2026 gelten in der Europäischen Union entsprechende Transparenzvorgaben des AI Acts für bestimmte KI-Inhalte.

Ob eine konkrete Sprachaufnahme gekennzeichnet werden muss, hängt unter anderem davon ab, wie die KI-Stimme eingesetzt wird und ob für das Publikum eine Täuschungs- oder Verwechslungsgefahr besteht. Besonders sensibel sind Inhalte, bei denen einer realen Person Aussagen zugeschrieben werden, die sie selbst nicht gesprochen hat.

Auftraggeber sollten daher neben den vertraglichen Nutzungsrechten auch die jeweils geltenden Kennzeichnungs-, Datenschutz- und Persönlichkeitsrechte prüfen lassen.

Chancen und Risiken von Voice Cloning

Voice Cloning ermöglicht schnellere Textanpassungen, mehrsprachige Produktionen und eine konsistente Stimme über verschiedene Formate hinweg. Gleichzeitig besteht das Risiko, dass Stimmen ohne ausreichende Zustimmung kopiert, verändert oder in einem nicht vereinbarten Zusammenhang verwendet werden.

Eine professionelle Produktion sollte deshalb auf Transparenz, klar geregelte Rechte und die ausdrückliche Zustimmung der betroffenen Person achten. So kann Voice Cloning sinnvoll eingesetzt werden, ohne die Kontrolle über die eigene Stimme aus der Hand zu geben.

→ Sie suchen passende Stimmen und Gesichter für Ihre Produktion? FAMEONME vermittelt Schauspieler und Darsteller für Werbung, Film und Contentproduktionen.

Ähnliche Einträge