Shorts vertonen und Podcast-Intro aufnehmen – mit demselben kostenlosen Stimmenklon

Es war 1:17 Uhr nachts, und ich starrte auf eine drei Minuten lange Produktdemo. Die siebte Version des Voiceovers lag auf der Timeline, und meine eigene Stimme klang, als hätte ich drei Tage lang geraucht. Ein Kumpel schrieb: „Du machst doch ständig mit TTS rum – warum quälst du dich?“

Gute Frage. Warum eigentlich.

In derselben Nacht habe ich zwei Baustellen neu aufgesetzt: das Voiceover für die Shorts und das Podcast-Intro, das ich seit Monaten vor mir herschiebe. Beides ist Vertonung, aber die Anforderungen könnten unterschiedlicher nicht sein.

Shorts vertonen: Schnell, stabil, beliebig oft änderbar

Der Schmerz bei Shorts ist ein einziges Wort: Änderung. Heute ist die Stimme zu ernst, morgen der Rhythmus zu langsam, übermorgen wird das Skript komplett umgeschrieben. Wenn du jedes Mal neu einsprechen musst, gibt deine Kehle zuerst auf.

Genau da spielt Text zu Sprache kostenlos seine Stärke aus. Ich ändere den Satz im Skript, markiere den Absatz, lasse neu generieren – dreißig Sekunden später liegt die neue Audiospur da. Tempo und Pausen kann ich feinjustieren. Das ist deutlich entspannter, als sich selbst zwanzig Mal ins Mikrofon zu fluchen.

Mein Trick: Ich lade eine saubere Aufnahme von mir hoch – ruhiger Raum, eine Faust vom Mikro weg, zwei Minuten neutraler Text. Dann lasse ich eigene Stimme klonen und nutze die Klonstimme für alle Voiceovers. Die Tonlage bleibt einheitlich, und in den Shorts merkt das Publikum den Unterschied nicht.

Eine Falle, die mich Nerven gekostet hat: Schreibt keine „Haha“-Laute oder übertriebenen Seufzer ins Skript. Das klingt synthetisch sofort seltsam. Emotion gehört ins Bild und in die Musik. Der Text liefert nur die Information.

Podcast-Intro: Da zählt Menschlichkeit – und DSGVO

Podcast ist ein anderes Biest. Die Leute haben Kopfhörer auf, und die ersten fünfzehn Sekunden entscheiden, ob sie bleiben. Klingt die Stimme auch nur leicht nach Roboter, sind sie weg – „Das ist doch ein AI Sprecher, oder?“

Deshalb nutze ich die Klonstimme im Intro nur für feste Bausteine: Sendungsname, wer ich bin, das Thema der Folge. Den eigentlichen Talk spreche ich selbst ein. So klingt der Einstieg sauber und stabil, während der Rest echte Atemzüge und Versprecher behält. Ja, Versprecher können sympathisch sein.

Die Qualität des Trainingsmaterials ist beim Podcast noch wichtiger. Meine erste Version hatte ein Grundrauschen aus der alten Wohnung. Das Ergebnis: zischende S-Laute, die mir die Nackenhaare hochgestellt haben. Zweiter Versuch mit sauberem Material – sofort brauchbar. Dass kostenlose Stimmenklon online ohne Anmeldung funktioniert, hilft beim Ausprobieren. Null Kosten, null Risiko, einfach neu hochladen.

Und jetzt der unangenehme Teil für alle in Deutschland: Wenn du die Stimme einer anderen Person klonst, brauchst du deren ausdrückliche Einwilligung. Die menschliche Stimme kann ein biometrisches Datum sein, und die DSGVO macht da keinen Spaß. Für mein eigenes Intro ist das unkritisch. Sobald aber Gäste oder Sprecher:innen im Spiel sind, hole ich mir vorher ein schriftliches Okay. Dazu kommt die Kennzeichnungspflicht nach dem EU AI Act – bei rein synthetischen Inhalten sollte klar sein, dass eine KI spricht. Ich schreibe es in die Shownotes und bei YouTube in die Beschreibung.

Mein Wochen-Workflow für beide Formate

So sieht es bei mir inzwischen aus – vielleicht hilft es dir:

  • Skript schreiben, laut lesen, alle Schriftsprache rauswerfen. Wörter wie „ferner“ oder „im Hinblick auf“ fliegen raus.
  • Voiceover komplett mit der Klonstimme erzeugen, exportieren, an der Timeline schneiden.
  • Podcast-Intro separat generieren, Tempo etwas langsamer, Lautstärke etwas leiser als beim Shorts-Voiceover.
  • Vor dem finalen Export einmal mit Kopfhörern komplett anhören. Über Handylautsprecher klingt vieles okay, mit Kopfhörern hörst du jeden Kratzer.
  • Wenn ich viele Varianten brauche, nutze ich die dynamische Sprachausgabe und baue sie in mein Skript-Tool ein. So kommen an einem Tag locker dreißig Vertonungen raus, ohne dass es weh tut.

Übrigens: Wer Hörbücher oder längere Projekte plant, kann mit demselben Prinzip Hörbuch selbst vertonen. Kapitelweise generieren, dann manuell nachbessern. Klingt nicht wie ein Verlag, aber für ein persönliches Projekt reicht es allemal.

FAQ

Erkennt man meine geklonte Stimme?

Bei sauberem Ausgangsmaterial in Alltagssituationen meistens nicht. Im Podcast, wo Leute nah dran sind, würde ich mischen: feste Passagen synthetisch, freie Rede selbst aufnehmen. Dann bleibt der Charakter erhalten.

Darf ich KI-Stimmen auf YouTube, TikTok und Spotify nutzen?

Die Plattformen verbieten AI-Vertonung nicht pauschal. Es kommt auf den Inhalt an. Ich kennzeichne es transparent und achte darauf, dass ich keine fremde Stimme ohne Erlaubnis verwende. Bei Musik oder Nachrichten sieht es anders aus – da wäre ich vorsichtig.

Ist der kostenlose Stimmenklon wirklich dauerhaft kostenlos?

Ich nutze ihn seit Monaten, und Stimme klonen kostenlos war bisher immer möglich – ohne Registrierung, ohne versteckte Kosten. Ob das in zehn Jahren noch so ist, weiß niemand. Wichtige Aufnahmen sichere ich deshalb lokal, und das Trainingsmaterial lösche ich nicht.

Was ich dir für heute Nacht mitgebe

Wenn du auch ständig zwischen Voiceover und Podcast-Intro hin- und hergerissen bist: Nimm dir zehn Minuten, sprich zwei Minuten sauberen Text in dein Handy – ruhiger Raum, keine Musik, kein Hall. Lade die Datei bei kostenloser AI Sprecher hoch und erzeuge eine Testversion. Wenn es Mist ist, löschst du es. Kostet ja nichts.

Bei mir war es der Moment, in dem ich um zwei Uhr nachts das Shorts-Voiceover neu generiert habe und der Kunde am nächsten Tag nichts mehr zu meckern hatte. In der Agenturwelt ist das ein Sechser im Lotto. Das Podcast-Intro lag seit drei Monaten auf Eis – an dem Abend war es fertig. Also: Nicht mehr lange überlegen. Einfach ausprobieren.