Insaga

KI-Sprecher und Vertonung

KI-Stimmen für Videos: jede Figur mit eigener Stimme

Die meisten KI-Sprecher lesen einen Textblock mit einer einzigen Stimme vor. Eine Geschichte braucht mehr: einen Erzähler, ein Mädchen, das schnell redet, einen alten Kapitän, der sich Zeit lässt, einen Roboter, der nach keinem von beiden klingt. Insaga zerlegt dein Skript in Sätze, gibt jeden Satz der Figur, die ihn sagt, besetzt jede Rolle mit einer eigenen Stimme aus über 6.000, Hunderte davon auf Deutsch, und legt die Aufnahme auf der Timeline unter das Bild.

100 Credits gratis · ohne Kreditkarte · Studio auf Englisch, Stimmen und Untertitel auf Deutsch

Comic-Bild: In einem Laden voller Gläser und trocknender Kräuter spricht eine Frau mit Kapuze und Kerze mit einem dunkelhaarigen Mädchen, das man von hinten sieht
Eine alte Heilerin und ein Mädchen: zwei Stimmen
Schwarz-Weiß-Bild: Eine junge Frau im Kostüm der 1950er-Jahre und ein lächelnder Mann in dunklem Anzug mit Krawatte stehen in einem leeren Klassenzimmer
Ein Gespräch nach dem Unterricht
Knetanimation: Ein Junge mit Sommersprossen und ein Mann mit grauem Bart, beide mit Knopfaugen, stehen sich in einer vollgestellten Küche Nase an Nase gegenüber
Nase an Nase: ein Junge und ein alter Mann
Federzeichnung: Ein Mann schreit und zeigt auf eine kleine Pferdefigur in seiner Hand, ein anderer starrt ihn fassungslos an; dahinter eine Menschenmenge und Pferde
Ein Streit in der Menge
Strichmännchen: eines mit verschränkten Armen, eines mit blauem Hut und eines mit Stirnband, das auf die beiden anderen zeigt
Drei Sprecher, drei Stimmen

Wie aus einem Skript eine Besetzung aus Stimmen wird

Der Stimmen-Tab startet mit dem Text deines Projekts, also derselben Geschichte, nach der die Bilder gezeichnet wurden, oder mit einem beliebigen Text, den du einfügst. Er hat zwei Modi (das Studio ist auf Englisch, darum stehen hier die Namen, die du dort siehst): Single Voice, bei dem eine Stimme alles liest, und Character Voices, bei dem der Text wie ein Hörspiel besetzt wird. Um den zweiten geht es hier, Schritt für Schritt.

  1. Den Text nach Sprechern aufteilen

    Drück auf Analyze Characters in Text. Insaga liest das Skript und teilt es in Sätze: Wörtliche Rede geht an die Figur, die sie sagt, alles andere an den Erzähler. Die Figuren, die beim Zeichnen der Geschichte entstanden sind, stehen in der Liste mit ihren Bildern und der Zahl ihrer Sätze. Du besetzt also Gesichter, die du schon kennst, und keine Namen in einer Tabelle. Die Aufteilung kostet keine Credits.

  2. Korrigieren, wer was sagt

    Unter Lines & roles siehst du das ganze Skript nach Sprechern eingefärbt. Klick auf einen Satz oder zieh über einen Teil davon und wähl, wer ihn sagt. Eine Figur, die bei der Aufteilung durchgerutscht ist, fügst du per Namen hinzu, benachbarte Sätze lassen sich zusammenführen, jede Änderung lässt sich rückgängig machen, und ein Knopf bringt dich zurück zur automatischen Aufteilung. Ein Text fasst bis zu 64 Sprecher.

  3. Zuerst den Erzähler besetzen, dann alle anderen

    Der Erzähler ist die Grundstimme: Die Sätze jeder Figur, der du keine eigene Stimme gibst, liest er mit, so hat die Aufnahme nie ein Loch. Danach öffnest du die Stimmenliste jeder Figur: zwischen Männer- und Frauenstimmen wechseln, die Liste nach Sprache filtern, nach Namen suchen und auf Play drücken, um eine Stimme vor der Wahl zu hören. Markier die, die dir gefallen, mit einem Stern und schreib eine Notiz dazu, etwa „Kapitän, Staffel 1“. Favoriten und Notizen werden in deinem Konto gespeichert.

    Schwarz-Weiß: Eine Frau im Trenchcoat sitzt nachts an einem regennassen Fenster, ein Glas in der einen Hand, einen handgeschriebenen Brief auf dem Knie
    Eine Szene, in der niemand spricht, gehört dem Erzähler: ein Brief, eine Erinnerung, der Regen.
  4. Aufnehmen, dann Satz für Satz nachbessern

    Jede Figur wird auf einer eigenen Spur aufgenommen, auch eine, die am Ende ohne eigene Stimme geblieben ist. Hör alles durch. Passt eine Rolle nicht, klickst du auf die Figur und nimmst alles, was sie sagt, mit einer anderen Stimme neu auf. Ist ein einzelner Satz daneben, klickst du dieses Fragment auf der Spur an und generierst nur ihn neu, mit derselben oder einer anderen Stimme, bis zu fünfmal pro Fragment. Der Rest der Aufnahme bleibt genau da, wo er war.

  5. Die Stimme unter das Bild legen

    Mach so viele Takes, wie du willst, und hak den an, der in den Schnitt geht. Im Editor transkribiert Assemble die Aufnahme und legt die Szenenclips daran entlang, sodass jede Szene zu sehen ist, während ihre Sätze zu hören sind. Die Untertitel kommen aus derselben Transkription, Wort für Wort, in jedem der 31 Stile. Die Vertonung lässt sich auch als Audiodatei herunterladen, falls du das Video woanders schneidest.

Vier Figuren, die nie gleich klingen dürfen

Die Bilder unten gehören zu einer Geschichte im Anime-Stil, die in Insaga entstanden ist. Die Besetzung: ein Mädchen, das fliegt, der Roboter, der mit ihr fliegt, ein Kapitän, der zu viele Stürme gesehen hat, und ein Wal, der in den Wolken lebt. Auf dem Bildschirm würde niemand sie verwechseln. Fürs Ohr brauchen sie dieselbe Sorgfalt, also schreib für jede Figur eine kurze Stimmbeschreibung, bevor du die Liste öffnest.

Die Besetzung und eine Stimmbeschreibung für jede Figur

  • Porträt: ein lächelndes Pilotenmädchen mit hochgeschobener Fliegerbrille und orangefarbener Jacke mit FellkragenPilotin: jung, flink
  • Porträt: ein kleiner kupferoranger Roboter, dessen einzelne runde Linse unter einem Zweiblattpropeller blau leuchtetRoboter: abgehackt, schräg
  • Porträt: ein strenger alter Seemann mit weißer Schirmmütze und Ankerabzeichen, ein Fernrohr über der SchulterKapitän: tief, bedächtig
  • Porträt: ein rundlicher hellblauer Wal aus Wolken mit großen violetten Augen und lila FleckenWal: kein Text, der Erzähler spricht

Szenen, in denen sie reden

Unter einer hängenden Laterne beugen sich das Pilotenmädchen, ihr Roboter und der alte Kapitän über eine Papierkarte, die auf einer Holztruhe ausgerollt ist
Drei Sprecher über einer Karte
Auf einem nassen Holzsteg lacht das Mädchen, der Roboter winkt mit beiden Händen, während ein riesiger Wolkenwal in einer Gischtfontäne auftaucht; dahinter ein Schloss auf einer schwebenden Insel
Zwei Stimmen und ein Platsch
Bei Sonnenuntergang steht der alte Kapitän mit dem Mädchen, ihrem Roboter und dem Wolkenwal am Ende eines Stegs über einem Wolkenmeer, weit hinten ein Leuchtturm auf einem schwebenden Felsen
Die ganze Besetzung; das letzte Wort hat der Erzähler

Eine Faustregel: Teilen sich zwei Figuren eine Szene, sollten sie sich in mindestens zwei von drei Dingen unterscheiden, nämlich Alter, Stimmlage und Tempo. Pilotin und Kapitän unterscheiden sich in allen dreien. Zwei gleichaltrige Schwestern brauchen mindestens ein anderes Sprechtempo, sonst weiß der Zuschauer nicht mehr, wer spricht, sobald die Kamera woanders hinschaut.

Stimmen besetzen, die ein ganzes Video tragen

Beurteil eine Stimme an deinem Satz, nicht an ihrer Hörprobe. Der Play-Knopf in der Liste spielt die eigene Probe der Stimme ab, und eine Stimme, die dort warm klingt, kann in einem wütenden Dialog flach werden. Markier drei Kandidaten, vertone die Szene und tausch die Rolle aus, die nicht funktioniert. Wechselst du eine Rolle, wird nur diese Rolle neu aufgenommen.

Gib dem Erzähler die ruhigste Stimme. In den meisten Geschichten trägt der Erzähler den Großteil des Textes, und der Zuschauer verbringt zehn Minuten mit dieser Stimme. Wähl sie danach, wie angenehm sie ist, nicht nach Dramatik, und heb die auffälligen Stimmen für Figuren auf, die nur kurz zu Wort kommen.

Wähl die Stimme passend zur Sprache des Textes. Stimmen sind mit den Sprachen markiert, die sie sprechen. Eine Stimme, die du wegen ihres Klangs ausgesucht hast, die aber nicht für Deutsch markiert ist, liest deinen Text womöglich mit fremdem Akzent. Filtere zuerst nach Sprache und entscheide dann nach Gehör. Der Filter trennt nach Sprache, nicht nach Land: Soll dein Video für ein Publikum in Wien oder Zürich klingen, hör dir die Proben genau an.

Schreib fürs Ohr. Zahlen, Abkürzungen und Klammern lassen sich schlecht vorlesen. Wenn es wichtig ist, wie „2026“, „z. B.“ oder „Nr. 5“ klingen soll, schreib es so aus, wie du es hören willst: „zweitausendsechsundzwanzig“, „zum Beispiel“, „Nummer fünf“.

Lass eine Serie wie sich selbst klingen. Stimmen werden in jedem Projekt neu gewählt, eine wiederkehrende Figur braucht also jedes Mal wieder dieselbe Stimme. Die Notizen an deinen markierten Stimmen machen daraus eine Sache von zehn Sekunden: Die Stimme sagt selbst, wem sie gehört.

Was der Stimmen-Tab sonst noch kann

Über 6.000 Stimmen
Männer und Frauen, jung und alt, in Dutzenden Sprachen, auf Deutsch Hunderte. Such nach Namen oder blätter die Liste Seite für Seite durch.
Tempo und Pausen
In den Voice Settings stellst du das Tempo zwischen halber und doppelter Geschwindigkeit ein und setzt Pausen zwischen den Sätzen. So darf ein Thriller hetzen und eine Gutenachtgeschichte durchatmen.
Deine eigene Aufnahme
Die Erzählung selbst eingesprochen? Lade sie als WAV, MP3, M4A oder AAC hoch, bis 50 MB. Der Editor transkribiert sie und schneidet die Szenen darauf, genau wie bei einer KI-Stimme.
Download, wenn du ihn brauchst
Die fertige Vertonung lässt sich als Audiodatei herunterladen, damit du sie in einem anderen Schnittprogramm verwenden kannst.
Keine Credits für die Vorbereitung
Das Aufteilen eines Skripts nach Sprechern und das Übersetzen kosten keine Credits. Bezahlt wird nur die Vertonung selbst.
Unbegrenzt im Studio-Tarif
Vertonung gibt es in den bezahlten Tarifen. Studio und Studio Max enthalten sie ohne Limit, zusammen mit Bildern, Animation und Export.

Dieselbe Geschichte, in einer anderen Sprache vertont

Bevor irgendetwas vertont wird, übersetzt der Tab Translate das Skript in bis zu drei von 27 Sprachen gleichzeitig, darunter Englisch, Spanisch, Französisch, Italienisch, Polnisch und Türkisch. Die Übersetzung kostet keine Credits. Jede Sprache bekommt ein eigenes Feld: Lies es, korrigier es oder füg deine eigene Fassung ein. Vertont wird, was im Feld steht.

Jede Sprachspur liest eine Stimme, die du für genau diese Spur wählst. Ihre Liste zeigt zuerst die Stimmen, die für diese Sprache markiert sind, also liest eine englische Spur eine englische Stimme und keine deutsche mit Akzent. Die Spuren werden als eigene Aufträge vertont, neben dem Original.

Die Bilder hängen nicht von der Sprache ab. Die neue Spur kommt unter dieselben Szenen, und die daraus transkribierten Untertitel erscheinen in ihrer Sprache. So kann eine Geschichte einen zweiten Kanal für ein anderes Land füllen, ohne ein einziges neues Bild und ohne einen neuen Clip. Andersherum geht es genauso: Ein englisches Skript bekommt eine deutsche Spur.

Der Stimmen-Tab von Insaga und ein reines Text-to-Speech-Tool

InsagaTypisches Text-to-Speech-Tool
Was du einfügstEine Geschichte mit Erzähler und FigurenEinen Textblock für eine Stimme
DialogDie Sätze werden für dich nach Sprechern aufgeteilt, du korrigierst die AufteilungDu zerschneidest den Text in Stücke und vertonst sie einzeln
Stimmen in einer AufnahmeEin Erzähler und eine eigene Stimme pro Figur, bis zu 64 SprecherMeist eine Stimme pro Generierung
Ein misslungener SatzFragment anklicken und nur diesen Satz neu generierenDie Datei neu generieren oder im Audioeditor schneiden
BildDie Szenen werden auf der Timeline auf die Aufnahme geschnittenEine Audiodatei, die du selbst ans Video anlegst
UntertitelAus derselben Aufnahme transkribiert, 31 StileEin eigener Schritt oder ein eigenes Tool

Ein allgemeiner Vergleich: Text-to-Speech-Dienste unterscheiden sich, und manche bieten auch Projekte mit mehreren Sprechern. Insaga ersetzt kein Tonstudio, sondern vertont eine Geschichte, die schon Bilder hat.

Geschichten, die mehr als eine Stimme brauchen

Märchen und Gutenachtgeschichten. Der Erzähler liest die Märchenzeilen, Fuchs, Großmutter und Wolf bekommen jeweils eine eigene Stimme. Kleine Zuhörer wissen, wer spricht, ohne auf den Bildschirm zu schauen.

Hörspiel mit Bildern. Wer mit Hörspielkassetten groß geworden ist, kennt das Prinzip: ein Erzähler, eine Handvoll Sprecher, und die Figuren erkennt man am Klang. Genau so besetzt du hier eine Geschichte, nur dass Bilder dazukommen.

Horror, Mystery und True Crime. Ein ruhiger Erzähler und kurze Sätze von einer Zeugin, einer Stimme am Telefon, jemandem hinter einer Tür. Der Kontrast macht die leisen Stellen unheimlich.

Erklärvideos mit zwei Stimmen. Eine Moderatorin, die erklärt, und ein Skeptiker, der genau die Frage dazwischenwirft, die der Zuschauer gleich stellen würde. Zwei Stimmen bewahren ein zehnminütiges Erklärvideo davor, zur Vorlesung zu werden.

Webromane und Fanfiction. Kapitel, die fast nur aus Dialog bestehen, werden lebendig, wenn jede Figur einmal besetzt wird und vom ersten bis zum letzten Kapitel gleich klingt.

Fragen zur KI-Vertonung

Ist die KI-Vertonung in Insaga kostenlos?

Nicht beim kostenlosen Start. Ein neues Konto bekommt einmalig 100 Credits, ohne Kreditkarte, und die gehen in Bilder: die Figuren und die Einstellungen deiner Geschichte. Das Aufteilen nach Sprechern und das Übersetzen kosten keine Credits, für die Vertonung selbst brauchst du aber einen bezahlten Tarif. Studio und Studio Max enthalten die Vertonung ohne Limit.

Gibt es deutsche Stimmen?

Ja, Hunderte: Von den über 6.000 Stimmen im Katalog sind Hunderte für Deutsch markiert. Der Filter in der Liste trennt nach Sprache, nicht nach Region. Hör dir also die Probe jeder Stimme an, bevor du sie wählst, und markier die, die zu deinem Publikum passen, mit einem Stern.

Wie viele verschiedene Stimmen kann ein Video haben?

Einen Erzähler und so viele Figuren, wie der Text Sprecher hat, bis zu 64 in einem Text. In der Praxis hält ein Zuhörer drei bis sechs Stimmen bequem auseinander, deshalb ist es oft besser, Nebenfiguren dem Erzähler zu überlassen.

Kann ich meine eigene Stimme verwenden?

Ja, als Aufnahme. Sprich die Erzählung selbst ein und lade sie als WAV, MP3, M4A oder AAC hoch, bis 50 MB. Der Editor behandelt sie wie jede andere Vertonung: Er transkribiert sie, schneidet die Szenen darauf und macht daraus die Untertitel.

Kann ich eine Stimme langsamer oder schneller machen?

Ja. In den Voice Settings stellst du das Tempo zwischen halber und doppelter Geschwindigkeit ein und setzt Pausen zwischen den Sätzen. Die Sprechweise kommt allerdings mehr von der Stimme selbst als von einem Regler: Für eine ruhige Rolle wähl eine ruhige Stimme, statt eine aufgeregte zu bremsen.

Was, wenn die KI einen Satz falsch liest?

Klick das Fragment auf der fertigen Spur an und generier nur diesen Satz neu, mit derselben oder einer anderen Stimme. Jedes Fragment lässt sich innerhalb von 90 Tagen nach der Aufnahme bis zu fünfmal neu machen, der Rest der Vertonung ändert sich nicht. Passt eine ganze Rolle nicht, klickst du auf die Figur und nimmst alles, was sie sagt, neu auf.

In welchen Sprachen kann vertont werden?

Stimmen sind mit den Sprachen markiert, die sie sprechen, und der Sprachfilter lässt nur die übrig, die deine sprechen. Ist das Skript in einer Sprache geschrieben und soll das Video in einer anderen erscheinen, übersetzt du es vorher im Stimmen-Tab: 27 Sprachen, bis zu drei auf einmal, und die Übersetzung kostet keine Credits.

Kommen Untertitel mit?

Der Editor macht sie aus der Aufnahme selbst: Sie wird Wort für Wort transkribiert, und die Untertitel folgen der Stimme in jedem der 31 Stile. Weil sie aus dem Ton entstehen, stimmen sie mit dem überein, was wirklich gesagt wird, ob bei einer übersetzten Spur oder bei deiner eigenen Aufnahme.

Weiterlesen

Füg eine Szene mit Dialog ein und besetz sie

Fang mit der Geschichte und ihren Figuren an, mit 100 Credits gratis und ohne Kreditkarte. Die Stimmen kommen mit einem bezahlten Tarif dazu, sobald die Bilder stehen.

Läuft im Browser. Keine Installation.