KI-Sprecher und Vertonung
KI-Stimmen für Videos: jede Figur mit eigener Stimme
Die meisten KI-Sprecher lesen einen Textblock mit einer einzigen Stimme vor. Eine Geschichte braucht mehr: einen Erzähler, ein Mädchen, das schnell redet, einen alten Kapitän, der sich Zeit lässt, einen Roboter, der nach keinem von beiden klingt. Insaga zerlegt dein Skript in Sätze, gibt jeden Satz der Figur, die ihn sagt, besetzt jede Rolle mit einer eigenen Stimme aus über 6.000, Hunderte davon auf Deutsch, und legt die Aufnahme auf der Timeline unter das Bild.
100 Credits gratis · ohne Kreditkarte · Studio auf Englisch, Stimmen und Untertitel auf Deutsch





Wie aus einem Skript eine Besetzung aus Stimmen wird
Der Stimmen-Tab startet mit dem Text deines Projekts, also derselben Geschichte, nach der die Bilder gezeichnet wurden, oder mit einem beliebigen Text, den du einfügst. Er hat zwei Modi (das Studio ist auf Englisch, darum stehen hier die Namen, die du dort siehst): Single Voice, bei dem eine Stimme alles liest, und Character Voices, bei dem der Text wie ein Hörspiel besetzt wird. Um den zweiten geht es hier, Schritt für Schritt.
Den Text nach Sprechern aufteilen
Drück auf Analyze Characters in Text. Insaga liest das Skript und teilt es in Sätze: Wörtliche Rede geht an die Figur, die sie sagt, alles andere an den Erzähler. Die Figuren, die beim Zeichnen der Geschichte entstanden sind, stehen in der Liste mit ihren Bildern und der Zahl ihrer Sätze. Du besetzt also Gesichter, die du schon kennst, und keine Namen in einer Tabelle. Die Aufteilung kostet keine Credits.
Korrigieren, wer was sagt
Unter Lines & roles siehst du das ganze Skript nach Sprechern eingefärbt. Klick auf einen Satz oder zieh über einen Teil davon und wähl, wer ihn sagt. Eine Figur, die bei der Aufteilung durchgerutscht ist, fügst du per Namen hinzu, benachbarte Sätze lassen sich zusammenführen, jede Änderung lässt sich rückgängig machen, und ein Knopf bringt dich zurück zur automatischen Aufteilung. Ein Text fasst bis zu 64 Sprecher.
Zuerst den Erzähler besetzen, dann alle anderen
Der Erzähler ist die Grundstimme: Die Sätze jeder Figur, der du keine eigene Stimme gibst, liest er mit, so hat die Aufnahme nie ein Loch. Danach öffnest du die Stimmenliste jeder Figur: zwischen Männer- und Frauenstimmen wechseln, die Liste nach Sprache filtern, nach Namen suchen und auf Play drücken, um eine Stimme vor der Wahl zu hören. Markier die, die dir gefallen, mit einem Stern und schreib eine Notiz dazu, etwa „Kapitän, Staffel 1“. Favoriten und Notizen werden in deinem Konto gespeichert.

Eine Szene, in der niemand spricht, gehört dem Erzähler: ein Brief, eine Erinnerung, der Regen. Aufnehmen, dann Satz für Satz nachbessern
Jede Figur wird auf einer eigenen Spur aufgenommen, auch eine, die am Ende ohne eigene Stimme geblieben ist. Hör alles durch. Passt eine Rolle nicht, klickst du auf die Figur und nimmst alles, was sie sagt, mit einer anderen Stimme neu auf. Ist ein einzelner Satz daneben, klickst du dieses Fragment auf der Spur an und generierst nur ihn neu, mit derselben oder einer anderen Stimme, bis zu fünfmal pro Fragment. Der Rest der Aufnahme bleibt genau da, wo er war.
Die Stimme unter das Bild legen
Mach so viele Takes, wie du willst, und hak den an, der in den Schnitt geht. Im Editor transkribiert Assemble die Aufnahme und legt die Szenenclips daran entlang, sodass jede Szene zu sehen ist, während ihre Sätze zu hören sind. Die Untertitel kommen aus derselben Transkription, Wort für Wort, in jedem der 31 Stile. Die Vertonung lässt sich auch als Audiodatei herunterladen, falls du das Video woanders schneidest.
Vier Figuren, die nie gleich klingen dürfen
Die Bilder unten gehören zu einer Geschichte im Anime-Stil, die in Insaga entstanden ist. Die Besetzung: ein Mädchen, das fliegt, der Roboter, der mit ihr fliegt, ein Kapitän, der zu viele Stürme gesehen hat, und ein Wal, der in den Wolken lebt. Auf dem Bildschirm würde niemand sie verwechseln. Fürs Ohr brauchen sie dieselbe Sorgfalt, also schreib für jede Figur eine kurze Stimmbeschreibung, bevor du die Liste öffnest.
Die Besetzung und eine Stimmbeschreibung für jede Figur
Pilotin: jung, flink
Roboter: abgehackt, schräg
Kapitän: tief, bedächtig
Wal: kein Text, der Erzähler spricht
Szenen, in denen sie reden



Eine Faustregel: Teilen sich zwei Figuren eine Szene, sollten sie sich in mindestens zwei von drei Dingen unterscheiden, nämlich Alter, Stimmlage und Tempo. Pilotin und Kapitän unterscheiden sich in allen dreien. Zwei gleichaltrige Schwestern brauchen mindestens ein anderes Sprechtempo, sonst weiß der Zuschauer nicht mehr, wer spricht, sobald die Kamera woanders hinschaut.
Stimmen besetzen, die ein ganzes Video tragen
Beurteil eine Stimme an deinem Satz, nicht an ihrer Hörprobe. Der Play-Knopf in der Liste spielt die eigene Probe der Stimme ab, und eine Stimme, die dort warm klingt, kann in einem wütenden Dialog flach werden. Markier drei Kandidaten, vertone die Szene und tausch die Rolle aus, die nicht funktioniert. Wechselst du eine Rolle, wird nur diese Rolle neu aufgenommen.
Gib dem Erzähler die ruhigste Stimme. In den meisten Geschichten trägt der Erzähler den Großteil des Textes, und der Zuschauer verbringt zehn Minuten mit dieser Stimme. Wähl sie danach, wie angenehm sie ist, nicht nach Dramatik, und heb die auffälligen Stimmen für Figuren auf, die nur kurz zu Wort kommen.
Wähl die Stimme passend zur Sprache des Textes. Stimmen sind mit den Sprachen markiert, die sie sprechen. Eine Stimme, die du wegen ihres Klangs ausgesucht hast, die aber nicht für Deutsch markiert ist, liest deinen Text womöglich mit fremdem Akzent. Filtere zuerst nach Sprache und entscheide dann nach Gehör. Der Filter trennt nach Sprache, nicht nach Land: Soll dein Video für ein Publikum in Wien oder Zürich klingen, hör dir die Proben genau an.
Schreib fürs Ohr. Zahlen, Abkürzungen und Klammern lassen sich schlecht vorlesen. Wenn es wichtig ist, wie „2026“, „z. B.“ oder „Nr. 5“ klingen soll, schreib es so aus, wie du es hören willst: „zweitausendsechsundzwanzig“, „zum Beispiel“, „Nummer fünf“.
Lass eine Serie wie sich selbst klingen. Stimmen werden in jedem Projekt neu gewählt, eine wiederkehrende Figur braucht also jedes Mal wieder dieselbe Stimme. Die Notizen an deinen markierten Stimmen machen daraus eine Sache von zehn Sekunden: Die Stimme sagt selbst, wem sie gehört.
Was der Stimmen-Tab sonst noch kann
- Über 6.000 Stimmen
- Männer und Frauen, jung und alt, in Dutzenden Sprachen, auf Deutsch Hunderte. Such nach Namen oder blätter die Liste Seite für Seite durch.
- Tempo und Pausen
- In den Voice Settings stellst du das Tempo zwischen halber und doppelter Geschwindigkeit ein und setzt Pausen zwischen den Sätzen. So darf ein Thriller hetzen und eine Gutenachtgeschichte durchatmen.
- Deine eigene Aufnahme
- Die Erzählung selbst eingesprochen? Lade sie als WAV, MP3, M4A oder AAC hoch, bis 50 MB. Der Editor transkribiert sie und schneidet die Szenen darauf, genau wie bei einer KI-Stimme.
- Download, wenn du ihn brauchst
- Die fertige Vertonung lässt sich als Audiodatei herunterladen, damit du sie in einem anderen Schnittprogramm verwenden kannst.
- Keine Credits für die Vorbereitung
- Das Aufteilen eines Skripts nach Sprechern und das Übersetzen kosten keine Credits. Bezahlt wird nur die Vertonung selbst.
- Unbegrenzt im Studio-Tarif
- Vertonung gibt es in den bezahlten Tarifen. Studio und Studio Max enthalten sie ohne Limit, zusammen mit Bildern, Animation und Export.
Dieselbe Geschichte, in einer anderen Sprache vertont
Bevor irgendetwas vertont wird, übersetzt der Tab Translate das Skript in bis zu drei von 27 Sprachen gleichzeitig, darunter Englisch, Spanisch, Französisch, Italienisch, Polnisch und Türkisch. Die Übersetzung kostet keine Credits. Jede Sprache bekommt ein eigenes Feld: Lies es, korrigier es oder füg deine eigene Fassung ein. Vertont wird, was im Feld steht.
Jede Sprachspur liest eine Stimme, die du für genau diese Spur wählst. Ihre Liste zeigt zuerst die Stimmen, die für diese Sprache markiert sind, also liest eine englische Spur eine englische Stimme und keine deutsche mit Akzent. Die Spuren werden als eigene Aufträge vertont, neben dem Original.
Die Bilder hängen nicht von der Sprache ab. Die neue Spur kommt unter dieselben Szenen, und die daraus transkribierten Untertitel erscheinen in ihrer Sprache. So kann eine Geschichte einen zweiten Kanal für ein anderes Land füllen, ohne ein einziges neues Bild und ohne einen neuen Clip. Andersherum geht es genauso: Ein englisches Skript bekommt eine deutsche Spur.
Der Stimmen-Tab von Insaga und ein reines Text-to-Speech-Tool
| Insaga | Typisches Text-to-Speech-Tool | |
|---|---|---|
| Was du einfügst | Eine Geschichte mit Erzähler und Figuren | Einen Textblock für eine Stimme |
| Dialog | Die Sätze werden für dich nach Sprechern aufgeteilt, du korrigierst die Aufteilung | Du zerschneidest den Text in Stücke und vertonst sie einzeln |
| Stimmen in einer Aufnahme | Ein Erzähler und eine eigene Stimme pro Figur, bis zu 64 Sprecher | Meist eine Stimme pro Generierung |
| Ein misslungener Satz | Fragment anklicken und nur diesen Satz neu generieren | Die Datei neu generieren oder im Audioeditor schneiden |
| Bild | Die Szenen werden auf der Timeline auf die Aufnahme geschnitten | Eine Audiodatei, die du selbst ans Video anlegst |
| Untertitel | Aus derselben Aufnahme transkribiert, 31 Stile | Ein eigener Schritt oder ein eigenes Tool |
Ein allgemeiner Vergleich: Text-to-Speech-Dienste unterscheiden sich, und manche bieten auch Projekte mit mehreren Sprechern. Insaga ersetzt kein Tonstudio, sondern vertont eine Geschichte, die schon Bilder hat.
Geschichten, die mehr als eine Stimme brauchen
Märchen und Gutenachtgeschichten. Der Erzähler liest die Märchenzeilen, Fuchs, Großmutter und Wolf bekommen jeweils eine eigene Stimme. Kleine Zuhörer wissen, wer spricht, ohne auf den Bildschirm zu schauen.
Hörspiel mit Bildern. Wer mit Hörspielkassetten groß geworden ist, kennt das Prinzip: ein Erzähler, eine Handvoll Sprecher, und die Figuren erkennt man am Klang. Genau so besetzt du hier eine Geschichte, nur dass Bilder dazukommen.
Horror, Mystery und True Crime. Ein ruhiger Erzähler und kurze Sätze von einer Zeugin, einer Stimme am Telefon, jemandem hinter einer Tür. Der Kontrast macht die leisen Stellen unheimlich.
Erklärvideos mit zwei Stimmen. Eine Moderatorin, die erklärt, und ein Skeptiker, der genau die Frage dazwischenwirft, die der Zuschauer gleich stellen würde. Zwei Stimmen bewahren ein zehnminütiges Erklärvideo davor, zur Vorlesung zu werden.
Webromane und Fanfiction. Kapitel, die fast nur aus Dialog bestehen, werden lebendig, wenn jede Figur einmal besetzt wird und vom ersten bis zum letzten Kapitel gleich klingt.
Fragen zur KI-Vertonung
Ist die KI-Vertonung in Insaga kostenlos?
Nicht beim kostenlosen Start. Ein neues Konto bekommt einmalig 100 Credits, ohne Kreditkarte, und die gehen in Bilder: die Figuren und die Einstellungen deiner Geschichte. Das Aufteilen nach Sprechern und das Übersetzen kosten keine Credits, für die Vertonung selbst brauchst du aber einen bezahlten Tarif. Studio und Studio Max enthalten die Vertonung ohne Limit.
Gibt es deutsche Stimmen?
Ja, Hunderte: Von den über 6.000 Stimmen im Katalog sind Hunderte für Deutsch markiert. Der Filter in der Liste trennt nach Sprache, nicht nach Region. Hör dir also die Probe jeder Stimme an, bevor du sie wählst, und markier die, die zu deinem Publikum passen, mit einem Stern.
Wie viele verschiedene Stimmen kann ein Video haben?
Einen Erzähler und so viele Figuren, wie der Text Sprecher hat, bis zu 64 in einem Text. In der Praxis hält ein Zuhörer drei bis sechs Stimmen bequem auseinander, deshalb ist es oft besser, Nebenfiguren dem Erzähler zu überlassen.
Kann ich meine eigene Stimme verwenden?
Ja, als Aufnahme. Sprich die Erzählung selbst ein und lade sie als WAV, MP3, M4A oder AAC hoch, bis 50 MB. Der Editor behandelt sie wie jede andere Vertonung: Er transkribiert sie, schneidet die Szenen darauf und macht daraus die Untertitel.
Kann ich eine Stimme langsamer oder schneller machen?
Ja. In den Voice Settings stellst du das Tempo zwischen halber und doppelter Geschwindigkeit ein und setzt Pausen zwischen den Sätzen. Die Sprechweise kommt allerdings mehr von der Stimme selbst als von einem Regler: Für eine ruhige Rolle wähl eine ruhige Stimme, statt eine aufgeregte zu bremsen.
Was, wenn die KI einen Satz falsch liest?
Klick das Fragment auf der fertigen Spur an und generier nur diesen Satz neu, mit derselben oder einer anderen Stimme. Jedes Fragment lässt sich innerhalb von 90 Tagen nach der Aufnahme bis zu fünfmal neu machen, der Rest der Vertonung ändert sich nicht. Passt eine ganze Rolle nicht, klickst du auf die Figur und nimmst alles, was sie sagt, neu auf.
In welchen Sprachen kann vertont werden?
Stimmen sind mit den Sprachen markiert, die sie sprechen, und der Sprachfilter lässt nur die übrig, die deine sprechen. Ist das Skript in einer Sprache geschrieben und soll das Video in einer anderen erscheinen, übersetzt du es vorher im Stimmen-Tab: 27 Sprachen, bis zu drei auf einmal, und die Übersetzung kostet keine Credits.
Kommen Untertitel mit?
Der Editor macht sie aus der Aufnahme selbst: Sie wird Wort für Wort transkribiert, und die Untertitel folgen der Stimme in jedem der 31 Stile. Weil sie aus dem Ton entstehen, stimmen sie mit dem überein, was wirklich gesagt wird, ob bei einer übersetzten Spur oder bei deiner eigenen Aufnahme.
Weiterlesen
Füg eine Szene mit Dialog ein und besetz sie
Fang mit der Geschichte und ihren Figuren an, mit 100 Credits gratis und ohne Kreditkarte. Die Stimmen kommen mit einem bezahlten Tarif dazu, sobald die Bilder stehen.
Läuft im Browser. Keine Installation.