KI-Video mit Ton und Musik erstellen: so geht es
Wie kommt Ton in ein KI-Video?
Ein stummer Clip wirkt wie eine Vorschau, erst der Ton macht daraus ein Video. Die gute Nachricht: Du musst dafür kein Tonstudio bedienen. Die sechs Tools auf dieser Seite bringen Ton auf vier verschiedenen Wegen ins Bild, und wer diese Wege kennt, wählt schneller das richtige Werkzeug:
- Ton entsteht mit dem Bild: Google Veo, Kling VIDEO 3.0 und PixVerse V6 erzeugen Dialog und Geräusche direkt im Clip.
- Stimme wird über ein Video gelegt: HeyGen lässt einen KI-Sprecher deinen Text vortragen, CapCut legt KI-Stimmen und Musik im Editor darunter.
- Bild folgt dem Ton: Lip-Sync bei PixVerse, Kling AI und Hailuo AI passt die Lippen an eine Audiodatei oder Sprachspur an.
- Ton wird nachträglich ersetzt: HeyGen übersetzt Videos mit Lip-Sync, CapCut bringt einen Video-Übersetzer mit.
Für die meisten Einsteiger ist der erste Weg der schnellste. Du beschreibst im Prompt, was zu hören sein soll, und bekommst Bild und Ton aus einem Guss. Der Haken: Nachträglich ändern lässt sich so ein Ton kaum, du generierst dann eben neu.
Der dritte Weg lohnt sich, wenn du schon Audio hast, etwa einen Podcast-Ausschnitt oder eine eingesprochene Nachricht. Dann bestimmt der Ton das Video und nicht umgekehrt. Das ist auch der Weg mit der meisten Kontrolle, denn Länge, Rhythmus und Text stehen fest, bevor die KI loslegt.
Für sprechende Porträts und Übersetzungen würde ich deshalb fast immer so anfangen und den Ton nicht dem Zufall eines Prompts überlassen.
Die Übersicht direkt unter diesem Text zeigt, welches der sechs Tools Ton, Lip-Sync und sprechende Fotos kann. Wer eigentlich gar keinen Ton ändern, sondern ein Gesicht im Foto tauschen will, braucht ein anderes Werkzeug.
| Tool | Gratis-Version | Günstigster Monatspreis | Stärken |
|---|---|---|---|
| Google Veo | Ja | 4,99 € | Text zu Video, Bild zu Video, Ton/Musik im Video |
| Kling AI | Ja | 7,73 € | Face Swap im Foto, Face Swap im Video, Text zu Video |
| PixVerse | Ja | 7,03 € | Text zu Video, Bild zu Video, Sprechendes Foto (Lip-Sync) |
| Hailuo AI | Ja | 13,17 € | Ton/Musik im Video, Text zu Video (Eingeschränkt), Bild zu Video (Eingeschränkt) |
| CapCut | Ja | 9,17 € | KI-Videoschnitt, Ton/Musik im Video, Text zu Video (Nur im Abo) |
| HeyGen | Ja | 10,00 € | Face Swap im Foto, Face Swap im Video, Face Swap in GIFs |
Welche KI erzeugt Ton direkt im Clip?
Vier Tools auf dieser Seite können das, und am bekanntesten ist Google Veo. Veo 3.1 und das neuere Gemini Omni Flash erzeugen nativen Ton, also Dialog und Geräusche passend zur Szene. In Omni Flash kommen wählbare und anpassbare Stimmen dazu.
Du schreibst im Prompt einfach mit, was zu hören sein soll: Regen auf dem Dach, eine Tür, ein kurzer Satz einer Figur. Mein Rat: Halte den Dialog kurz. In einem Clip von 4 bis 8 Sekunden hat ein langer Satz keinen Platz.
Kling VIDEO 3.0 liefert nativen Ton und Dialog mit Lippensynchronität, dazu gibt es eine eigene Sound Generation. Deutschen Dialog bringt erst Kling 4.0, vorerst nur im Ultra-Jahresabo, 3.0 spricht Englisch, Chinesisch, Japanisch, Koreanisch und Spanisch.
PixVerse V6 erzeugt Dialog, Soundeffekte und Atmo direkt im Clip, bis 15 Sekunden in 1080p. Einen Soundeffekt-Generator gibt es zusätzlich, und laut Modellseite baut V6 auch Szenen mit mehreren Einstellungen. Gratis bleibt es bei 540P mit Wasserzeichen, erst Standard für ca. 8,79 € im Monat bringt 720P ohne Wasserzeichen. Hailuo AI bietet Veo 3.1 als Fremdmodell an, dort kommen 8 Sekunden mit Ton heraus.
Mein Favorit für Ton aus dem Prompt bleibt Veo, weil die täglichen Gratis-Credits zum Üben reichen.
KI-Video mit Ton erstellen kostenlos: was drin ist
Ohne zu zahlen kommst du erstaunlich weit, solange dich Wasserzeichen und kurze Clips nicht stören. So sieht der Gratis-Umfang für Ton aus:
- Google Veo: 50 Credits pro Tag in Flow, genug für 5 Clips mit Veo 3.1 Lite, jeweils mit Ton.
- PixVerse: 60 Start-Credits und 30 Credits pro Tag, Clips bis 540P mit Wasserzeichen.
- Kling AI: Basic kostet nichts, eine Credit-Menge nennt Kling nicht, und Lip-Sync ist bezahlt.
- Hailuo AI: einmalige Willkommens-Credits, die nach 3 Tagen verfallen.
- HeyGen: 3 Videos pro Monat bis 1 Minute mit KI-Stimmen, schon gratis in über 30 Sprachen.
Überall gilt: Gratis-Videos tragen ein Wasserzeichen, bei Google Veo bleibt es in Flow sogar mit Plus und Pro sichtbar. Bei HeyGen hängt die Zahl der Gratis-Videos laut Hilfe von der Region ab, es können auch nur eines oder zwei sein. Für einen privaten Clip ist das alles egal, für einen Kanal nicht.
Eine Übersicht aller Werkzeuge, vom Generator bis zum Avatar-Studio, findest du auf meiner Startseite zum Thema KI-Video.
Was jede App bietet
| App | Face Swap im VideoFace Swap im Video | Text zu VideoText zu Video | Bild zu VideoBild zu Video | Sprechendes Foto (Lip-Sync)Sprechendes Foto (Lip-Sync) | Gratis ohne WasserzeichenGratis ohne Wasserzeichen | App für iOS/AndroidApp für iOS/Android |
|---|---|---|---|---|---|---|
| Google Veoab 4,99 €/Monat | Nein | Ja | Ja | Eingeschränkt | Nein | Ja |
| Kling AIab 7,73 €/Monat | Ja | Ja | Ja | Ja | Nur in Bezahltarifen | Ja |
| PixVerseab 7,03 €/Monat | Nein | Ja | Ja | Ja | Nur in Bezahltarifen | Ja |
- Ja
- Eingeschränkt oder gegen Aufpreis
- Nein
- Fakten geprüft am
Wie macht man Videos mit KI-Stimme?
Wenn ein Sprecher deinen Text vortragen soll, ist HeyGen auf dieser Seite das Werkzeug der Wahl. Das Prinzip ist einfach: Skript rein, Avatar oder Porträtfoto wählen, Stimme wählen, fertig. HeyGen nennt über 1.000 KI-Stimmen, die Deutsch in den Varianten Deutschland, Österreich und Schweiz unterstützen. Stimmenklonen gibt es ab Creator für 25 € im Monat.
Statt eines Skripts kannst du auch eine eigene Sprachaufnahme als Eingabe nutzen, und der Avatar spricht sie lippensynchron. Lizenzierte Musik und Soundeffekte kommen dazu. Gratis bekommst du 3 Videos pro Monat bis 1 Minute mit Wasserzeichen, Creator exportiert in 1080p ohne Wasserzeichen und erlaubt Videos bis 30 Minuten. Schließ das Abo im Browser ab: Im App Store kostet Creator 35 € statt 25 €.
CapCut ist die günstigere Alternative ohne Avatar im Bild. Die Sprachausgabe hat über 200 KI-Stimmen, laut CapCut auch auf Deutsch, und aus einigen eingesprochenen Sätzen entsteht ein Klon deiner Stimme. Die Stimme legst du im Editor unter deine Clips, dazu Musik aus der Bibliothek. Wer ein KI-Video mit Stimme erstellen will, ohne dass jemand im Bild spricht, ist hier richtig. Für die Avatare nennt CapCut über 150 KI-Voiceovers, laut Hilfe sind Avatare aber eine Pro-Funktion.
Hailuo AI hat über MiniMax Audio ebenfalls Sprachausgabe und Stimmklon. Ein Detail dazu: Stimmklone speichern dort nur Abonnenten. Google Veo erzeugt Stimmen direkt in der Szene, in Omni Flash wählbar und anpassbar. Das passt, wenn eine Figur im Bild spricht, weniger für einen Erzähler aus dem Off.
So würde ich vorgehen, egal mit welchem Tool:
- Skript laut vorlesen, bevor du es eingibst. Was sich holprig spricht, klingt auch bei einer KI holprig.
- Kurze Sätze schreiben, eine Aussage pro Satz.
- Zuerst die Stimme wählen, dann den Avatar, damit beides zusammenpasst.
- Mit einem Gratis-Video die Aussprache von Namen und Fachwörtern prüfen.
- Erst danach das ganze Video erzeugen und dafür Credits ausgeben.
Die eigene Stimme als Klon ist verlockend, aber nur für deine eigene Stimme gedacht. HeyGen verbietet Inhalte, die sich ohne Erlaubnis als jemand anderes ausgeben, und die CapCut-Hilfe sagt klar, dass du Gesicht oder Stimme einer anderen Person nur mit deren Erlaubnis hochladen darfst. Eine fremde Stimme zu klonen, ist also keine Grauzone.
Welche Generatoren Ton und Bild am besten verbinden, und was sie kosten, vergleiche ich in meiner Rangliste der besten KI-Video-Generatoren.
PixVerse auf einen Blick
- Preis ab
- 7,03 €/Monat
- Gratis-Version
- Gratis-Tarif verfügbar
- Plattformen
- Web, iOS, Android
- Gratis ohne Wasserzeichen
- Nur in Bezahltarifen
- Ohne Konto nutzbar
- Nein
- Text zu Video
- Ja
- Bild zu Video
- Ja
- Sprechendes Foto (Lip-Sync)
- Ja
- Betreiber
- AIVORA PTE. LTD.
- Sprachen
- Englisch, Deutsch, Französisch, Indonesisch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch, Chinesisch (vereinfacht), Spanisch, Thai, Türkisch, Vietnamesisch
Wie erstellst du ein KI-Video zu einem Song?
Hier muss ich ehrlich sein: Keines der sechs Tools beschreibt auf den offiziellen Seiten genau, wie aus einem hochgeladenen Song automatisch ein Musikvideo wird. PixVerse nennt Musikvideos als Funktion, Details dazu stehen nicht in meinen Unterlagen. Wer ein KI-Video zu Musik erstellen will, fährt deshalb mit einem Zwei-Schritt-Weg am besten.
Schritt eins sind die Bilder. Erzeuge kurze Clips ohne Dialog, die zur Stimmung des Songs passen, etwa in PixVerse mit den täglichen Gratis-Credits oder in Google Veo. Achte darauf, dass alle Clips dasselbe Format haben, sonst springt das Bild später zwischen Quer- und Hochformat. Soll eine Figur in jedem Clip gleich aussehen, hilft bei Kling AI die Funktion Elements.
Schritt zwei ist der Schnitt. In CapCut legst du deinen Song auf die Zeitleiste und setzt die Clips darauf, bis die Schnitte zum Takt passen. Der Editor ist gratis, der Export bis 1080p auch, solange keine Pro-Materialien im Projekt stecken. Hier bestimmst du den Rhythmus selbst, und das macht den Unterschied zwischen Musikvideo und Diashow. Für 4K und 60 fps brauchst du CapCut Pro.
Google Veo liefert zwar Geräusche und Dialog passend zum Prompt, eine hochgeladene Musikdatei als Vorlage nennt Google aber nicht. HeyGen bietet lizenzierte Musik und Soundeffekte im KI-Studio, das passt eher zu Erklärvideos als zu einem Clip für deinen Song.
Wenn eine Figur zum Text singen oder sprechen soll, kommt Lip-Sync ins Spiel. PixVerse macht aus einem Charakterbild plus Audiodatei einen sprechenden Avatar, Kling AI macht aus einem Bild plus Ton ein sprechendes Video. Ob das mit Gesang so gut klappt wie mit Sprache, beschreiben beide Anbieter nicht, rechne also mit Versuchen.
Ein Wort zu Rechten, das ich bei Musik wichtig finde. Ein KI-Tool macht aus einem geschützten Song keinen freien Song. Nutze eigene Musik, lizenzfreie Titel oder die Bibliotheken der Tools, bei HeyGen etwa lizenzierte Musik. Hailuo AI schreibt in den Bedingungen ausdrücklich, dass du selbst alle Rechte und Einwilligungen einholen musst, auch zu Bild und Stimme von Personen.
Wenn Menschen im Video zu sehen sind, frag sie vorher. In Deutschland schützt das Recht am eigenen Bild nach § 22 KUG jede Person.
Wer das fertige Musikvideo danach schneiden, hochskalieren oder mit Untertiteln versehen will, findet die passenden Werkzeuge in meiner Liste, mit welchen Tools du ein KI-Video bearbeiten kannst.
Google Veo
Dialog und Geräusche direkt im Clip, täglich gratis · 7.4/10, ab 4,99 €/MonatDE Menü ✅jaDE Prompts ✓teilweiseDE Stimme ✓teilweise
Google Veo gratis testen
Wie vertont man ein Video mit KI?
Hast du schon ein fertiges Video und willst nur den Ton ändern, gibt es auf dieser Seite mehrere Werkzeuge, die dafür gebaut sind. HeyGen übersetzt Videos mit Lip-Sync, der Sprecher bewegt die Lippen also passend zur neuen Sprache. Laut Hilfe kostet das 6 bis 10 Credits pro Minute, mit Pro für 42 € im Monat lässt sich das Übersetzungsskript bearbeiten. Für Kurse oder Produktvideos in mehreren Sprachen ist das für mich der stärkste Weg.
CapCut hat einen Video-Übersetzer, eine Sprachausgabe mit über 200 KI-Stimmen und eine Rauschunterdrückung für eigene Aufnahmen. Automatische Untertitel lassen sich in über 27 Sprachen übersetzen, darunter Deutsch. Für ein vorhandenes Video, das nur eine neue Stimme braucht, ist das der einfachste Weg.
Kling AI und Hailuo AI passen die Lippen in einem hochgeladenen Video an eine neue Sprachspur an. Bei Kling ist dieses Lip-Sync-Werkzeug bezahlt und kostet Credits je nach Länge des Videos.
KI-Video aus MP3 erstellen: geht das?
Im Prinzip ja, aber die Anbieter nennen das Dateiformat nicht, sie sprechen von Audiodatei, Tonaufnahme oder Sprachspur. Deshalb bleibe ich hier allgemein. Wer ein KI-Video zu Audio erstellen will, hat vier Wege:
HeyGen nimmt eine eigene Sprachaufnahme als Eingabe, und ein Avatar oder ein Porträtfoto spricht sie lippensynchron. PixVerse macht aus einem Charakterbild und einer Audiodatei einen sprechenden Avatar. Kling AI baut mit dem KI-Avatar aus einem Bild und einer hochgeladenen Tonaufnahme ein sprechendes Video. Und Hailuo AI legt eine Sprachspur per Lip-Sync auf ein vorhandenes Video.
Für einen Podcast-Ausschnitt würde ich HeyGen nehmen, weil deutsche Stimmen und Porträt dort am besten zusammenpassen. Für eine Figur, die nicht wie ein Mensch aussehen muss, PixVerse, weil die täglichen Credits zum Ausprobieren reichen. Prüfe das Format deiner Datei vor dem Hochladen.
Wichtig: Die Stimme in der Datei sollte deine eigene sein oder die einer Person, die zugestimmt hat. Eine fremde Stimme auf ein Gesicht zu legen, ist genau die Art Täuschung, die Google, HeyGen und Kling AI in ihren Regeln verbieten.
Wie du vom ersten Prompt bis zum fertigen Clip vorgehst, inklusive Länge, Auflösung und Credits, erkläre ich Schritt für Schritt in meiner Anleitung, wie du ein KI-Video erstellst.
Was kostet Ton in einem KI-Video?
Ton kostet selten extra, aber er steckt in den Credits, und die rechnet jedes Tool anders. Bei Google Veo ist der Ton im Clip-Preis enthalten, Veo 3.1 Lite kostet 10 Credits pro Clip. Bei Hailuo AI kostet ein Veo-3.1-Clip mit 8 Sekunden und Ton derzeit 120 Credits, regulär 320.
Die 1.000 Credits im Standard-Plan für regulär ca. 13,17 € reichen zum Aktionspreis also für 8 solcher Clips.
Bei HeyGen kostet eine Minute sprechendes Foto mit Avatar IV 16 Credits, als Video-Avatar 31 Credits. Creator bringt 600 Credits für 25 € im Monat, ungenutzte Credits gehen einen Monat mit. Bei Kling AI kostet Lip-Sync Credits je nach Länge, und 4K schlägt mit 30 Credits pro Sekunde zu Buche. PixVerse nennt die Credit-Kosten pro Clip nicht.
Mein Fazit zu den Kosten: Für gelegentliche Clips mit Ton reicht der Gratis-Plan von Google Veo. Wer regelmäßig Sprecher-Videos mit deutscher Stimme braucht, fährt mit HeyGen Creator gut. Und wer nur Musik und Stimme unter eigene Clips legt, kommt mit der Gratis-Version von CapCut aus.
Ein Kostenfaktor wird oft vergessen: misslungene Versuche. Ein Clip, bei dem der Dialog nicht passt oder die Lippen hinterherhinken, kostet genauso viele Credits wie ein gelungener. Immerhin kosten fehlgeschlagene Generierungen bei Google Veo und Hailuo AI nichts. Prüfe Aussprache und Timing trotzdem erst an einem kurzen Stück.
Worauf ich bei Stimme und Musik achten würde
Erstens: Rechte an der Musik. Ein Tool kann keinen geschützten Song freigeben, den du hochlädst. Die Bibliotheken der Tools sind der sichere Weg, bei HeyGen lizenziert, bei CapCut in der Musikbibliothek des Editors.
Zweitens: Rechte an Stimme und Gesicht. Google verbietet in seiner Richtlinie das täuschende Nachahmen einer lebenden oder verstorbenen Person. HeyGen verlangt für einen Avatar mit deinem Gesicht ein Einwilligungsvideo derselben Person. Für eine geklonte Stimme gilt dasselbe Prinzip: nur deine eigene.
Drittens: Was mit deinen Aufnahmen passiert. Bei HeyGen dürfen Eingaben die Modelle trainieren, widersprechen geht nur per E-Mail. Bei Google Veo lässt sich das Training in Flow abschalten. Bei Kling AI umfasst die Lizenz an deinen Inhalten das Training, ein Opt-out ist nicht beschrieben.
Wie ich Datenschutz, Gratis-Umfang und Ergebnisqualität gegeneinander gewichte und woher die Fakten stammen, steht auf der Seite zu meiner Methode.
Häufige Fragen
Kann ich ein KI-Video mit Musik erstellen, kostenlos?
Ja, mit Einschränkungen. Erzeuge die Clips mit den Gratis-Credits von PixVerse oder Google Veo und lege die Musik in der Gratis-Version von CapCut darunter. CapCut exportiert bis 1080p ohne Wasserzeichen, solange keine Pro-Materialien im Projekt sind, die Clips aus den Generatoren tragen gratis aber ein Wasserzeichen. Nutze nur Musik, an der du die Rechte hast.
Wie kann ich ein Foto animieren mit Musik?
Für Bewegung lädst du das Foto als Startbild in PixVerse, Kling AI oder Google Veo und beschreibst, was passieren soll. Die Musik legst du danach in CapCut darunter. Soll die Person auf dem Foto zum Ton die Lippen bewegen, geht das per Lip-Sync bei PixVerse oder mit dem KI-Avatar von Kling AI. Nutze dein eigenes Foto oder eines mit Zustimmung.
Kann ich ein KI-Video zu einem Lied erstellen, das mir gehört?
Ja. Am sichersten erzeugst du passende Clips und schneidest sie in CapCut auf deinen Song. Soll eine Figur zum Lied die Lippen bewegen, nehmen PixVerse eine Audiodatei und Kling AI eine hochgeladene Tonaufnahme an. Ob das mit Gesang so gut klappt wie mit Sprache, nennen die Anbieter nicht. Prüfe das Dateiformat vor dem Hochladen.
Welche KI-Video-Tools sprechen Deutsch?
HeyGen unterstützt deutsche KI-Stimmen in den Varianten Deutschland, Österreich und Schweiz. CapCut hat eine Sprachausgabe mit über 200 KI-Stimmen, laut CapCut auch auf Deutsch. Kling AI erzeugt Dialog im Clip mit Version 3.0 nur auf Englisch, Chinesisch, Japanisch, Koreanisch und Spanisch, deutsche Sprache bringt erst Kling 4.0, vorerst nur im Ultra-Jahresabo. Eine deutsche Oberfläche haben Google Veo, PixVerse, Hailuo AI und CapCut laut ihren Angaben.
Kann ich den Ton eines Videos nachträglich übersetzen?
Ja. HeyGen übersetzt Videos mit Lip-Sync, laut Hilfe für 6 bis 10 Credits pro Minute, und mit Pro für 42 € im Monat lässt sich das Übersetzungsskript bearbeiten. CapCut hat einen Video-Übersetzer und übersetzt automatische Untertitel in über 27 Sprachen, darunter Deutsch. Gratis-Videos tragen bei HeyGen ein Wasserzeichen.
Kann Google Veo Musik erzeugen?
Veo erzeugt nativen Ton mit Dialog und Geräuschen passend zur Szene, und du beschreibst im Prompt, was zu hören sein soll. Einen eigenen Song als Vorlage zu nutzen, beschreibt Google nicht. Für ein Video, das exakt zu deinem Lied passen soll, erzeugst du die Clips ohne Dialog und schneidest sie in CapCut auf die Musik.
