Veo 3 ist das Videogenerierungsmodell von Google DeepMind, vorgestellt im Mai 2025: Du beschreibst die Szene und es generiert einen Clip von acht Sekunden mit synchronisiertem Ton darin, Dialoge eingeschlossen. Benutzt wird es in der Gemini-App, wo es auch gratis gibt, mit Tageslimits, in Flow (dem Tool von Google für KI-Video) und über die APIs. Es ist die Engine, die dem Prompt von den fünf großen mit der größten Präzision folgt: Du bittest um eine laterale Kamerafahrt mit Regen im Gegenlicht und bekommst genau diese Szene, nicht eine Cousine von ihr. Hier findest du, wie du anfängst, was es wirklich kostet, die Unterschiede zwischen Veo 2, 3 und 3.1 und die Grenzen, die niemand schreibt.
In meiner wöchentlichen Arbeit sind die Clips von Veo 3 die Einstellungen, die am häufigsten beim ersten Wurf gelingen. Nicht weil es magisch ist: sondern weil es die Engine ist, die dem Satz, den du schreibst, am treuesten ist. Die anderen schenken dir schöne Varianten der Szene, die du gebeten hast; Veo macht dir dazu die Szene, die du gebeten hast. Wenn du Videos für Kunden machst, wo das Brief nicht verhandelbar ist, ist dieser Unterschied alles.
Diese Anleitung ist der Zoom auf Veo 3: Die komplette Karte der fünf Engines, mit wer wo gewinnt, steht in der großen Anleitung Videos mit KI erstellen.
Die anderen Modelle geben dir eine Szene, die der ähnelt, die du gebeten hast. Veo gibt dir genau diese Szene: Das ist der Grund, warum es in meine Projekte kommt, wenn das Brief geschrieben ist.
Was Veo 3 ist (und woher es kommt)
Veo 3 ist ein Text-to-Video-Modell von Google DeepMind: Du gibst ihm eine Beschreibung oder ein Startbild, und es gibt einen Clip von acht Sekunden zurück, mit Kamera, Bewegung und Ton, zusammen generiert. Der Ton ist die Wendung, die es von der vorherigen Generation unterschieden hat: Regen, der sein Geräusch hat, Schritte, die dem Schritt folgen, Figuren, die mit synchronen Lippen sprechen.
Die Geschichte in drei Zügen hilft bei der Orientierung, weil man über Veo noch alles findet und durcheinanderkommt:
- Veo 2 ist die vorherige Generation: Clips ohne Ton, niedrigere Auflösung, weniger Kontrolle über die Kamera. Es kommt noch als "schnelle" Option vor: Zum Ausprobieren geht es, zum Produzieren ist es ein anderes Handwerk.
- Veo 3, vorgestellt im Mai 2025, hat den synchronisierten Ton gebracht und die Qualität, die den Vergleich mit der Kinematografie aushält. Es ist der Moment, in dem das KI-Video aufgehört hat, stumm zu sein.
- Veo 3.1, die aktuelle Version, hat die Kontinuität hinzugefügt: die Möglichkeit, vom letzten Frame aus neu zu starten, um die Szene zu verlängern, und die Referenzen, um dieselbe Figur und dieselben Objekte über verschiedene Clips hinweg zu halten.
Wenn jemand heute "Veo 2" sucht, will er fast immer wissen, ob sich der Sprung zur 3 lohnt: Er lohnt sich, und der Ton ist Grund Nummer eins.
Veo 3 gratis: wo man es wirklich probiert
Die Frage, die mich am häufigsten erreicht, ist, ob man Veo 3 gratis benutzen kann. Ja, mit genauen Grenzen:
- In Gemini, Gratis-Plan: Du kannst einige Videos pro Tag mit der Fast-Version von Veo generieren, in reduzierter Auflösung und mit Wasserzeichen. Die genaue Zahl ist nicht offiziell angegeben und schwankt: In meinen Wochen liegt sie bei ungefähr drei pro Tag. Sie genügen, um zu verstehen, ob das Tool das richtige für dich ist.
- In Flow: Das Video-Tool von Google Labs startet mit Test-Credits, die schnell verbraucht sind. Flow ist schön, um Szenen zu bauen, nicht um gratis zu produzieren.
- Die ernsthaften kostenlosen Wege, alle zusammen, stehen in der eigenen Anleitung: KI-Videos kostenlos erstellen, wo Veo eine Stimme im kompletten Bild ist.
Meine Ehrlichkeit aus der Produktion: Das Gratis von Veo dient dazu, Prompts schreiben zu lernen, nicht um Arbeit zu machen. Wenn du ein Projekt mit Deadline hast, stoppen dich die Tageslimits auf halbem Weg, und auf halbem Weg stehen zu bleiben ist die schlechteste Art, ein Tool kennenzulernen.
So benutzt du es: der erste Clip in fünf Schritten
Der Pfad, den ich jemandem mitgeben würde, der heute startet, ausprobiert auf dem Gratis-Plan von Gemini:
- Öffne Gemini (App oder Web) und bitte in natürlicher Sprache um ein Video: "generiere ein Video von...". Befehle muss man nicht kennen: Veo liest den Satz.
- Schreibe die Szene mit den fünf Elementen: Subjekt, Aktion, Kamera, Licht, Ton, in dieser Reihenfolge und in einem einzigen Satz. Weiter unten lasse ich dir ein Beispiel, das ich wirklich benutze.
- Sieh an, was herauskommt, und iteriere am falschen Teil. Die Kamera streunt? Deklariere sie neu. Das Licht ist flach? Nenne die Lichtquelle. Generiere nicht blind neu: Jeder Versuch hat Kosten, auch wenn er gratis ist, weil die Zeit das erste Budget ist.
- Wenn der Clip trägt, gib ihn in Flow, wenn die Szene weitergehen soll: Dort kannst du vom letzten Frame aus verlängern und die Zutaten halten, also die Referenzen von Figur und Objekten, die die folgenden Clips kohärent machen.
- Schneide außerhalb. Acht Sekunden sind eine Einstellung, kein Video: Schnitte, Rhythmus und finaler Ton werden im Schnitt entschieden. Kein Modell gibt dir das.
Auf Veo zahlt sich das Schreiben mehr aus als anderswo, weil das Modell ausführt. Die Struktur, die ich benutze, mit einem Beispiel, das für einen ersten Versuch taugt:
A woman in a beige trench coat walks alone through a night market, camera tracks laterally at walking pace, warm string lights and steam from food stalls, ambient chatter and her footsteps.
Subjekt (wer da ist), Aktion (nur eine), Kamera (deklariert), Licht (die Quelle genannt), Ton (das Geräusch gebeten). Veo nimmt jeden Teil ernst: Wenn du die Kamera deklarierst, macht die Kamera genau das; wenn du das Licht nennst, kommt das Licht von dort. Die vollständigen Regeln, einschließlich der Fallen wie das "keine Menschen im Hintergrund", das Menschen im Hintergrund erscheinen lässt, stehen im Prompt-Abschnitt der großen Anleitung.
Veo 2, Veo 3, Veo 3.1: was sich in der Praxis ändert
| Veo 2 | Veo 3 | Veo 3.1 | |
|---|---|---|---|
| Ton | nein, stumm | ja, synchronisiert, Dialoge eingeschlossen | ja, verbessert |
| Dauer des Clips | kurze Clips | 8 Sekunden | 8 Sekunden, vom letzten Frame aus verlängerbar |
| Kohärenz | begrenzt | gut auf dem einzelnen Clip | Referenzen für Figur und Objekte zwischen Clips |
| Wo man es findet | als schnelle Option in einigen Tools | Gemini, Flow, API | Gemini, Flow, API: es ist die aktuelle Version |
| Wann man es wählt | nie, wenn du die 3 in Reichweite hast | geschriebene Szene, die genau so herauskommen muss | Projekte mit wiederkehrender Figur |
Was Veo 3 kostet
Drei Wege, drei Preislogiken. Zahlen verifiziert im August 2026: Die Branche bewegt sich jeden Monat, nimm sie also als Momentaufnahme und prüfe die offiziellen Seiten, bevor du entscheidest.
| Weg | Was du zahlst | Wann es Sinn ergibt |
|---|---|---|
| Gemini Gratis-Plan | 0: einige Generierungen pro Tag mit Veo Fast, reduzierte Auflösung, Wasserzeichen | Schreiben lernen, die Szenen probieren |
| Google-KI-Pläne | das Monatsabo schaltet mehr Generierungen frei, höhere Qualität und Flow mit mehr Credits | Jede Woche produzieren |
| Gemini-API | pro Clip: rund 0,40 $ in 720-1080p, 0,60 $ in 4K | Produkte und automatische Workflows bauen |
Wo Veo stolpert (und wie man es umgeht)
Ich benutze Veo jede Woche und empfehle es, also kommen die echten Nachteile dran:
- Acht Sekunden pro Clip. Das ist das Format der Einstellung, nicht des Videos: Man verlängert in Flow oder montiert. Wer von "mach mir ein Video von einer Minute" kommt, muss die Erwartung neu kalibrieren: Eine Minute sind acht Clips, also acht geschriebene Szenen.
- Die Sicherheitsfilter. Bekannte Gesichter, echte Personen, sensible Inhalte: Veo filtert stark. In der Arbeit für Marken ist das fast immer ein Vorteil, aber wisse es, bevor du den Prompt mit eurer Botschafterin drin schreibst.
- Der Text im Video. Wie bei allen: Die Schriften kommen schief heraus. Texte werden im Schnitt gesetzt, immer.
- Die Lippensynchronisation auf Italienisch. Dem Englisch folgt es gut, dem Italienischen weniger: Für italienische Dialoge kommt die Stimme in die Postproduktion.
- Das unsichtbare Wasserzeichen. Die Videos von Veo tragen SynthID in sich, die unsichtbare Signatur von Google, die die KI-Herkunft erklärt. Man sieht sie nicht, man entfernt sie nicht, und die sozialen Netzwerke erkennen sie: Die Herkunft muss deklariert werden, immer.
Wann ich Veo wähle, und wann nicht
In meiner Art, die Szenen unter den Engines aufzuteilen, bekommt Veo die Einstellungen, in denen sich Präzision auszahlt: Die Szene steht schon, der Kunde hat die Referenz freigegeben, sie muss genau so herauskommen. Wenn die Szene anderes verlangt, wechsle ich die Engine:
- Menschen, die gehen, Gesten, Physik der Körper: Kling bewegt sie besser;
- Szenen mit mehreren Aktionen in Folge, lange Clips: Seedance merkt sich alle;
- Ganze Projekte mit Kamera, Kohärenz und Verlängerungen, die zusammen zu verwalten sind: Ich gehe über die Regie-Plattform, Higgsfield, wo die Engines mit den Werkzeugen drumherum leben.
Und wenn du das Video für deine Marke brauchst und lieber jemanden hast, der es jeden Tag macht: Das ist mein Handwerk. Schreib mir und wir starten mit einer Idee.
Die Anleitungen des Videopfads
- Videos mit KI erstellen, die Karte aller Tools (der Pillar dieser Anleitung);
- Higgsfield, die Regie-Plattform, in der die Engines arbeiten;
- Seedance, die Engine der langen Szenen;
- Kling AI, der Realist, und die beste kostenlose Schule;
- Sora 2, der Storyboard-Pionier, heute mit der Konkurrenz im Nacken;
- KI-Videos kostenlos erstellen, alle Wege ohne Kosten.
Quellen
- Google DeepMind, offizielle Modellseite: deepmind.google/models/veo
- Gemini, wo Veo auch gratis lebt: gemini.google.com
- Flow, das Video-Tool von Google Labs: labs.google/flow
- Gemini-API, Preise pro Videogenerierung: ai.google.dev
- Limits des Gratis-Plans und Verhalten des Modells: in der App im August 2026 verifiziert, dieselbe Prüfung wie in der großen Anleitung
Für Updates und Neuigkeiten gibt es meinen Telegram-Kanal
Die letzten News zu den KI-Video-Tools veröffentliche ich zuerst dort.
Hinterlasse einen Kommentar
Kommentare werden vor der Veröffentlichung gelesen und freigegeben.