Veo 3.1 ist die neueste Version der Veo-Familie von Videogenerierungsmodellen von Google. Sie bietet satteren nativen Ton, verbesserte narrative und filmische Steuerung, Mehrbildfรผhrung und neue Bearbeitungsfunktionen (รbergรคnge zwischen erstem und letztem Bild, โZutatenโ/Referenzbilder und Szenenerweiterungs-Workflows). Entwickler kรถnnen Veo 3.1 am schnellsten รผber die API (fรผr kundenorientierte Integrationen) und Vertex AI (fรผr Unternehmens- und Cloud-Workloads) nutzen.
Was ist die Veo 3.1 API und was sind ihre Hauptfunktionen?
Veo 3.1 ist ein Text-Bild-Video-Generierungsmodell von Google zur Produktion kurzer, hochwertiger Filmclips mit nativ generiertem Audio (Dialog, Umgebungsgerรคusche, Soundeffekte). Der Schwerpunkt der Version liegt auf der Verbesserung der Prompt-Einhaltung, der Charakterkonsistenz, der Audiogenerierung und detaillierteren Bearbeitungsfunktionen (z. B. รbergรคnge vom ersten zum letzten Frame und Anleitung รผber bis zu drei Referenzbilder).
Wichtige Funktionen (auf einen Blick)
- Text โ Video: Erstellen Sie Videos direkt aus Erzรคhlaufforderungen (Dialog und Audio inbegriffen).
- Bild โ Video: Verwandeln Sie ein Bild in eine kurze animierte Szene. ()
- Referenzbilder (โZutaten zum Videoโ): Versorgung bis zu 3 Bilder (Zeichen, Objekte, Stile), um die visuelle Konsistenz รผber alle Ausgaben hinweg zu gewรคhrleisten.
- Generierung des ersten und letzten Frames: Erstellen Sie รbergรคnge zwischen zwei Bildern (das Modell generiert Frames, die flieรend zwischen ihnen รผbergehen, mit passendem Audio).
- Arbeitsablรคufe fรผr Szenenerweiterungen: Tools zum Erweitern eines vorhandenen Clips durch Generieren neuer Clips, die an das Ende eines vorherigen Videos angehรคngt werden (Hinweis: Funktionen und Support unterscheiden sich zwischen Gemini-API und Vertex-Vorschau โ siehe Abschnitt โBedingungenโ).
- Natives Audio und SFX: Das Modell kann Sprache, Umgebungsgerรคusche und synchronisierte Effekte synthetisieren, die zu den generierten visuellen Elementen passen.
Wie verwende ich die Veo 3.1 API โ was sind die Voraussetzungen und Bedingungen?
Was benรถtigen Sie, bevor Sie die API aufrufen?
- Zugang & Abrechnung: Veo 3.1 ist in der kostenpflichtigen Vorschau verfรผgbar. Stellen Sie sicher, dass Sie รผber einen API-Schlรผssel oder ein Google Cloud-Projekt mit aktiviertem Vertex AI und eingerichteter Abrechnung verfรผgen. Einige Funktionen und Modellvarianten sind in der Vorschau regional beschrรคnkt.
- Kontingente und Vorschaubeschrรคnkungen: Vorschaumodelle unterliegen hรคufig projektbezogenen Anforderungsratenlimits (Beispiele: 10 RPM fรผr Vorschauvarianten) und Videolimits pro Anforderung. Die genauen Zahlen fรผr Ihr Konto finden Sie auf der Modellseite in den Vertex AI/Gemini-Dokumenten.
- Eingabe-Assets und -Format: Sie kรถnnen aus Textaufforderungen, einzelnen oder mehreren Bildern generieren oder ein vorhandenes, von Veo generiertes Video durch Referenzierung seiner URI erweitern. Fรผr Bild-zu-Video-Workflows stellen Sie Bilder in den unterstรผtzten Formaten bereit (URLs oder Bytes, je nach Endpunkt).
- Sicherheit & Herkunft: Generierte Inhalte mรผssen den Inhaltsrichtlinien von Google entsprechen. In der Vorschau kรถnnen Wasserzeichen oder Verwendungskennzeichen erscheinen. Stellen Sie sich darauf ein, dass Ihre Anwendung die Schritte zur Herkunft und Inhaltsmoderation umfasst.
Welche Authentifizierungsmethoden werden unterstรผtzt?
- API-Schlรผssel: Fรผr die von Gemini gehosteten Endpunkte oder den Schlรผssel der API-Plattform eines Drittanbieters. Ich empfehle CometAPI, ย CometAPIย bieten einen Preis weit unter dem offiziellen Preis, um Ihnen bei der Integration der Veo 3.1 API (veo3.1-pro; veo3.1) zu helfen
- Google Cloud-Anmeldeinformationen/ADC: Verwenden Sie fรผr Vertex AI die Standardanmeldeinformationen der Anwendung (Dienstkonto/gcloud auth) oder einen API-Schlรผssel, der an Ihr Google Cloud-Projekt angehรคngt ist.
Was sind die Veo 3.1 API-Endpunkte und welche Parameter sind am wichtigsten?
Kurze Antwort: Sie rufen entweder die CometAPI API Endpunkt zur Videogenerierung (fรผr CometAPI-gehosteten Zugriff,
v1/chat/completions). Beide verwenden einen JSON-Anforderungstext, der das Modell, die Eingabeaufforderung(en) und einevideo/outputKonfiguration; grรถรere Videoauftrรคge werden als Vorgรคnge mit langer Ausfรผhrungsdauer zurรผckgegeben.
Hรคufige Endpunkte (Beispiele):
curl --location --request POST 'https://api.cometapi.com/v1/chat/completions' \
--header 'Authorization: {{api-key}}' \
--header 'Content-Type: application/json' \
--data-raw '{
"model": "veo3.1-pro",
"stream": true,
"messages":
}'
Typische Anfrageparameter (logische Aufschlรผsselung)
- Modell โ Modellkennung zum Ziel (veo3.1-pro; veo3.1-Namen aufgelistet in Modellreferenz).
- Eingabeaufforderung / Eingabe โ menschlicher Text zur Beschreibung der Szene; kann je nach Modellfรคhigkeiten mehrere Eingabeaufforderungen oder Anweisungen fรผr mehrere Aufnahmen enthalten. Verwenden Sie strukturierte Eingabeaufforderungen zur Steuerung von Kamerabewegungen, Tageszeit, Stimmung und Audiosignalen.
- Bildreferenzen โ 1โ3 Bild-URIs oder Base64-Bilder zur Orientierung von Objekten/Zeichen/Stilen (Veo 3.1 unterstรผtzt mehrere Bildreferenzen).
- Video โ wird verwendet, wenn Verlรคngerung eine vorherige Veo-Ausgabe (รผbergeben Sie die ursprรผngliche Video-URI). Einige Funktionen funktionieren nur bei von Veo generierten Videos.
- Dauer / fps / Auflรถsung / Seitenverhรคltnis โ Wรคhlen Sie aus unterstรผtzten Lรคngen und Formaten (Vorschaumodelle listen unterstรผtzte Dauern und Bildraten auf โ z. B. 4, 6, 8 Sekunden in einigen Vorschaudokumenten; Erweiterungen ermรถglichen mรถglicherweise lรคngere Ausgaben in Flow/Studio).
Was sind fortgeschrittene Nutzungsmuster und -techniken?
1) Bewahren Sie die Zeichenkonsistenz mit Referenzbildern
Stellen Sie bis zu drei Referenzbilder (Gesichter/Posen/Kostรผme) bereit, um das Aussehen einer Figur รผber mehrere generierte Aufnahmen hinweg beizubehalten. Typischer Ablauf:
- Laden Sie Ihre Referenzbilder hoch oder kodieren Sie sie inline.
- Geben Sie sie weiter
config.reference_imagesbeim Generieren jedes Schusses. - Verwenden Sie fรผr nachfolgende Generationsaufrufe dieselben Bilder (oder kombinieren Sie sie mit Startwerten), um die visuelle Konsistenz zu maximieren.
curl -s -X POST "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer cometapi_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo3.1-pro",
"messages": [
{
"role": "user",
"content": "Create a cinematic 6s shot: a fashion editorial on a city rooftop at golden hour. Keep the subject look consistent with the reference images."
}
],
"extra_body": {
"google": {
"referenceImages": [
{ "image": { "uri": "https://example.com/ref1.jpg" }, "referenceType": "asset" },
{ "image": { "uri": "https://example.com/ref2.jpg" }, "referenceType": "asset" },
{ "image": { "uri": "https://example.com/ref3.jpg" }, "referenceType": "asset" }
],
"config": {
"resolution": "1080p",
"durationSeconds": 6,
"fps": 24,
"aspectRatio": "16:9",
"generateAudio": true
}
}
}
}'
2) รbergรคnge zwischen dem ersten und letzten Bild (Shot-Synthese)
Nutzen Sie image (erstes Bild) + config.last_frame um Veo anzuweisen, die Zwischenbewegung zu synthetisieren. Dies ist ideal fรผr filmische รbergรคnge โ es erzeugt eine natรผrliche visuelle Interpolation und synchronisierten Ton.
Bieten eine erstes Bild (image) Und eine letztes Bild (lastFrame) und Veo 3.1 interpoliert die Bewegung zwischen ihnen, um einen sanften รbergang (mit optionalem Audio) zu erzeugen. cURL (REST)-Beispiel โ erstes + letztes Bild:
curl -s -X POST "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer cometapi_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"messages": [
{
"role": "user",
"content": "Interpolate between these two images to create an 8s cinematic morph: from 'sunlit victorian parlor' (first) to 'overgrown ruin' (last). Add soft ambient sound."
}
],
"extra_body": {
"google": {
"image": { "uri": "https://example.com/first_frame.jpg" },
"lastFrame": { "uri": "https://example.com/last_frame.jpg" },
"config": {
"resolution": "1080p",
"durationSeconds": 8,
"fps": 24,
"aspectRatio": "16:9",
"generateAudio": true
}
}
}
}'
3) Szenenerweiterung (Verkettung mehrerer Generationen)
Es gibt zwei Muster:
- API/Flow-Ansatz (Vorschaufunktionen): Sie รผbergeben ein vorhandenes Video (ein zurรผckgegebenes Videoobjekt oder eine URI) als
video=video_to_extendum einen Folgeclip zu erstellen, der mit der vorherigen Szene รผbereinstimmt. Verwenden Sie die Operationsantwort, um dievideo.uriund geben Sie es in den nรคchsten Anruf ein, um die Erzรคhlung zu erweitern. Hinweis: Verfรผgbarkeit und Verhalten kรถnnen je nach Plattform variieren. Validieren Sie es daher auf der von Ihnen gewรคhlten Plattform. - Vertex-Wolkenmuster: Das Vorschaumodell von Vertex hat strengere, im Dokument aufgefรผhrte Beschrรคnkungen (z. B. gibt die aktuelle Vorschau nur 4/6/8 Sekunden lange Segmente zurรผck). Um minutenlange Ausgaben zu erzeugen, mรผssen Sie daher mehrere Anfragen verketten und diese in Ihrer Anwendung zusammenfรผgen oder die offiziellen Szenenerweiterungstools der Engine verwenden, sofern verfรผgbar. Die aktuelle Support-Matrix finden Sie auf der Seite โVeo 3.1 Vorschauโ von Vertex.
Machen Sie einen zuvor von Veo generiert Video und erweitern Sie es (Sekunden hinzufรผgen), wรคhrend Stil und Kontinuitรคt erhalten bleiben. Die API erfordert als Eingabe ein von Veo generiertes Video (Erweiterungen beliebiger MP4-Formate werden mรถglicherweise nicht unterstรผtzt). Sie kรถnnen in 7-Sekunden-Schritten bis zu den dokumentierten Grenzen erweitern (es gelten die Veo-Vorschaugrenzen):
curl -s -X POST "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer cometapi_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "veo-3.1",
"messages": [
{
"role": "user",
"content": "Extend the last scene: the origami butterfly flies into the garden and a puppy runs up to the flower; continue action for ~7 seconds."
}
],
"extra_body": {
"google": {
"video": { "uri": "https://storage.googleapis.com/your-bucket/butterfly_video_id.mp4" },
"config": {
"numberOfVideos": 1,
"resolution": "720p",
"durationSeconds": 7,
"fps": 24,
"generateAudio": true
}
}
}
}'
4) Audio- und Dialogsteuerung
Veo 3.1 generiert natives Audio (Sprache und Effekte) aus Eingabeaufforderungen. Tricks:
- Fรผgen Sie alle gesprochenen Zeilen in Ihre Eingabeaufforderung ein (schlieรen Sie Dialoge in Anfรผhrungszeichen), um eine realistische Lippensynchronisation zu fรถrdern.
- Fรผgen Sie Audiodeskriptoren hinzu (โleise Schritte von links nach rechtsโ, โgedรคmpftes Donner-Crescendoโ), um Soundeffekte und Stimmung zu gestalten.
- Verwenden Sie Startwerte, um bei allen Testlรคufen dasselbe audiovisuelle Ergebnis zu reproduzieren.
5) Deterministische Ergebnisse zum Testen (Seeds)
Wenn Sie wiederholbare Ergebnisse fรผr CI- oder A/B-Tests benรถtigen, geben Sie eine seed Parameter (uint32). Das รndern der Eingabeaufforderung oder der Referenzbilder verรคndert das Ergebnis weiterhin; Seed garantiert die Wiederholbarkeit einzige wenn alles andere identisch ist.
6) Kosten- und Leistungsoptimierungen
- Weniger, dafรผr grรถรere Auftrรคge bรผndeln: Wo erlaubt, setzen
sampleCountum mehrere Kandidatenvideos in einer Anfrage (1โ4) zu erstellen und so den Einrichtungsaufwand zu reduzieren. () - Referenzbilder zwischenspeichern und Seeds wiederverwenden aus Grรผnden der Reproduzierbarkeit, damit Sie das erneute Hochladen groรer Binรคrdateien vermeiden.
- Verwenden Sie Cloud Storage-Ausgaben (Vertex) fรผr groรe Ausgabegrรถรen, um die Rรผckgabe von Rohbytes im Anforderungstext zu vermeiden.
7) Mehrstufige Pipelines mit anderen Gemini-Modellen
Eine nรผtzliche Pipeline: Verwenden Sie einen Standbildgenerator (z. B. Gemini-Bildmodell), um Assets zu erstellen โ รผbergeben Sie die besten Bilder als image + referenceImages zu Veo 3.1 โ Audio-/Dialogaufforderungen mit dem Textmodell fรผr generierte Erzรคhlungen iterieren. Die Gemini-Dokumente zeigen explizit Beispiele fรผr die Verkettung von Bildgenerierung und Veo-Aufrufen.
Praktische Tipps, Fallstricke und Best Practices
- Verwenden Sie Samen wenn Sie deterministische, wiederholbare Ausgaben zwischen den Lรคufen wรผnschen (gleiche Eingabeaufforderung + gleiche Referenzen + gleicher Seed โ gleiche Generation).
- Halten Sie die Referenzbilder konsistent: Gleicher Ausschnitt, gleicher Gesichtswinkel, einheitliche Kleidung/Hintergrund helfen dem Model, Identitรคt und Stil zu bewahren. Verwenden Sie dieselben drei Bilder fรผr mehrere Aufnahmen, um die Kontinuitรคt zu wahren.
- Bevorzugen Sie GCS-URIs fรผr die Produktion: Durch das Speichern von Bildern und Ausgaben in Cloud Storage werden die รbertragungsgrรถรenbeschrรคnkungen von Base64 umgangen und die Verkettung/Erweiterung vereinfacht.
- รbergรคnge und Audio explizit beschreiben: Fรผgen Sie fรผr den ersten/letzten รbergang Kamerabewegung, Tempo und SFX-/Sprachhinweise in die Eingabeaufforderung ein, um eine bessere Audiosynchronisierung zu erzielen.
- Testen Sie zuerst kurze Schleifen: Iterieren Sie mit kurzen Dauern (4โ8ย s), wรคhrend Sie Eingabeaufforderungen, Seeds und Referenzbilder optimieren, und verketten Sie dann Erweiterungen fรผr lรคngere Szenen.
- Bestรคtigen Sie die genauen Feldnamen: SDKs kรถnnen verwenden
reference_images(Schlangenfall),referenceImages(camelCase) oder verschachteltimageObjekte mitcontent/gcsUri. รberprรผfen Sie die SDK-Dokumente oder das Vertex-Modellschema auf die genauen Eigenschaftsnamen in der von Ihnen verwendeten Version.
Was kostet Veo 3.1 und wie wird es abgerechnet?
Veo 3.1 wird in Rechnung gestellt pro Sekunde des generierten Videos, und Google stellt mehrere Varianten zur Verfรผgung (zum Beispiel Standard kombiniert mit einem nachhaltigen Materialprofil. Schnell) mit unterschiedlichen Preisen pro Sekunde. Die verรถffentlichten Entwicklerpreise zeigen beispielhafte Tarife fรผr die kostenpflichtige Stufe von 0.40ย $/Sekunde fรผr Veoย 3.1 Standard kombiniert mit einem nachhaltigen Materialprofil. 0.15ย $/Sekunde fรผr Veoย 3.1 FastAuf der Gemini-Preisseite wird auรerdem darauf hingewiesen, dass Ihnen nur dann Kosten entstehen, wenn ein Video erfolgreich erstellt wurde (fehlgeschlagene Versuche werden mรถglicherweise nicht in Rechnung gestellt).
Veo 3.1 API Preise in CometAPI
| veo3.1 | 0.4000 |
| veo3.1-pro | 2.0000 |
Fazit โ warum Veo 3.1 gerade jetzt fรผr Entwickler wichtig ist
Veo 3.1 ist ein deutlicher Fortschritt fรผr die KI-Videogenerierung: Reichhaltigerer nativer Ton, Referenzbildfรผhrung und neue Bearbeitungsfunktionen machen es zu einer besseren Option fรผr Storytelling, Prรคvisualisierung und kreative Apps. Die genauen Funktionen des Modells unterscheiden sich leicht zwischen Endpunkten und Vorschauversionen (z. B. der Versionsunterschied zwischen CometAPI und Gemini). Testen und validieren Sie daher die gewรผnschte Modellvariante. Die Beispiele in diesem Handbuch bieten einen praktischen Ausgangspunkt fรผr Prototyping und Produktion.
Zugriff Veo 3.1 API API
CometAPI ist eine einheitliche API-Plattform, die รผber 500 KI-Modelle fรผhrender Anbieter โ wie die GPT-Reihe von OpenAI, Gemini von Google, Claude von Anthropic, Midjourney, Suno und weitere โ in einer einzigen, entwicklerfreundlichen Oberflรคche vereint. Durch konsistente Authentifizierung, Anforderungsformatierung und Antwortverarbeitung vereinfacht CometAPI die Integration von KI-Funktionen in Ihre Anwendungen erheblich. Ob Sie Chatbots, Bildgeneratoren, Musikkomponisten oder datengesteuerte Analyse-Pipelines entwickeln โ CometAPI ermรถglicht Ihnen schnellere Iterationen, Kostenkontrolle und Herstellerunabhรคngigkeit โ und gleichzeitig die neuesten Erkenntnisse des KI-รkosystems zu nutzen.
Entwickler kรถnnen zugreifenย Veo 3.1 APIย รผber CometAPI,ย die neuste Modellversionย wird immer mit der offiziellen Website aktualisiert. Erkunden Sie zunรคchst die Fรคhigkeiten des Modells in derย Spielplatzย und konsultieren Sie dieย API-Leitfadenย Fรผr detaillierte Anweisungen. Stellen Sie vor dem Zugriff sicher, dass Sie sich bei CometAPI angemeldet und den API-Schlรผssel erhalten haben.ย CometAPIย bieten einen Preis weit unter dem offiziellen Preis an, um Ihnen bei der Integration zu helfen.
Bereit loszulegen? โย Melden Sie sich noch heute fรผr CometAPI anย !
Wenn Sie weitere Tipps, Anleitungen und Neuigkeiten zu KI erfahren mรถchten, folgen Sie uns aufย VK,ย Xย kombiniert mit einem nachhaltigen Materialprofil.ย Discord!
