Grok Imagine hat in den 30 Tagen vor seinem 1.0-Release Anfang Februar 2026 genau 1,245 Milliarden Videos generiert. Dieses Release brachte 720p, 10-Sekunden-Clips und deutlich besseres natives Audio. Mit OpenAIs Sora 2, das zum 24. September 2026 abgeschaltet wird, steht Grok Imagine nun neben Google Veo 3.1 und Kling 3.0 als dominierende Video-API der Zukunft, und es ist die günstigste der drei.

Wie schneidet Groks Chatbot im Vergleich zu ChatGPT für alltägliche Aufgaben ab? Schau dir unseren ausführlichen Grok vs. ChatGPT-Vergleich an.

Was einen brauchbaren Grok-Imagine-Clip von einem verschwendeten Credit unterscheidet, ist fast immer der Prompt. Dieser Leitfaden ist das praktische Prompt-Handbuch für die Grok-Imagine-Videogenerierung: die Formel für saubere Ergebnisse, 20 einfügebereite Beispiele für die relevantesten Anwendungsfälle, die Anti-Patterns, die Generierungen ruinieren, die xAI-API-Specs und Kosten pro Clip sowie was zu tun ist, wenn ein Clip unscharf oder abgelehnt zurückkommt.

Das Wichtigste in Kürze

  • Grok Imagine generiert Clips von 1 bis 15 Sekunden in 480p oder 720p mit nativem Audio (Musik, SFX, Dialog, Lippensync) über die grok-imagine-video-API.
  • Die xAI-API berechnet $0.05 pro Sekunde, also rund $4.20 pro Minute. Ein 6-Sekunden-Clip kostet $0.30, ein 15-Sekunden-Clip $0.75, natives Audio inklusive.
  • Die Prompt-Formel, die in 90 % der Fälle funktioniert: [Motiv] + [Aktion] + [Umgebung] + [Stil] + [Kamera und Licht].
  • Ein Motiv, eine Aktion, eine Kamerabewegung pro Prompt. Mehrere konkurrierende Anweisungen teilen die Aufmerksamkeit des Modells und erzeugen visuelles Chaos.
  • Drei Fehlertypen verursachen fast jeden schlechten Clip: Prompt-Überlastung, Ablehnungen wegen Content-Richtlinien und das harte 15-Sekunden-Limit.

Grok Imagine Video-Specs auf einen Blick

Vom Herausgeber

Jedes KI-Modell in einer App

Fello AI vereint GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 und mehr in einer nativen App für Mac und iPhone.

Jetzt herunterladen!

Das gibt das Modell stand Mai 2026 tatsächlich aus.

SpecConsumer-UIxAI-API
Dauer6 s (kostenlos, Lite), 10 s (SuperGrok und höher)1–15 Sekunden, Bearbeitungsmodus auf 8,7 s begrenzt
Auflösung720p (Standard in bezahlten Tarifen), 480p (Lite)480p (Standard) oder 720p
Seitenverhältnisse1:1, 16:9, 9:16, 4:31:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3
Framerate24 fps24 fps
AudioNativ, automatischNativ, automatisch
Variationen pro Prompt4Konfigurierbar
GeschwindigkeitRund 17 Sekunden pro ClipBis zu einigen Minuten für 15 s in 720p

Die xAI-Dokumentation gibt den Bereich 1–15 Sekunden und die beiden Auflösungsstufen explizit an. Manche Drittanbieter-Blogs behaupten 1080p-Output, doch das steht zum Zeitpunkt dieses Artikels nicht im offiziellen xAI-Spec-Sheet. 720p ist die tatsächliche Obergrenze.

Die Prompt-Formel für saubere Clips

Die meisten enttäuschenden Grok-Imagine-Clips gehen auf vage Prompts zurück, nicht auf das Modell selbst. Die Struktur, die konstant saubere Ergebnisse liefert, lautet [Motiv] + [Aktion] + [Umgebung] + [Stil] + [Kamera und Licht]. Jeder Slot hat eine bestimmte Funktion, und wenn einer fehlt, wirkt ein Clip in der Regel generisch. Dieselbe Slot-Logik gilt auch für Text- und Bildmodelle, und unser vollständiger KI-Prompt-Leitfaden behandelt die allgemeine Formel.

Motiv ist die eine Einheit, auf der die Kamera liegt, also eine Person, ein Fahrzeug, ein Objekt oder ein Tier. Widerstehe dem Drang, zwei Motive in einem Prompt zu beschreiben. Wenn du zwei brauchst, platziere eines im Vordergrund und das andere in der Umgebung.

Aktion ist das Verb. Was macht das Motiv? Gehen, laufen, Kaffee einschenken, hochschauen, sich zur Kamera drehen. Die Aktion treibt die Bewegung über alle 24 Bilder pro Sekunde an. Schwache Verben erzeugen statisch wirkende Ergebnisse.

Umgebung ist der Ort des Geschehens. Eine Wüstenschlucht, ein Cyberpunk-Café, ein schneebedeckter Kamm, eine Küche im Morgengrauen. Die Umgebung verankert das Licht und die Farbpalette und teilt dem Modell mit, welche Atmosphäre zu rendern ist.

Stil ist das visuelle Register. Kinematisch, fotorealistisch, Anime, Knetmasse, Aquarell, Food-Werbung. Stil-Wörter sagen dem Modell, auf welchen Teil seiner Trainingsdaten es sich stützen soll. Ohne sie bekommst du einen generisch wirkenden Clip.

Kamera und Licht ist die Cinematografie. Totale, Nahaufnahme, langsamer Push-In, Tracking-Shot, Drohnen-Rückwärtsbewegung, kombiniert mit einem Licht-Hinweis wie „goldene Stunde", „Neon-beleuchtet" oder „weiches Morgenlicht". Das ist der Unterschied zwischen einem flachen Clip und einem, der sich absichtsvoll anfühlt.

Ein funktionierendes Beispiel, das jeden Slot nutzt: „Ein stark modifizierter orangefarbener Offroad-Buggy rast mit hoher Geschwindigkeit durch eine Wüstenschlucht auf die Kamera zu und wirbelt eine riesige Staubwolke auf, kinematische Totale, goldene Stunde, fotorealistisch." Dieser Satz benennt das Motiv (modifizierter Buggy), die Aktion (auf die Kamera zurasen), die Umgebung (Wüstenschlucht), den Stil (kinematisch, fotorealistisch) und Kamera und Licht (Totale, goldene Stunde). Das Modell hat null Mehrdeutigkeit darüber, was es rendern oder wie es beleuchten soll, weshalb der Clip in etwa 17 Sekunden landet.

20 einfügebereite Prompts nach Anwendungsfall

Die Formel passt sich verschiedenen Genres an. Hier sind 20 einfügebereite Prompts, gruppiert nach dem, was du tatsächlich erstellen möchtest. Jeder füllt alle Slots der Formel aus und enthält ein Seitenverhältnis, damit du ihn direkt in Grok Imagine einfügen und von dort aus anpassen kannst.

Action und Kinetik

„Ein Surfer schneidet bei Sonnenuntergang eine türkisfarbene Welle, das Brett zieht eine saubere Gischtspur, Drohnen-Tracking-Shot aus niedrigem Winkel, kinematisch, 16:9."

„Ein Motocross-Fahrer springt von einem Schmutz-Sprungbrett, Drehung in der Luft, Staub wirbelt unter dem Motorrad auf, Aufnahme von unten, Fischauge, fotorealistisch, 16:9."

„Ein Parkour-Läufer springt bei goldener Stunde zwischen Dächern, Hände greifen die Kante, breiter kinematischer Shot, der seitlich trackt, 16:9."

„Ein Pferd galoppiert im Morgengrauen über ein nebeliges Feld, Hufe werfen nasse Erde auf, Zeitlupe, kinematisch, 16:9."

Kinematisch und narrativ

„Ein verwitterter Seemann umklammert in der Abenddämmerung das Steuerrad, Salzgischt hängt in seinem Bart, Wellen brechen gegen schroffe Klippen, dokumentarisches Gefühl, natürliches Licht, 16:9."

„Ein Detektiv tritt in eine regengetränkte Gasse, Neon-Reflexionen in Pfützen, langsamer Push-In, Noir-Stil, geringe Schärfentiefe, 16:9."

„Ein Astronaut geht über eine rote Marsebene, Helm reflektiert die Morgensonne, breiter Tracking-Shot, fotorealistisch, 16:9."

„Zwei Fremde tauschen einen Blick auf einem belebten Bahnhof aus, warmes weiches Licht, kinematischer mittlerer Shot, 16:9."

Produkt und Werbung

„Langsamer Push-In auf eine dampfende Kaffeetasse auf einer Marmorplatte, warmes Morgenlicht aus einem Küchenfenster, geringe Schärfentiefe, Food-Werbung-Stil, 1:1."

„Ein Paar schlanker kabelloser Kopfhörer rotiert langsam auf einer glänzenden schwarzen Fläche, kühles Studio-Licht, Produkt-Werbung-Stil, 1:1."

„Eine Parfümflasche fängt einen Strahl goldenen Lichts ein, Tropfen gleiten das Glas hinunter, Makro-Shot, Luxus-Werbung-Stil, 9:16."

„Auspacken eines neuen Laufschuhs, Hände heben den Deckel, weiches Top-Down-Licht, Social-Commerce-Stil, 9:16."

Social, Memes und Persönlichkeit

„Ein Golden Retriever mit Aviator-Sonnenbrille fährt in einem Cabrio den Pacific Coast Highway entlang, Zunge heraus, Sommer-Feeling, kinematisch aber verspielt, 9:16."

„Ein Roboter-Barista gießt Latte-Art in ein Glasgefäß, Dampf kräuselt sich nach oben, Neon-beleuchtetes Cyberpunk-Café im Hintergrund, Anime-Stil, mittlere Nahaufnahme, 9:16."

„Ein Pinguin im winzigen Smoking stepptanzt auf einer Eisscholle, Schnee treibt, komödiantischer Ton, handgezeichneter Animationsstil, 1:1."

„Eine Großmutter strickt mit Blitzgeschwindigkeit, Wolle fliegt durch die Luft, unordentlicher Küchenhintergrund, übertriebene Bewegung, leicht komödiantischer Ton, 16:9."

Anime und stilisiert

„Eine junge Schwertkämpferin steht auf einem Klippenvorsprung und trotzt einem Sturm, Haare peitschen im Wind, Blitze hinter ihr, Studio-Ghibli-inspirierter Anime-Stil, breiter Shot, 16:9."

„Ein einsamer Wolf geht nachts durch einen Wald aus leuchtenden Pilzen, ätherische Stimmung, malerischer Stil, langsamer Seiten-Tracking-Shot, 16:9."

„Eine schwebende Stadt in den Wolken, Luftschiffe treiben zwischen Türmen, goldene Stunde, Anime-kinematischer Stil, breiter Establishing Shot, 16:9."

„Ein Roboterkind bewässert eine einzelne Blume auf einem kargen Planeten, Sandstürme in der Ferne, melancholische Stimmung, Aquarell-Stil, 1:1."

Prompts für Bild-zu-Video-Animationen

Wenn du von einem vorhandenen Bild ausgehst, sollte der Prompt nur die Bewegung beschreiben. Die Optik ist bereits im Ausgangsbild festgelegt, und neue Elemente anzufragen, die nicht im Quellbild vorhanden sind, ist der schnellste Weg zu einem holprigen Ergebnis. Halte Bild-zu-Video-Prompts auf ein oder zwei Sätze beschränkt und setze auf starke Aktionsverben.

Drei Muster, die konstant funktionieren:

„Die Kamera schiebt sich langsam auf das Gesicht des Motivs zu, Haare heben sich sanft in einer Brise."

„Motiv blinzelt zweimal, lächelt dann sanft; warmes Licht verschiebt sich von links nach rechts über die Szene."

„Regen fällt gleichmäßig im Hintergrund, Neon-Schilder flackern, keine Kamerabewegung."

Je kürzer der Prompt, desto besser. Ist das Ausgangsbild ein Portrait, frage nach einer einzelnen Gesichtsaktion und einer kleinen Kamerabewegung. Bei einem breiten Umgebungsshot frage nach atmosphärischer Bewegung (Wind, Regen, Staub, fallende Blätter) und lass die Kamera stillstehen.

Anti-Patterns: Was deine Prompts ruiniert

Drei Gewohnheiten sabotieren Grok-Imagine-Prompts mehr als alles andere und sind für den Großteil der „Warum ist das unscharf?"-Beschwerden verantwortlich.

Mehrere Motive oder Aktionen in einem Prompt stapeln. „Ein Zauberer schießt einen Feuerball auf einen Drachen, während Bogenschützen von einer Burgmauer Pfeile regnen lassen, in einem Gewitter" klingt kinematisch, aber das Modell teilt seine Aufmerksamkeit und rendert nichts davon gut. Reduziere auf ein Motiv, eine Aktion, eine Kamerabewegung. Verbinde weitere Momente, indem du mehrere Clips generierst und diese schneidest, oder nutze Extend From Frame auf einer Partnerplattform wie PixVerse.

Den Prompt als Liste von Stil-Referenzen behandeln. „Wes Anderson trifft Blade Runner mit einem Hauch von Studio Ghibli" erzeugt gemittelten Output, der nach keiner dieser Referenzen aussieht. Das Modell kollabiert konkurrierende Stile in einem generischen Mittelklasse-Render. Wähle ein Stil-Register und bleib dabei. Wenn du Einflüsse kombinieren musst, tu das im Schnitt oder durch das Stapeln mehrerer Clips mit verschiedenen Stilen.

Prompts länger als drei Sätze. Grok Imagines Anweisungsbefolgung verschlechtert sich nach dem dritten Satz. Es beginnt, frühere Klauseln zu ignorieren und die letzte Anweisung übermäßig zu gewichten. Zwei prägnante Sätze schlagen in der Regel eine fünfsätzige Shot-Liste. Wenn du wirklich Shot-List-Präzision brauchst, wechsle in den Custom-Modus und nutze die expliziten Kamera-, Bewegungs- und Licht-Parameter, statt sie in Prosa zu packen.

So generierst du ein Video mit Grok Imagine

Der schnellste Weg ist die Consumer-Oberfläche:

  1. Gehe im Browser auf grok.com/imagine oder öffne die Grok-App auf iOS, Android oder Mac.
  2. Wähle Video statt Bild, dann einen kreativen Modus (Normal, Fun, Custom oder Spicy). Für Limits nach Tarifstufen sieh dir unsere Grok-Preisübersicht an.
  3. Tippe einen Prompt nach der Formel ein oder füge eines der obigen Beispiele ein.
  4. Wähle dein Seitenverhältnis und die Dauer (6 Sekunden kostenlos/Lite, 10 Sekunden bei SuperGrok und höher).
  5. Generieren drücken. Grok liefert in rund 17 Sekunden vier Variationen zurück. Du wählst eine aus und lädst die MP4 herunter.

Es gibt keinen separaten „Audio speichern"-Schritt, weil die Audiospur im Output eingebacken ist. Wenn du die Musik tauschen oder später Narration hinzufügen möchtest, tue das in deinem Editor, nicht in Grok.

Die xAI-API und was jeder Clip wirklich kostet

Für Entwicklerinnen und Entwickler ist der Ablauf ein POST an https://api.x.ai/v1/videos/generations mit dem grok-imagine-video-Modell, dann ein GET auf https://api.x.ai/v1/videos/{request_id}, um den Abschluss abzufragen. Die Latenz reicht von einigen Sekunden bis zu wenigen Minuten für die längsten 720p-Jobs. Die vollständigen xAI-Videogenerierungsdokumente beschreiben alle Parameter.

Das Pricing ist simpel. Das grok-imagine-video-Modell wird mit $0.05 pro Sekunde generiertem Video abgerechnet, natives Audio inklusive. Das ergibt rund $4.20 pro Minute. Zum Vergleich: Google Veo 3.1 Standard liegt bei rund $24 pro Minute mit Audio, Kling 3.0 Standard bei rund $5.04 pro Minute (Pro ist $6.72), und OpenAI Sora 2 Pro lag bei rund $18 pro Minute in 720p, bevor seine API vor der vollständigen Abschaltung am 24. September 2026 in den Shutdown ging. Grok Imagine liegt damit unter der Preisuntergrenze jeder anderen aktiven Video-API, was xAI in seiner Launch-Ankündigung hervorgehoben hat. Diese API-Preise pro Sekunde sind vom Consumer-App getrennt, wo Groks kostenloser Tarif das Testen von Imagine vor dem Abonnement ermöglicht.

Drei konkrete Beispiele für die Budgetplanung: Ein 6-sekündiger Instagram-Reel-Hook kostet rund $0.30; ein 15-sekündiger TikTok oder YouTube Short rund $0.75; ein 60-sekündiger Werbecut aus vier 15-Sekunden-Variationen rund $3.00 an reinen API-Generierungskosten, vor etwaigem Schnittaufwand. Das macht kurze Experimente günstig. 20 Prompt-Varianten für eine Idee zu generieren kostet rund $6, wenn jede 6 Sekunden hat, ein Preis, der anderswo kaum zu schlagen ist.

Wenn die Generierung schiefläuft

Drei Probleme verursachen die meisten enttäuschenden Grok-Imagine-Ergebnisse.

Unscharfe oder instabile Bewegung. Fast immer das Prompt-Überlastungsproblem von vorhin. Wenn dieselbe Idee immer wieder unscharf zurückkommt, reduziere den Prompt auf ein Motiv, eine Aktion, eine Kamerabewegung und einen Stil-Hinweis, dann generiere erneut mit einem anderen Seed.

Harte Ablehnungen oder verwässerte Clips. Wenn Grok eine abgeschwächte Version deines Prompts zurückliefert oder komplett ablehnt, hat der Prompt eine Content-Grenze überschritten. Ähnlichkeiten mit echten Personen (besonders Prominente und Politiker), Minderjährige in irgendeinem Kontext und grafische Gewalt sind die häufigsten Auslöser. Der Wechsel in den Spicy-Modus umgeht sie nicht. Schreibe stattdessen mit Archetypen und fiktiven Figuren statt mit namentlich genannten Personen.

Hartes Längenlimit. Das 15-Sekunden-API-Limit und das 10-Sekunden-Consumer-Limit sind fest. Wenn du einen 30-Sekunden-Clip brauchst, generiere zwei 15-Sekunden-Segmente mit demselben Seed und füge sie in deinem Editor zusammen, oder nutze den Extend-Modus auf Partnerplattformen wie PixVerse, um ein zweites Segment anzuhängen. Grok selbst überschreitet das Limit auf eine einzelne Anfrage nicht.

Grok Imagine neben anderen KI-Modellen nutzen

Grok Imagine erstellt Videos und kaum mehr. Langtexte, Code, tiefe Recherchen oder Dokumentenbearbeitung erledigt es nicht so wie ChatGPT, Claude, Gemini oder DeepSeek. Die meisten Creators zahlen am Ende für zwei oder drei Abos, um die Lücken zu schließen. Fello AI für $9.99/Monat konsolidiert diesen Stack. Es ist eine Mac-native KI-App, die ChatGPT, Claude, Gemini, Grok, DeepSeek und Perplexity hinter einem einzigen Preis bündelt, damit du einen Prompt mit einem Modell entwirfst, ihn mit einem anderen verfeinerst und ihn durch Grok Imagine schickst, ohne Tabs und Konten zu jonglieren.

Für das größere Grok-Produktbild sieh dir unseren Grok-4.3-Test und unseren Grok-Desktop-Client-Leitfaden für Mac an.

Fazit

Grok Imagine ist der kosteneffizienteste ernsthafte KI-Videogenerator auf dem Markt und der einzige große mit nativem Audio für $4.20 pro Minute. Das Modell ist gut. Was einen brauchbaren Clip von einem verschwendeten Credit trennt, ist der Prompt, und die obige Formel plus die 20 Beispiele sollten dich 80 % des Weges zu konstantem Output bringen. Für Social Clips, Werbekonzepte, Mood Boards und jeden kurzformatigen Video-Bedarf, bei dem Geschwindigkeit und Preis die absolute Fotorealität schlagen, ist es das Standard-Tool. Wenn du über 15 Sekunden gehst oder kino-taugliche 4K-Details brauchst, ist Kling 3.0 oder Veo 3.1 die bessere Wahl.

Der einfachste Einstieg ist grok.com/imagine im kostenlosen Tarif. Für den Rest unserer Berichterstattung sieh im Grok-Imagine-Tag-Archiv oder im vollständigen Grok-Tag nach. Und um zu sehen, wohin xAI als Nächstes geht, lies alles, was wir über Grok 5 wissen.

FAQ

Wie lang kann ein Grok-Imagine-Video sein?

Grok Imagine generiert Clips von 1 bis 15 Sekunden. Das 15-Sekunden-Limit ist nur über die xAI-API verfügbar. In der Consumer-Oberfläche unter grok.com/imagine erhalten kostenlose und SuperGrok-Lite-Nutzerinnen und -Nutzer 6-Sekunden-Clips, SuperGrok- und X-Premium+-Nutzende bis zu 10 Sekunden.

Was kostet die Grok-Imagine-API?

$0.05 pro Sekunde generiertem Video, natives Audio inklusive, was rund $4.20 pro Minute ergibt. Das ist weniger als ein Viertel des Preises von Google Veo 3.1 Standard ($24/min), rund 17 % günstiger als Kling 3.0 Standard ($5.04/min) und ein Bruchteil von OpenAI Sora 2 Pro, bevor es am 24. September 2026 abgeschaltet wird.

Was ist die Prompt-Formel für Grok-Imagine-Video?

[Motiv] + [Aktion] + [Umgebung] + [Stil] + [Kamera und Licht]. Ein Motiv, eine Aktion, eine Kamerabewegung pro Prompt. Zwei kurze Sätze schlagen fünf. Die 20 Beispiele oben folgen alle dieser Struktur.

Kann Grok Imagine mein eigenes Foto animieren?

Ja, Bild-zu-Video ist einer der zentralen Workflows. Lade das Standbild hoch, schreibe dann einen kurzen Prompt, der nur die Bewegung und atmosphärische Veränderung beschreibt, die du möchtest. Beschreibe das Motiv nicht erneut, das Quellbild hat es bereits.

Warum sind meine Grok-Imagine-Videos unscharf?

Fast immer Prompt-Überlastung. Mehrere Motive, mehrere Aktionen oder eine Liste von Stil-Referenzen zwingen das Modell, seine Aufmerksamkeit zu teilen und Brei zu rendern. Reduziere den Prompt auf ein Motiv, eine Aktion, eine Kamerabewegung, einen Stil-Hinweis und versuche es mit einem anderen Seed.

Generiert Grok Imagine Audio?

Ja. Musik, Soundeffekte, Umgebungsaudio, Dialog und Gesang werden alle nativ gleichzeitig mit dem Video generiert, mit Lippensync für Figuren. Es gibt keinen separaten Audio-Schritt.