MiniMax H3 Prompt-Leitfaden: T2VA, I2VA, Frames und Audio

15 Min. Lesezeit

minimax-h3-prompt-guide

Gute Prompts für MiniMax H3 beginnen mit dem richtigen Modus. Anschließend trennen sie die visuelle Zeitleiste, Dialoge, physische Geräusche und nicht diegetische Musik. Dieser Leitfaden enthält eigenständige, kopierbare Vorlagen für T2VA, I2VA, FL2VA, L2VA und natives Audio. Jede Vorlage folgt dem offiziellen Format von MiniMax.

Eine korrekte Struktur gibt H3 klarere Anweisungen, kann jedoch keine exakten Schnitte, Stimmen, Texte, Bewegungen oder Frame-Übereinstimmungen garantieren.

Die folgenden Prompts basieren auf Beispielen in der offiziellen Dokumentation von MiniMax.

Wähle zuerst den richtigen H3-Prompt-Modus

Beginne mit dem Bildmaterial, das du bereitstellen kannst. Wähle keinen Modus nur deshalb, weil sein Kürzel fortgeschrittener klingt.

ModusBereitgestellte EingabeErste Aufgabe des PromptsGeeignet für
T2VAKeineLege Szene, Motive, Handlung, Einstellungen und den vollständigen Audioplan festErstelle aus Text eine neue audiovisuelle Idee
I2VAEin StartframeVerankere das Eröffnungsbild vollständig und beschreibe anschließend den weiteren AblaufAnimiere eine vorbereitete Eröffnungskomposition
FL2VAStart- und EndframeRichte beide Bilder aus und beschreibe einen erkennbaren Weg zwischen ihnenAnfang und Ende eines Übergangs steuern
L2VAEin EndframeErstelle eine plausible frühere Sequenz, die im bereitgestellten Endframe ankommtEine vom Ende aus geplante Enthüllung oder Transformation entwerfen
Ref2VAReferenzbilder, -videos und/oder -audio in beliebiger Kombination; Audio kann der einzige Referenzmedientyp sein, ein nicht leerer Text-Prompt ist jedoch immer erforderlich.Weise jedem Asset im vollständigen Referenzformat eine Rolle zuSteuere Identität, Stil, Bewegung, Kamera oder Ton mit mehreren Quellen

MiniMax dokumentiert diese vier Basismodi in seinem offiziellen H3-Base-Prompt-Leitfaden. Ref2VA nutzt ein anderes Planungsformat mit sechs Abschnitten und gehört deshalb in einen eigenen fortgeschrittenen Workflow.

Baue jeden Basis-Prompt auf drei Kernfeldern auf

Stell dir den Basis-Prompt als drei Ebenen vor: Zeitleiste, physische Geräusche und nicht diegetische Musik.

integrated_multimodal_description: [Shot 1] Describe the subjects, setting, visible action, camera, dialogue, and any sound tied to this moment. [Shot 2] At 00:03.000, describe the next visible and audible event. overall_soundscape: Describe ambience, physical sound effects, and non-verbal human sounds across the clip. non_diegetic_music: Describe the audience-only score, or write N/A when no score is wanted.

integrated_multimodal_description legt die Wiedergabereihenfolge fest. Schreibe Einstellungen, Handlung, Dialoge, Gesang, sichtbaren Text und synchronisierte Geräusche in dieses Feld.

overall_soundscape umfasst Raumklang, Wind, Verkehr, Schritte, Stöße, Stoffrascheln, Atmung und ähnliche physische Geräusche. Wiederhole hier nicht den vollständigen Dialog.

non_diegetic_music beschreibt Musik, die nur das Publikum hört. Kommt die Musik dagegen von einem Radio oder einer Person in der Szene, gehört dieses Ereignis in die Zeitleiste.

Verwende diesen siebenteiligen Workflow für die Basismodi T2VA, I2VA, FL2VA und L2VA:

  1. Wähle T2VA, I2VA, FL2VA oder L2VA passend zu den verfügbaren Referenzframes.
  2. Lege die Dauer fest. Bei bildgeführten API-Modi bestimmt das Quellbild das Ausgabeformat.
  3. Füge die erforderliche Bildausrichtungszeile hinzu, wenn ein Start- oder Endframe vorhanden ist.
  4. Schreibe die sichtbare Abfolge in Wiedergabereihenfolge.
  5. Weise feste Sprecher-IDs zu und übernimm den Dialog wortgetreu.
  6. Trenne physische Geräusche von nicht diegetischer Musik.
  7. Prüfe vor der Generierung Timing, Beschriftungen, Referenzen und Text.

Verwende für Ref2VA das eigenständige Vollreferenzformat mit sechs Abschnitten: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape und non_diegetic_music.

Kopiere diesen Text-zu-Video-Prompt für MiniMax H3

T2VA hat keine Bildausrichtungszeile. Beginne mit den drei Feldern und definiere alle Inhalte per Text.

Das folgende Beispiel zeigt eine achtsekündige Produktpräsentation. Die festgelegte Produktbeschreibung bleibt in allen Einstellungen identisch: „a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE"“.

Liste vor dem Test die Produktdetails auf, die nicht abweichen dürfen. Der Leitfaden zur Konsistenz in Produktvideos zeigt, wie du daraus prüfbare Akzeptanzkriterien machst.

Ablaufdaten: T2VA · 8 Sekunden · 16:9 · kein bereitgestelltes Bild.

integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. A square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" stands on a wet black-basalt plinth inside a greenhouse before sunrise. Cold blue window light reaches the bottle from camera right. The camera makes a slow, small-amplitude push toward the plinth. Water beads slide down the glass while fern leaves move gently behind it. [Shot 2] At 00:04.000, the camera cuts to a close-up of the same square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE". A narrow amber light sweeps from left to right across the bottle. The label stays front-facing and readable. One water bead reaches the base as a woman with a quiet voice (S1) says in an off-screen voiceover: <d>[English] Find your north.</d> No person appears on screen, and no visible lips move. The shot holds steady through the final frame. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Light greenhouse rain taps on the glass roof. Leaves rustle softly while water drops strike the basalt surface. A low room tone continues beneath the voice. non_diegetic_music: Three isolated felt-piano strikes sound during the first half. A bowed-glass drone rises twice, then stops two seconds before the end.

Etikett, Stimme, Lichtbewegung und synchronisierter Wassertropfen stehen in der Zeitleiste. Regen und Blattbewegungen gehören in die Geräuschkulisse.

Verankere einen Bild-zu-Video-Prompt im Startframe

I2VA behandelt das bereitgestellte Bild als tatsächlichen Startframe bei 0.00 Sekunden. Verwende die feste erste Zeile von MiniMax und beschreibe anschließend nur, was sich aus dem bereits festgelegten Bild entwickelt.

Beschreibe den Startframe nicht neu. Behalte Produkt, Komposition, Beleuchtung, Farben und räumliche Beziehungen bei, bevor du Bewegung hinzufügst.

Ablaufdaten: I2VA · 8 Sekunden · 16:9-Quellbild · Picture 1 liefert die erste Produktaufnahme.

For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. The square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" remains in the position, scale, lighting, and greenhouse composition established by <Picture 1>. The camera arcs clockwise with small amplitude at slow speed. Water beads move down the glass while the background fern leaves shift in a light draft. A narrow amber reflection begins at the bottle's left edge and travels across its front face. The label remains front-facing and readable. At the end, the camera stops and holds the original product as the brightest object. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Soft rain taps the greenhouse roof while leaves brush against one another. Water drops strike the basalt plinth at irregular intervals. non_diegetic_music: A muted handpan sounds once every two seconds. One airy synthesizer tone enters halfway and recedes before the final frame.

Der Prompt nennt nur Änderungen, die sich aus dem Bild entwickeln können. So bleiben Produkt und Szene erhalten, während sich die Kamera bewegt.

Verbinde Start- und Endframe, ohne den Übergang zu überspringen

FL2VA verankert beide Enden. Der Prompt muss den sichtbaren Pfad zwischen Bild 1 und Bild 2 erläutern.

Verwende eine Aufnahme, wenn du eine kontinuierliche Interpolation wünschst. Füge Schnitte nur dann hinzu, wenn der kreative Plan sie wirklich erfordert.

Ablaufdaten: FL2VA · 8 Sekunden · passende 16:9-Quellbilder · Picture 1 bei 0.00 · Picture 2 bei 8.00.

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. At the opening instant, Picture 1 determines the square amber-glass perfume bottle's location, size, and framing. It has a matte-black cap and a cream label reading "NORTHLINE". The camera trucks right with small amplitude at slow speed. A thin stream of water crosses the basalt plinth from left to right. The greenhouse light shifts gradually from cold blue dawn toward Picture 2's warm amber direction. Fern shadows travel across the background, then settle. The bottle does not rotate, and its label remains front-facing. By the last frame, the camera, water, reflections, shadows, and lighting match Picture 2's spacing, viewing angle, and composition. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Rain decreases gradually as water runs across the stone. The final drops become farther apart before the scene settles into quiet greenhouse ambience. non_diegetic_music: N/A

Ein guter FL2VA-Prompt benennt die Zwischenbewegung: Kamerafahrt, Wasserposition, Lichtwechsel und Schattenbewegung.

Plane rückwärts vom bereitgestellten Endframe

L2VA macht Picture 1 zum Endframe, nicht zum Startframe. Wähle einen plausiblen früheren Zustand, der diesen Endframe innerhalb der verfügbaren Zeit erreichen kann.

Die offizielle Zeile verwendet die Nummer der letzten Einstellung und eine effektive Dauer mit genau zwei Dezimalstellen. Ein achtsekündiger Prompt mit nur einer Einstellung endet daher bei 8.00-second und verwendet Shot 1.

Ablaufdaten: L2VA · 8 Sekunden · bereitgestellter 16:9-Endframe · Picture 1 definiert die endgültige Produktkomposition.

How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 8.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. An empty wet black-basalt plinth fills the foreground inside a dark greenhouse before sunrise. The camera pulls out with small amplitude at slow speed. From the left, a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" slides smoothly onto the plinth and slows as it reaches center. Cold blue light from the right changes gradually to a narrow amber beam from the left. Water beads become visible on the bottle. During the final two seconds, every moving element comes to rest. The object placement, scale, camera view, reflections, label direction, fern shadows, and illumination now match <Picture 1>. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Rain taps the greenhouse roof while glass slides softly over wet stone. The sliding sound slows and stops as one final drop strikes the plinth. non_diegetic_music: Four muted glass harmonics sound at even intervals. The fourth ends as the bottle stops moving.

Rückwärtsplanung funktioniert am besten, wenn der Ausgangszustand nur wenige Änderungen erfordert.

Plane Einstellungen, Kamerabewegung und Timing

Die erste Einstellung hat keinen Zeitstempel. Jede spätere Einstellung beginnt mit einer streng ansteigenden Schnittzeit innerhalb der Zieldauer.

MiniMax dokumentiert dieses Shot-Label-Muster; die Auslassungspunkte unten sind Platzhalter:

[Shot 1] Live-action, cinematic, a medium-wide shot establishes... [Shot 2] At 00:03.500, the camera cuts to... [Shot 3] At 00:06.250, the shot switches to...

Verwende keinen Zeitstempel für eine fortlaufende Aktion innerhalb einer Einstellung. Schreibe stattdessen beispielsweise „zur Hälfte der Einstellung“, wenn kein Schnitt erfolgt.

Nenne bei der Kameraführung zuerst die Bewegungsart. Ergänze Amplitude und Geschwindigkeit nur, wenn sie das gewünschte Ergebnis genauer beschreiben.

Unklare AnweisungKlarere Richtung
Filmische KameraDie Kamera fährt langsam und mit geringer Amplitude näher heran
Dynamische BewegungDie Kamera fährt schnell und mit großer Amplitude nach links
Auf das Etikett fokussierenDie Kamera hält eine statische Nahaufnahme, während das Licht über das Etikett wandert
Das Produkt umkreisenDie Kamera beschreibt langsam und mit kleiner Amplitude einen Bogen im Uhrzeigersinn

Plane die Schnitte, bevor du die Prompt-Syntax schreibst. Der Leitfaden für KI-Storyboards erklärt, wie du Zweck und Kontinuität jeder Einstellung vor der Animation festlegst.

Trenne Dialoge, Soundeffekte, Atmosphäre und Musik

H3 generiert Videos mit nativem Stereo-Audio. Deshalb gehören die Audioanweisungen bereits in den ersten Prompt. Trenne diese vier Tonfunktionen.

TonfunktionWo eintragen?Beispiel
Dialog oder Gesangintegrated_multimodal_description(S1) says: <d>[English] Find your north.</d>
Synchronisiertes EreignisAktuelle Aufnahme in der TimelineDie Kappe rastet ein, wenn die Hand sie loslässt
Umgebung und physische Geräuscheoverall_soundscapeRegen, Schritte, Kleidung, Stöße, Atmung
Nicht diegetische Musiknon_diegetic_musicInstrumentierung, Tempo, Rhythmus und Lautstärkeverlauf

Weise (S1), (S2) und weitere IDs in der Reihenfolge zu, in der die Stimmen erstmals auftreten. Verknüpfe jede ID in allen Einstellungen mit derselben Stimme.

Setze nur das Sprach-Tag und den genauen gesprochenen Text in <d>. Sprecherbeschreibung, Handlung, Sprechweise und ID bleiben außerhalb des Tags.

The calm off-screen woman (S1) says: <d>[English] Find your north.</d> The shopkeeper with a low, measured voice (S2) replies: <d>[English] It was here all along.</d>

Verwende für das Voice-over die ausdrückliche Formulierung von MiniMax und lass die Person im Bild den Mund geschlossen halten:

The woman (S1) says in an off-screen voiceover: <d>[English] I kept the first bottle.</d> while her lips remain completely closed.

Schreibe N/A unter non_diegetic_music, wenn du Atmosphäre und Effekte ohne nicht diegetische Musik wünschst. Verwende overall_soundscape: N/A nur, wenn du für den gesamten Clip völlige Stille verlangst.

Sichtbarer Text muss in doppelten Anführungszeichen stehen. Übernimm ihn einschließlich der Zeichensetzung exakt. Ein Etikett in Anführungszeichen kann die Anweisung klarer machen, garantiert aber keine fehlerfreie Textdarstellung.

Praktische Fehlerbehebung auf Basis des offiziellen Formats

Beginne mit der Struktur, bevor du Stilbegriffe änderst. Ändere jeweils eine Variable und vergleiche dann die nächste Ausgabe mit derselben Akzeptanzprüfung.

FehlerWahrscheinliches Prompt-ProblemEmpfohlene Anpassung
Die falsche Person sprichtDie IDs haben gewechselt oder einem Sprecher wurde nie eine ID zugewiesenWeise beim ersten Auftreten jeder Stimme feste IDs wie (S1) und (S2) zu und verwende sie weiter
Es erscheint unerwünschte HintergrundmusikDas Musikfeld war vage oder fehlteSchreibe non_diegetic_music: N/A und behalte die gewünschten physischen Geräusche in overall_soundscape
Ein Zeitstempel scheint ignoriert zu werdenDer Zeitstempel markiert eine Aktion, keinen Schnitt, oder liegt außerhalb der DauerSetze Zeitstempel nur bei späteren Einstellungen und lass die Schnittzeiten innerhalb des Clips streng ansteigen
Das Video wird zufällig geschnittenKleinere Winkeländerungen wurden als separate Aufnahmen aufgezeichnetBehalte eine Aufnahme und beschreibe die Kamerabewegung, es sei denn, ein Schnitt führt neue Informationen ein
FL2VA springt zwischen EndpunktenDer Prompt wiederholt zwei statische BeschreibungenNenne beobachtbare Zwischenänderungen, die nach und nach das endgültige Bild erreichen
L2VA behandelt das Bild als StartbildDie Ausrichtungslinie des letzten Frames oder die endgültige Konvergenz fehltPlatziere die L2VA-Anweisung zuerst und lande erst am Ende auf dem Bild
Der sichtbare Text weicht abDer Text wurde paraphrasiert oder nicht zitiertSetze den genauen Text in gerade doppelte Anführungszeichen und überprüfe anschließend das Ergebnis
Der Dialog wiederholt sich in der GeräuschkulisseGesprochene Wörter wurden in mehrere Felder kopiertSchreibe den vollständigen Dialog nur innerhalb von <d> in die visuelle Zeitleiste

Diese Korrekturen machen die Anweisungen klarer, garantieren aber nicht, dass jede Generierung jedes Detail befolgt.

Wenn ein Prompt Identität, Bewegung, Kamera und Stimme aus mehreren Quelldateien benötigt, erweitere dieses Basisformat nicht weiter. Nutze Ref2VA und den offiziellen vollständigen Referenzleitfaden.

Prüfe deinen Prompt vor der Generierung in 30 Sekunden

Kopiere diese Checkliste in deine Produktionsnotizen:

  • Der ausgewählte Modus entspricht den bereitgestellten visuellen Eingaben.
  • Die erforderliche Bildausrichtungsanweisung steht in der ersten Zeile.
  • Die Zeit des Endframes entspricht der effektiven Dauer und hat zwei Dezimalstellen.
  • [Shot 1] hat keinen Zeitstempel; spätere Schnittzeiten steigen an und bleiben innerhalb der Dauer.
  • Die gleiche Motivbeschreibung bleibt bei allen Aufnahmen stabil.
  • Jede Stimme behält eine feste (Sx)-ID.
  • Sprache und Wortlaut jeder gesprochenen Zeile bleiben innerhalb von <d> exakt erhalten.
  • Sichtbarer Text erscheint in englischen doppelten Anführungszeichen.
  • Physische Geräusche stehen in der Zeitleiste oder in overall_soundscape.
  • Nicht diegetische Musik steht in non_diegetic_music; ohne Musik enthält das Feld N/A.
  • Die angeforderten Aktionen passen in die ausgewählte Cliplänge.
  • Die Akzeptanzprüfung benennt, worauf es am meisten ankommt: Identität, Etikett, Übergang, Timing, Ton oder Endframe.

Die offizielle API-Referenz zu Video Generation V2 verlangt einen nicht leeren Text-Prompt. Sie trennt außerdem Rollen für Start- und Endframes von Rollen für Referenzmedien. Mische diese Rollenfamilien daher nicht in einer API-Anfrage.

FAQ zu MiniMax-H3-Prompts

Wie ist ein MiniMax-H3-Prompt am besten aufgebaut?

Die beste Grundstruktur beginnt mit dem richtigen Modus und verwendet drei Felder: integrated_multimodal_description, overall_soundscape und non_diegetic_music. Setze bei I2VA, FL2VA oder L2VA davor die offizielle Bildausrichtungszeile.

Was unterscheidet T2VA, I2VA, FL2VA und L2VA?

T2VA beginnt mit Text, I2VA mit einem Startframe. FL2VA verbindet Start- und Endframe, während L2VA auf einen bereitgestellten Endframe hinarbeitet. Der Modus bestimmt die erste Prompt-Anweisung und die Richtung der visuellen Planung.

Wie weise ich H3 verschiedene Sprecher zu?

Weise jeder Stimme bei ihrem ersten Auftreten eine feste ID wie (S1) oder (S2) zu und verwende sie in allen Einstellungen weiter. Innerhalb von <d> stehen nur das Sprach-Tag und der gesprochene Text.

Wie fordere ich Soundeffekte, aber keine Musik an?

Beschreibe synchronisierte Effekte in der jeweiligen Einstellung und die allgemeine Geräuschkulisse in overall_soundscape. Schreibe anschließend non_diegetic_music: N/A, wenn du keine nicht diegetische Musik anfordern möchtest.

Warum ignoriert H3 möglicherweise einen Shot-Zeitstempel?

Ein Zeitstempel kann scheitern, wenn er eine Aktion statt eines Schnitts markiert, einen früheren Zeitpunkt wiederholt oder außerhalb des Clips liegt. Verwende Zeitstempel nur ab Shot 2 und ordne die Schnittzeiten streng aufsteigend an.

Kann ich dasselbe Format für die Generierung mit Referenzen verwenden?

Für direkte H3-Base-Ref2VA-Prompts nutzt du das Format mit sechs Abschnitten: Motivdefinitionen, Zusammenfassung, Erhaltungsanalyse, detaillierter Ablauf, Geräuschkulisse und Musik. Die gehostete API akzeptiert einen nicht leeren Text-Prompt zusammen mit Referenzmedien; die vollständige Fassung muss daher nicht immer von Hand geschrieben werden.

Setze deinen H3-Prompt in die Praxis um

Du kannst jetzt den passenden H3-Modus auswählen, die Zeitleiste schreiben und die Audioebenen sauber trennen. Speichere die passende Vorlage und gehe vor der nächsten Generierung die QA-Checkliste durch.

MiniMax H3 ist jetzt in DomoAI über Omni Reference verfügbar.

Neueste Artikel