Guía de prompts de MiniMax H3: T2VA, I2VA y audio

15 min de lectura

minimax-h3-prompt-guide

Los buenos prompts de MiniMax H3 comienzan con el modo correcto. Después separan la línea de tiempo visual, el diálogo, los sonidos físicos y la música no diegética. Esta guía ofrece plantillas originales y listas para copiar de T2VA, I2VA, FL2VA, L2VA y audio nativo. Cada plantilla sigue el formato oficial de MiniMax.

Una estructura correcta da instrucciones más claras a H3, pero no garantiza cortes, voces, texto, movimiento ni coincidencias exactas entre fotogramas.

Los prompts siguientes se basan en ejemplos de la documentación oficial de MiniMax.

Elige primero el modo de prompt de H3 correcto

Empieza con el material visual suministrado. No elijas un modo porque sus siglas suenan más avanzadas.

ModoEntrada suministradaPrimera tarea del promptUso recomendado
T2VANingunoEstablece la escena, los sujetos, la acción, los planos y el plan de audio completo.Crea una nueva idea audiovisual a partir de texto
I2VAUn primer fotogramaHaz referencia completa a la imagen de apertura y luego describe lo que sucede a continuación.Animar una composición de apertura preparada.
FL2VAPrimer y último fotogramaAlinea ambas imágenes y describe un camino observable entre ellas.Controlar la apertura y el final de una transición.
L2VAUn último fotogramaConstruye una secuencia anterior plausible que aterrice en el fotograma final suministrado.Diseñar una revelación o transformación a partir del final
Ref2VAImágenes, videos y/o audio de referencia en cualquier combinación; el audio puede ser el único tipo de medio de referencia, pero siempre se requiere un prompt de texto no vacío.Asigna a cada recurso una función dentro del formato de referencia completaGuiar identidad, estilo, movimiento, cámara o sonido con varias fuentes

MiniMax documenta estos cuatro modos básicos en su guía oficial de prompts base de H3. Ref2VA utiliza otro formato de planificación de seis secciones, por lo que corresponde a un flujo de trabajo avanzado independiente.

Construye cada prompt básico en torno a tres campos centrales

Piensa en el prompt básico como tres capas: línea de tiempo, sonidos físicos y música no diegética.

integrated_multimodal_description: [Shot 1] Describe the subjects, setting, visible action, camera, dialogue, and any sound tied to this moment. [Shot 2] At 00:03.000, describe the next visible and audible event. overall_soundscape: Describe ambience, physical sound effects, and non-verbal human sounds across the clip. non_diegetic_music: Describe the audience-only score, or write N/A when no score is wanted.

integrated_multimodal_description define el orden de reproducción. Incluye aquí los planos, la acción, el diálogo, el canto, el texto visible y el sonido sincronizado.

overall_soundscape abarca el sonido ambiente, el viento, el tráfico, los pasos, los impactos, el roce de la tela, la respiración y otros sonidos físicos. No repitas aquí el diálogo completo.

non_diegetic_music describe la música que solo escucha el público. Si la música procede de una radio o de un intérprete dentro de la escena, mantén ese evento en la línea de tiempo.

Usa este flujo de trabajo de siete partes para los modos base T2VA, I2VA, FL2VA y L2VA:

  1. Elige T2VA, I2VA, FL2VA o L2VA según los fotogramas de referencia disponibles.
  2. Define la duración. En los modos de API guiados por fotogramas, la imagen de origen determina la relación de aspecto de salida.
  3. Añade la línea de alineación de imágenes cuando exista un primer o último fotograma.
  4. Escribe la línea de tiempo visible en orden de reproducción.
  5. Asigna identificadores estables a los hablantes y conserva el diálogo sin modificarlo.
  6. Separa los sonidos físicos de la música no diegética.
  7. Verifica el tiempo, las etiquetas, las referencias y el texto antes de generar.

Para Ref2VA, usa el formato independiente de referencia completa con seis secciones: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape y non_diegetic_music.

Copia este prompt de texto a video para MiniMax H3

T2VA no tiene línea de alineación de imagen. Comienza con los tres campos y establece todo desde el texto.

El siguiente ejemplo crea una presentación de producto de ocho segundos. La cláusula fija se mantiene idéntica en todos los planos: «a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE"».

Antes de probar el prompt, enumera los detalles del producto que no deben variar. La guía de coherencia para videos de producto muestra cómo convertirlos en criterios de aceptación.

Ficha de ejecución: T2VA · 8 segundos · 16:9 · no se suministra imagen.

integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. A square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" stands on a wet black-basalt plinth inside a greenhouse before sunrise. Cold blue window light reaches the bottle from camera right. The camera makes a slow, small-amplitude push toward the plinth. Water beads slide down the glass while fern leaves move gently behind it. [Shot 2] At 00:04.000, the camera cuts to a close-up of the same square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE". A narrow amber light sweeps from left to right across the bottle. The label stays front-facing and readable. One water bead reaches the base as a woman with a quiet voice (S1) says in an off-screen voiceover: <d>[English] Find your north.</d> No person appears on screen, and no visible lips move. The shot holds steady through the final frame. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Light greenhouse rain taps on the glass roof. Leaves rustle softly while water drops strike the basalt surface. A low room tone continues beneath the voice. non_diegetic_music: Three isolated felt-piano strikes sound during the first half. A bowed-glass drone rises twice, then stops two seconds before the end.

La etiqueta, la voz, el barrido de luz y la gota de agua sincronizada van en la línea de tiempo. La lluvia y el movimiento de las hojas van en el paisaje sonoro.

Ancla un prompt de imagen a video al primer fotograma

I2VA trata la imagen proporcionada como el primer fotograma real en el segundo 0.00. Usa la primera línea fija de MiniMax y describe a partir de lo que la imagen ya establece.

No rediseñes el primer fotograma con palabras. Antes de añadir movimiento, conserva el producto, la composición, la iluminación, los colores y las relaciones espaciales visibles.

Ficha de ejecución: I2VA · 8 segundos · fotograma de origen 16:9 · Picture 1 proporciona el plano inicial del producto.

For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. The square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" remains in the position, scale, lighting, and greenhouse composition established by <Picture 1>. The camera arcs clockwise with small amplitude at slow speed. Water beads move down the glass while the background fern leaves shift in a light draft. A narrow amber reflection begins at the bottle's left edge and travels across its front face. The label remains front-facing and readable. At the end, the camera stops and holds the original product as the brightest object. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Soft rain taps the greenhouse roof while leaves brush against one another. Water drops strike the basalt plinth at irregular intervals. non_diegetic_music: A muted handpan sounds once every two seconds. One airy synthesizer tone enters halfway and recedes before the final frame.

El prompt nombra solo los cambios que pueden desarrollarse a partir de la imagen. Evita reemplazar el producto y la escena mientras se mueve la cámara.

Conecta el primer y último fotograma sin saltarse la transición

FL2VA ancla ambos extremos. El prompt debe explicar la ruta visible entre Picture 1 y Picture 2.

Usa un solo plano cuando quieras una interpolación continua. Añade cortes solo cuando el plan creativo realmente los requiera.

Ficha de ejecución: FL2VA · 8 segundos · fotogramas de origen 16:9 coincidentes · Picture 1 en 0.00 · Picture 2 en 8.00.

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. At the opening instant, Picture 1 determines the square amber-glass perfume bottle's location, size, and framing. It has a matte-black cap and a cream label reading "NORTHLINE". The camera trucks right with small amplitude at slow speed. A thin stream of water crosses the basalt plinth from left to right. The greenhouse light shifts gradually from cold blue dawn toward Picture 2's warm amber direction. Fern shadows travel across the background, then settle. The bottle does not rotate, and its label remains front-facing. By the last frame, the camera, water, reflections, shadows, and lighting match Picture 2's spacing, viewing angle, and composition. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Rain decreases gradually as water runs across the stone. The final drops become farther apart before the scene settles into quiet greenhouse ambience. non_diegetic_music: N/A

Un buen prompt FL2VA nombra el movimiento intermedio: recorrido de cámara, posición del agua, cambio de luz y movimiento de las sombras.

Escribe hacia atrás desde el último fotograma proporcionado

L2VA convierte Picture 1 en el final, no en el inicio. Elige un estado anterior plausible que pueda llegar a ese fotograma dentro del tiempo disponible.

La línea oficial usa el número del plano final y una duración efectiva con exactamente dos decimales. Por tanto, un prompt de un solo plano y ocho segundos termina en 8.00-second y usa Shot 1.

Ficha de ejecución: L2VA · 8 segundos · fotograma final 16:9 proporcionado · Picture 1 define la composición final del producto.

How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 8.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. An empty wet black-basalt plinth fills the foreground inside a dark greenhouse before sunrise. The camera pulls out with small amplitude at slow speed. From the left, a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" slides smoothly onto the plinth and slows as it reaches center. Cold blue light from the right changes gradually to a narrow amber beam from the left. Water beads become visible on the bottle. During the final two seconds, every moving element comes to rest. The object placement, scale, camera view, reflections, label direction, fern shadows, and illumination now match <Picture 1>. No extra bottle, label, subtitle, or watermark appears. overall_soundscape: Rain taps the greenhouse roof while glass slides softly over wet stone. The sliding sound slows and stops as one final drop strikes the plinth. non_diegetic_music: Four muted glass harmonics sound at even intervals. The fourth ends as the bottle stops moving.

La planificación hacia atrás funciona mejor cuando el estado inicial requiere pocos cambios.

Dirige los planos, el movimiento de cámara y los tiempos

El primer plano no lleva marca de tiempo. Cada plano posterior comienza con un tiempo de corte estrictamente creciente y dentro de la duración objetivo.

MiniMax documenta este patrón de etiquetas de plano; los puntos suspensivos siguientes son marcadores de posición:

[Shot 1] Live-action, cinematic, a medium-wide shot establishes... [Shot 2] At 00:03.500, the camera cuts to... [Shot 3] At 00:06.250, the shot switches to...

No uses una marca de tiempo para describir una acción continua dentro de una sola toma. Usa prosa como “a mitad de la toma” cuando no se produzca un corte.

La dirección de la cámara necesita primero un tipo de movimiento. Añade amplitud y velocidad sólo cuando ayuden a definir el resultado.

Dirección poco precisaDirección más clara
Cámara cinematográficaLa cámara se acerca lentamente con un movimiento de poca amplitud
Movimiento dinámicoLa cámara se desplaza hacia la izquierda, rápido y con gran amplitud
Centrarse en la etiquetaLa cámara mantiene un primer plano estático mientras la luz atraviesa la etiqueta.
Rodear el productoLa cámara describe un arco en sentido horario, lentamente y con poca amplitud

Planifica los cortes antes de escribir la sintaxis del prompt. La guía de storyboard para videos con IA explica cómo definir el propósito y la continuidad de cada plano antes de animar.

Separa diálogo, efectos de sonido, ambiente y música

H3 genera video con audio estéreo nativo, por lo que las indicaciones de audio deben formar parte del prompt inicial. Mantén separadas estas cuatro funciones sonoras.

Función sonoraDónde escribirlaEjemplo
Diálogo o cantointegrated_multimodal_description(S1) says: <d>[English] Find your north.</d>
Evento sincronizadoToma actual en la línea de tiempo.La tapa se cierra con un clic cuando la mano la suelta.
Ambiente y sonidos físicosoverall_soundscapeLluvia, pasos, tela, impactos, respiración.
Música no diegéticanon_diegetic_musicInstrumentación, tempo, ritmo y cambio de volumen.

Asigna (S1), (S2) y los identificadores siguientes según el orden en que aparezcan las voces. Mantén cada identificador asociado a la misma voz en todos los planos.

Coloca dentro de <d> solo la etiqueta de idioma y las palabras exactas. Deja fuera la descripción del hablante, la acción, la interpretación y el identificador.

The calm off-screen woman (S1) says: <d>[English] Find your north.</d> The shopkeeper with a low, measured voice (S2) replies: <d>[English] It was here all along.</d>

Para la voz en off, usa la frase explícita de MiniMax y mantén cerrada la boca en pantalla:

The woman (S1) says in an off-screen voiceover: <d>[English] I kept the first bottle.</d> while her lips remain completely closed.

Escribe N/A en non_diegetic_music cuando quieras ambiente y efectos sin música no diegética. Usa overall_soundscape: N/A solo cuando solicites silencio absoluto durante todo el clip.

El texto visible necesita comillas dobles. Cópialo exactamente, incluida la puntuación. Citar una etiqueta puede mejorar la claridad de las instrucciones, pero no garantiza una representación perfecta del texto.

Solución práctica de problemas basada en el formato oficial

Empieza por la estructura antes de cambiar los términos de estilo. Modifica una sola variable cada vez y compara el resultado siguiente con los mismos criterios de aceptación.

FalloPosible problema del promptAjuste recomendado
Habla la persona equivocadaLas identificaciones cambiaron o nunca se estableció un hablanteAsigna identificadores estables (S1) y (S2) cuando aparezca cada voz por primera vez y reutilízalos después
Aparece música de fondo no deseadaEl campo de música era impreciso o faltabaEscribe non_diegetic_music: N/A y conserva los sonidos físicos deseados en overall_soundscape
Una marca de tiempo parece ignoradaLa marca de tiempo señala una acción, no un corte, o queda fuera de la duraciónUsa marcas de tiempo solo en los planos posteriores y mantén los tiempos de corte estrictamente crecientes dentro del clip
El video introduce cortes aleatoriosLos cambios de ángulo pequeños se escribieron como planos separadosMantén una toma y describe el movimiento de la cámara a menos que un corte introduzca nueva información.
FL2VA salta entre puntos finalesEl prompt repite dos descripciones estáticas.Describe cambios intermedios observables que conduzcan de forma gradual al fotograma final
L2VA trata la imagen como una aperturaFalta la línea de alineación del último fotograma o la convergencia finalColoca primero la instrucción L2VA y llega a la imagen solo al final
El texto visible cambiaEl texto se parafraseó o no se escribió entre comillasConserva el texto exacto entre comillas dobles en inglés y luego revisa el resultado
El diálogo se repite en el paisaje sonoro.Las palabras habladas se copiaron en varios campos.Mantén el diálogo completo solo dentro de <d> en la línea de tiempo visual

Estas correcciones mejoran la claridad de las instrucciones, pero no garantizan que cada generación respete todos los detalles.

Si un prompt necesita identidad, movimiento, cámara y voz de varios archivos de origen, deja de ampliar este formato básico. Usa Ref2VA y la guía oficial de referencia completa.

Ejecuta un control de calidad de 30 segundos antes de generar

Copia esta lista de verificación en tus notas de producción:

  • El modo seleccionado coincide con las entradas visuales proporcionadas.
  • Cualquier instrucción de alineación de imagen requerida aparece en la primera línea.
  • El tiempo del fotograma final coincide con la duración efectiva y utiliza dos decimales.
  • [Shot 1] no tiene marca de tiempo; los tiempos de corte posteriores aumentan y permanecen dentro de la duración.
  • La misma descripción del sujeto permanece estable en todas las tomas.
  • Cada voz mantiene un único identificador (Sx).
  • Cada línea conserva dentro de <d> el idioma y la redacción exactos.
  • El texto visible aparece entre comillas dobles en inglés.
  • El sonido físico se encuentra en la línea de tiempo o en overall_soundscape.
  • La música no diegética se escribe en non_diegetic_music; si no se necesita, el campo indica N/A.
  • Las acciones solicitadas pueden caber dentro de la duración del clip seleccionado.
  • La verificación de aceptación nombra lo que más importa: identidad, etiqueta, transición, sincronización, sonido o fotograma final.

La referencia oficial de la API Video Generation V2 exige un prompt de texto no vacío. También separa los roles del primer y último fotograma de los roles de medios de referencia; no mezcles ambas familias en una sola solicitud.

Preguntas frecuentes sobre los prompts de MiniMax H3

¿Cuál es la mejor estructura para un prompt de MiniMax H3?

La mejor estructura básica comienza con el modo correcto y usa tres campos: integrated_multimodal_description, overall_soundscape y non_diegetic_music. Añade la línea oficial de alineación de imágenes antes de esos campos para I2VA, FL2VA o L2VA.

¿Cuál es la diferencia entre T2VA, I2VA, FL2VA y L2VA?

T2VA parte de texto; I2VA, de un primer fotograma; FL2VA conecta el primero con el último; y L2VA termina en un último fotograma proporcionado. Cada modo cambia la primera instrucción del prompt y la dirección del plan visual.

¿Cómo asigno distintos hablantes en H3?

Asigna identificadores estables como (S1), (S2) y los siguientes cuando aparezca cada voz por primera vez. Reutiliza cada identificador en todos los planos y coloca dentro de <d> solo la etiqueta de idioma y las palabras pronunciadas.

¿Cómo indico a H3 que use efectos de sonido, pero no música?

Describe los efectos sincronizados dentro del plano y el ambiente general en overall_soundscape. Después escribe non_diegetic_music: N/A para no solicitar música no diegética.

¿Por qué H3 puede ignorar la marca de tiempo de un plano?

Una marca de tiempo puede fallar si señala una acción en vez de un corte, repite un momento anterior o queda fuera del clip. Úsala solo en el Plano 2 y los posteriores, con tiempos de corte estrictamente crecientes.

¿Puedo usar el mismo formato para generar video a partir de referencias?

Para prompts directos de H3-Base Ref2VA, usa el formato de seis secciones: definición de sujetos, resumen, conservación, reproducción detallada, ambiente sonoro y música. La API alojada acepta un prompt de texto no vacío con medios de referencia, por lo que no es obligatorio redactar a mano las seis secciones.

Pon en práctica tu prompt de H3

Ya puedes elegir el modo H3 correcto, escribir la línea de tiempo y separar cada capa de audio. Guarda la plantilla correspondiente y completa la lista de control de calidad antes de tu próxima generación.

MiniMax H3 ya está disponible en DomoAI a través de Omni Reference.

Artículos recientes