Reference-to-Video en MiniMax H3 funciona mejor cuando cada fuente tiene una función definida. Usa una imagen para la apariencia o la composición, un video para el movimiento o la cámara y un audio para una señal sonora. Indica después qué debe conservar, transferir o cambiar H3, y qué debe tratar solo como referencia general.
Un mismo recurso puede aportar varios sujetos o atributos. La regla de «una función por fuente» asigna una responsabilidad principal a cada archivo. Es un método de planificación, no un límite técnico de un solo recurso.
¿Qué es Reference-to-Video en MiniMax H3?
Reference-to-Video, o Ref2VA, combina texto con imágenes, videos o audios de referencia para guiar un nuevo clip audiovisual. Cada fuente puede definir identidad, apariencia, estilo, movimiento, cámara, tiempos, voz, efectos de sonido o música.
H3 no trata cada archivo como un fotograma. Una imagen puede definir la apariencia, un video puede guiar la cámara y un audio puede orientar el timbre.
La guía oficial de prompts con referencias completas de MiniMax formaliza esas relaciones mediante etiquetas, marcadores de conservación y una estructura de planificación de seis secciones.
Ese formato describe las relaciones previstas, pero no garantiza una identidad exacta, un comportamiento físico concreto, sincronización labial, tiempos, texto ni reproducción píxel por píxel.
Ref2VA frente a FL2VA: ¿qué modo de H3 conviene usar?
Elige FL2VA cuando una imagen suministrada deba ocupar el primer fotograma, el último fotograma o ambos. Elige Ref2VA cuando las fuentes deban guiar atributos o comportamiento sin servir como puntos finales fijos.
| Necesidad | Modo H3 recomendado | Motivo |
|---|---|---|
| Comenzar desde una imagen inicial | Checkpoint de FL2VA en modo I2VA de primer fotograma | La imagen proporcionada fija el estado inicial |
| Llegar a una imagen final proporcionada | Checkpoint de FL2VA en modo L2VA | El prompt describe la transición hasta el estado final |
| Restringir la primera y la última imagen | Checkpoint de FL2VA en modo de primer y último fotograma | Ambos puntos finales son explícitos. |
| Usar identidad, estilo, movimiento, cámara o sonido de varias fuentes | Ref2VA | Cada fuente puede recibir un rol de referencia diferente |
| Combinar roles de API de primer/último fotograma con roles de referencia en una solicitud | No compatible con una única solicitud de API | La API oficial trata estas familias de roles como mutuamente excluyentes. |
La referencia de la API Video Generation V2 separa los roles de fotograma inicial/final de los roles de medios de referencia. Una solicitud de API no puede combinar ambas familias.
Prepara solo referencias con un propósito claro
Cada referencia añade otra relación que H3 debe interpretar.
Usa este filtro de cinco comprobaciones antes de cargar:
- Permiso: Eres propietario del recurso o tienes permiso para usar la identidad, el metraje, el audio, la marca y la obra creativa.
- Relevancia: El archivo muestra claramente el atributo que quieres guiar.
- Claridad: El sujeto, movimiento, trayectoria de la cámara o evento de audio importante es fácil de identificar.
- Compatibilidad: El archivo cumple los límites actuales del flujo local o de la API que vas a usar.
- Prioridad: Puedes indicar qué recurso controla un atributo cuando otra fuente entra en conflicto.
Una foto de producto limpia suele guiar mejor la geometría que un collage recargado. Un clip de movimiento estable comunica mejor la intención de la cámara que un montaje rápido.
Planifica la toma antes de reunir las referencias. Esta guía de storyboard con IA ayuda a separar las decisiones de composición, acción y cámara antes de animar.
Límites oficiales de referencia H3
El repositorio H3 actual y la documentación del modelo de MiniMax enumeran estos límites locales de Ref2VA:
- Hasta 9 imágenes de referencia.
- Hasta 3 videos de referencia, cada uno de 2 a 15 segundos, con no más de 15 segundos en total.
- Hasta 3 clips de audio de referencia, cada uno de 2 a 15 segundos, con no más de 15 segundos en total.
- No más de 12 archivos multimedia locales mixtos Ref2VA en total.
- El audio de referencia debe acompañar a una imagen o video en el flujo de trabajo local. No puede ser la única entrada multimedia.
La API alojada requiere un prompt de texto que no esté vacío en cada solicitud. Su límite actual de cuerpo de solicitud es de 64 MB.
Las imágenes de referencia API pueden usar JPG, JPEG, PNG, WEBP, HEIC o HEIF. El video de referencia acepta MP4 o MOV, mientras que el audio de referencia acepta WAV o MP3.
Los requisitos de carga de API pueden cambiar, así que consulta la referencia actual de la API Video Generation V2 antes de enviar una solicitud.
MiniMax enumera ComfyUI como una opción de inferencia local. Las reglas de entrada locales y las reglas de solicitud de API alojadas pueden diferir.
Asigna una función principal clara a cada referencia
Crea una ficha de funciones de referencia antes de redactar el prompt. Asigna a cada archivo una función principal y, si hace falta, una función secundaria.
| Fuente o etiqueta | Funciones principales adecuadas | Lo que no garantiza |
|---|---|---|
<Subject N> | Persona, objeto, entorno, acción, pose, efecto o estilo reutilizable abstraído de fuentes | Bloqueo perfecto de la identidad o equivalencia con un archivo cargado aparte |
<Picture N> | Fotograma concreto, composición, referencia de storyboard, disposición espacial o referencia de iluminación | Movimiento completo, estructura temporal o retención de geometría perfecta. |
<Video N> | Edición de fuente, continuación, patrón de movimiento, trayectoria de cámara, cortes, ritmo o estructura temporal | Reemplazo garantizado, física exacta o copia píxel por píxel |
<Audio N> | Timbre de voz, ritmo, señal de diálogo, efecto de sonido, rasgos musicales, continuidad o reutilización directa del audio. | Sincronización labial garantizada o entrada local de Ref2VA solo con audio |
Aquí está el formato de la hoja de trabajo:
| ID del recurso | Tipo | ¿Derechos autorizados? | Función principal | Función secundaria | Conservar, transferir o cambiar | Intervalo de tomas | Verificación de conflicto o aceptación |
|---|---|---|---|---|---|---|---|
| Picture 1 | Imagen | Sí | Aspecto y etiqueta de la botella. | Color del material | Conserva la geometría y la tapa negra mate. | Todas las tomas | La etiqueta permanece orientada hacia el frente |
| Picture 2 | Imagen | Sí | Ambiente de invernadero | Paleta del amanecer | Transferir solo el entorno, no sus accesorios | Todas las tomas | No aparece ningún segundo producto |
| Video 1 | Video | Sí | Arco de cámara en el sentido de las agujas del reloj | ritmo lento | Transferir solo la ruta de la cámara | Toma 1 | La botella no hereda la forma de la fuente |
| Audio 1 | Audio | Sí | Textura de campanilla de cristal | Momento del sonido final | Referenciar la textura sin copiar la señal | Toma 2 | Una campanilla nítida después del clic de la tapa |
Los criterios de aceptación permiten revisar cada función por separado.
Para proyectos de producto, la guía de coherencia en videos de producto añade comprobaciones de geometría y etiquetas.
Resuelve los conflictos antes de redactar el prompt
Estas instrucciones no establecen una prioridad:
Use the silver cap from Picture 1 and the black cap from Picture 2. Keep both exact.
Esta versión asigna responsabilidad:
Picture 1 controls the bottle geometry, amber glass, matte-black cap, and label. Picture 2 controls only the greenhouse environment and dawn lighting; ignore the container shown in Picture 2.
Cuando una actuación de referencia importa más que su intérprete, establece ese límite explícitamente: Video 1 controla el movimiento y la cámara únicamente; ignora su intérprete y su entorno.
Usa correctamente las etiquetas Subject, Picture, Video y Audio
Mantén los números de etiquetas estables en las seis secciones.
Subject representa una abstracción
<Subject N> designa contenido visible reutilizable o editable, como una persona, producto, entorno, acción, pose, interfaz o estilo.
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
Picture representa un fotograma concreto o una referencia de planificación
Usa <Picture N> por separado cuando la imagen funcione como fotograma concreto o referencia de composición.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
Si una imagen solo define un Subject, cítala dentro de la definición de ese Subject.
Video describe una relación que afecta al video completo
Usa <Video N> para edición de la fuente, continuación, cámara, cortes, ritmo o estructura temporal. Las personas y los objetos extraídos aún necesitan etiquetas Subject.
Audio describe la señal y su función
Usa <Audio N> para la reutilización directa o referencia a voz, sincronización, ritmo, efectos o rasgos musicales. Los números de audio y video siguen siendo independientes.
Redacta las seis secciones de un plan completo de referencias para H3
La guía de referencia completa de MiniMax utiliza seis secciones en este orden:
subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music
La API alojada requiere texto, pero no exige que cada usuario redacte manualmente esta versión completa. H3-Context-IR puede procesar entradas multimodales de forma libre. Usa las seis secciones como un lenguaje de planificación preciso, no como un esquema de API obligatorio.
El siguiente ejemplo original aplica el formato documentado de MiniMax a una fotografía de producto ficticia.
Ficha de ejecución de ejemplo: Ref2VA · 8 segundos · 16:9 · tres imágenes · un video · una referencia de audio.
subject_definitions:
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
<Subject 2> is the greenhouse environment from <Picture 2>, with wet black-basalt surfaces, tall fern leaves, glass roof panels, and cold blue dawn light.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
<Video 1> provides the slow clockwise camera arc and measured pacing for [Shot 1], without providing product appearance.
<Audio 1> is the sound-texture reference for one clear glass chime heard after the cap click in [Shot 2].
summary:
[keyframe completion + reference generation + audio reference] The target video presents <Subject 1> inside <Subject 2>. It begins from the composition in <Picture 3>, follows the camera path from <Video 1>, and uses <Audio 1> only as a sound-texture reference for the final chime.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the square amber-glass body, matte-black cap, cream "NORTHLINE" label, and front-facing product identity are retained.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the wet basalt, fern leaves, glass roof, and cold blue dawn lighting are retained.
<Picture 3> ([Shot 1] first frame): fully_preserved - the opening bottle position, plinth angle, and right-side negative space are retained.
<Video 1> (camera path and pacing): partially_preserved - its slow clockwise arc and measured speed guide [Shot 1], while its source subjects and setting are excluded.
<Audio 1>: reference - its clean glass-chime texture guides one newly generated accent without copying the original signal.
detailed_description:
The target video uses a live-action cinematic product-film style with restrained movement and cool dawn lighting.
[Shot 1] The shot begins from <Picture 3>. <Subject 1>, the square amber-glass perfume bottle with a matte-black cap and cream "NORTHLINE" label, stands on the wet basalt plinth inside <Subject 2>. The camera follows the slow clockwise arc and measured pacing referenced from <Video 1>. Cold blue light enters from the right through the greenhouse roof. Water beads slide down the amber glass. Fern leaves move slightly behind the product. The bottle stays fixed, front-facing, and unchanged while the camera completes the arc. No second bottle, subtitle, or watermark appears.
[Shot 2] At 00:05.000, the camera cuts to a static close-up of <Subject 1>. A clean hand enters from the upper right, presses the matte-black cap down once, and releases it. The cap makes a dry click. A single newly generated glass chime follows, using the clear texture referenced from <Audio 1> without copying its signal. A narrow amber reflection crosses the cream "NORTHLINE" label from left to right. The hand exits. The bottle remains centered and readable through the final frame.
overall_soundscape:
Light rain taps on the glass roof throughout the video. Fern leaves brush softly in the background, while water drops strike the basalt and the cap produces one dry mechanical click.
non_diegetic_music:
N/A
El plan establece lo que cada fuente controla y excluye.
Convierte los roles de referencia en una línea de tiempo de tomas
Asigna roles por toma porque una referencia puede ser importante solo para una parte del clip.
Usa este orden para cada toma:
- Establece la composición actual y los sujetos activos.
- Nombra la referencia cuando comienza su influencia.
- Describe las acciones físicas y los cambios de estado.
- Indica el movimiento de cámara y el momento del corte.
- Coloca diálogo o sonido sincronizado en su evento.
- Termina con el estado que necesita la siguiente toma.
La primera toma no lleva marca de tiempo. En las tomas posteriores, usa [Shot N] At MM:SS.mmm, ... con tiempos de corte en orden ascendente. Si dos videos guían el movimiento, asigna el movimiento del cuerpo a uno y la cámara al otro.
Decide si el audio se copia o se usa como referencia
Elige el marcador de audio que coincida con la relación de señal deseada.
| Marcador | Significado en lenguaje sencillo |
|---|---|
fully_copy | Reutiliza todo el audio fuente como la pista de audio final completa |
partially_copy | Copia parte de la línea de tiempo o capas seleccionadas, con cambios en otros lugares |
reference | Genera nuevo audio guiado por timbre, ritmo, estilo, palabras, pulso o textura sonora. |
weak_reference | Mantén solo una categoría amplia o similitud atmosférica |
Cuando el audio guíe a un hablante objetivo, vincúlalo al mismo identificador estable (Sx) que se usa en detailed_description. Si solo transfieres el timbre, no copies el diálogo de origen al resultado.
Recuerda la restricción local: el audio no puede ser la única referencia multimedia para H3-Base-Ref2VA. Incluye una imagen o video.
Revisa el primer resultado con una rúbrica de aceptación
Clasifica cada función prevista como conservada, conservada en parte, ausente o en conflicto.
| Comprobación | Pregunta |
|---|---|
| Identidad | ¿La persona u objeto deseado sigue siendo reconocible en las tomas? |
| Apariencia | ¿Están presentes los colores, la ropa, el material, la etiqueta o el estilo mencionados? |
| Geometría | ¿El producto mantuvo su forma definitoria y las relaciones entre piezas? |
| Movimiento | ¿La acción solicitada sigue el camino y el ritmo previstos? |
| Cámara | ¿Utilizó la cámara la dirección solicitada sin heredar contenido fuente no deseado? |
| Tiempo | ¿Cada referencia comenzó y terminó en el intervalo de tomas previsto? |
| Sonido | ¿Se copió, se hizo referencia o se generó nuevamente el audio según lo planeado? |
| Conflictos | ¿Dos referencias compitieron por el mismo atributo? |
Revisa una relación a la vez. Si solo falla la cámara, aclara que Video 1 controla únicamente la cámara y excluye el producto de la fuente.
¿Por qué el H3 podría debilitar o ignorar una referencia?
Revisa las entradas oficiales y tu plan de funciones antes de atribuir el problema al modelo.
- La función no está explícita: Indica el sujeto exacto, el atributo, el intervalo de tomas y la relación prevista.
- Dos fuentes entran en conflicto: Elige qué recurso controla ese atributo y excluye la versión de la otra fuente.
- La fuente es irrelevante: Sustituye un archivo recargado o ambiguo por uno que muestre claramente la función prevista.
- El modo incorrecto está activo: Usa FL2VA para puntos finales fijos y Ref2VA para guía multimodal.
- El checkpoint está mal: El trabajo de referencia mixta local utiliza H3-Base-Ref2VA, no el checkpoint FL2VA.
- Los roles de API entran en conflicto: No mezcles roles de primer/último fotograma con roles de medios de referencia.
- Una entrada excede un límite: Vuelve a verificar los recuentos, duraciones, formatos, tamaños, dimensiones, frecuencias de fotogramas y tamaño del cuerpo de la solicitud.
- El prompt pide demasiado: Elimina las referencias de menor prioridad y prueba primero la relación principal.
La caché, la cuantificación, el recuento de pasos, los nodos y la VRAM pueden afectar una configuración local específica. Sus efectos varían según la configuración.
Cómo encajan 768p H3-Base y Regenerate-2K
H3-Base local produce video de 768p con audio estéreo nativo. La publicación incluye checkpoints de FL2VA y Ref2VA por separado.
El sistema completo también incluye H3-Context-IR y H3-Regenerate-2K alojados. Regenerate-2K utiliza el resultado de 768p más el contexto original para regenerar hasta 2K.
Regenerate-2K no es un reescalador convencional y no forma parte de la publicación actual de pesos abiertos. Por lo tanto, la descarga de Ref2VA por sí sola no proporciona el flujo de trabajo 2K local completo.
Preguntas frecuentes sobre Reference-to-Video en MiniMax H3
¿Cuál es la diferencia entre H3 FL2VA y Ref2VA?
FL2VA fija el primer fotograma, el último o ambos. Ref2VA asigna funciones de identidad, estilo, movimiento, cámara, temporización o sonido a imágenes, videos y audios de referencia.
¿Cuántos archivos de referencia admite H3-Base-Ref2VA en local?
La ficha del modelo admite hasta 9 imágenes, 3 videos y 3 audios, con un máximo de 12 archivos combinados. La duración total de los videos y la de los audios no pueden superar los 15 segundos.
¿El audio puede ser la única referencia en MiniMax H3?
No en el flujo local de Ref2VA documentado. El audio de referencia debe acompañar a una imagen o un video. La API alojada aplica reglas de solicitud distintas.
¿Necesito las seis secciones de Ref2VA para la API?
No. La API requiere texto, pero no obliga a enviar las seis secciones de forma manual. Esa estructura es un método preciso para planificar la solicitud.
¿H3 puede copiar el movimiento de un video de referencia?
El video puede guiar un patrón de movimiento, una trayectoria de cámara, el ritmo o la estructura temporal. Trátalo como una guía, no como una reproducción garantizada.
¿H3-Base-Ref2VA puede generar video 2K en local?
H3-Base genera 768p en local. La ruta oficial a 2K depende de la etapa alojada Regenerate-2K, que no forma parte de la publicación actual de pesos abiertos.
Planifica tu próxima prueba de Ref2VA con H3
Antes de tu próxima solicitud de Ref2VA, crea la ficha de funciones de referencia. Asigna una función principal a cada fuente y revisa el primer resultado según esa función.
MiniMax H3 ya está disponible en DomoAI a través de Omni Reference.



