La génération vidéo par référence dans MiniMax H3 fonctionne mieux lorsque chaque source a un rôle précis. Utilisez une image pour l’apparence ou la composition, une vidéo pour le mouvement ou la caméra, et un fichier audio pour un signal sonore. Indiquez ensuite ce que H3 doit conserver, transférer, modifier ou traiter comme une référence générale.
Un même fichier peut fournir plusieurs sujets ou attributs. La règle « un rôle par source » fixe une responsabilité principale pour chaque fichier. Il s’agit d’une méthode de planification, pas d’une limite technique à un seul fichier.
Qu’est-ce que Reference-to-Video dans MiniMax H3 ?
Reference-to-Video, ou Ref2VA, associe du texte à des images, vidéos ou fichiers audio de référence pour guider un nouveau clip audiovisuel. Chaque source peut définir l’identité, l’apparence, le style, le mouvement, la caméra, le timing, la voix, les effets sonores ou la musique.
H3 ne traite pas chaque fichier comme une image vidéo. Une image fixe peut définir l’apparence, une vidéo peut guider la caméra et un fichier audio peut orienter le timbre.
Le guide officiel de MiniMax sur les prompts avec références complètes formalise ces relations à l’aide d’étiquettes, de marqueurs de conservation et d’un plan en six sections.
Ce format décrit les relations visées, sans garantir une identité exacte, un comportement physique précis, la synchronisation labiale, le timing, le texte ni une reproduction pixel par pixel.
Ref2VA ou FL2VA : quel mode H3 choisir ?
Choisissez FL2VA lorsqu’une image fournie doit servir de première image, de dernière image ou des deux. Choisissez Ref2VA lorsque les sources doivent guider des attributs ou un comportement sans constituer des points de départ ou d’arrivée fixes.
| Besoin | Mode H3 recommandé | Pourquoi |
|---|---|---|
| Commencer à partir d’une image initiale | Checkpoint FL2VA en mode I2VA de première image | L’image fournie fixe l’état initial |
| Atteindre une image finale fournie | Checkpoint FL2VA en mode L2VA | Le prompt décrit la transition vers l’état final |
| Contraindre la première et la dernière image | Checkpoint FL2VA en mode première et dernière image | Les deux points de terminaison sont explicites |
| Utiliser l'identité, le style, le mouvement, la caméra ou le son provenant de plusieurs sources | Ref2VA | Chaque source peut recevoir un rôle de référence différent |
| Mélanger des rôles API de première/dernière image avec des rôles de référence dans une même demande | Non pris en charge dans une seule demande API | L'API officielle traite ces familles de rôles comme s'excluant mutuellement |
La documentation de l’API Video Generation V2 sépare les rôles de première/dernière image des rôles de médias de référence. Une même demande API ne peut pas combiner ces familles.
Préparez uniquement des références qui ont un objectif clair
Chaque référence ajoute une autre relation que H3 doit interpréter.
Utilisez ce filtre à cinq vérifications avant le téléchargement :
- Autorisation : Vous possédez le fichier ou avez l’autorisation d’utiliser l’identité, les images, l’audio, la marque et l’œuvre créative.
- Pertinence : Le fichier montre clairement l'attribut que vous souhaitez guider.
- Clarté : Le sujet, le mouvement, le trajet de la caméra ou l'événement audio important est facile à identifier.
- Compatibilité : Le fichier respecte les limites actuelles du flux local ou de l’API que vous utilisez.
- Priorité : Vous pouvez préciser quelle source contrôle un attribut lorsque deux sources se contredisent.
Un packshot propre guide généralement mieux la géométrie qu’un collage chargé. Un clip de mouvement stable communique mieux l’intention de la caméra qu’un montage rapide.
Planifiez le plan avant de rassembler les références. Ce guide du storyboard IA aide à distinguer les décisions de composition, d’action et de caméra avant l’animation.
Limites de référence officielles H3
Le référentiel H3 actuel de MiniMax et la documentation du modèle répertorient ces limites Ref2VA locales :
- Jusqu'à 9 images de référence.
- Jusqu'à 3 vidéos de référence, chacune d'une durée de 2 à 15 secondes, sans dépasser 15 secondes au total.
- Jusqu'à 3 clips audio de référence, chacun d'une durée de 2 à 15 secondes, sans dépasser 15 secondes au total.
- Pas plus de 12 fichiers multimédias Ref2VA locaux mixtes au total.
- L'audio de référence doit accompagner une image ou une vidéo dans le flux de travail local. Il ne peut pas constituer le seul média d’entrée.
L'API hébergée nécessite un prompt de texte non vide dans chaque demande. Sa limite actuelle de corps de demande est de 64 Mo.
Les images de référence API peuvent utiliser JPG, JPEG, PNG, WEBP, HEIC ou HEIF. La vidéo de référence accepte MP4 ou MOV, tandis que l'audio de référence accepte WAV ou MP3.
Les exigences de téléchargement de l'API peuvent changer, alors consultez la documentation actuelle de l’API Video Generation V2 avant de soumettre une demande.
MiniMax répertorie ComfyUI comme une option d'inférence locale. Les règles de saisie locales et les règles de demande d'API hébergée peuvent différer.
Attribuez un rôle principal clair à chaque référence
Créez une fiche des rôles de référence avant de rédiger le prompt. Attribuez à chaque fichier un rôle principal et, si nécessaire, un rôle secondaire.
| Source ou étiquette | Rôles principaux adaptés | Ce que cela ne garantit pas |
|---|---|---|
<Subject N> | Personne, objet, environnement, action, pose, effet ou style réutilisables extraits des sources | Verrouillage parfait de l’identité ou équivalence avec un fichier importé séparément |
<Picture N> | Image précise, composition, repère de storyboard, disposition spatiale ou ancre d'éclairage | Mouvement complet, structure temporelle ou rétention parfaite de la géométrie |
<Video N> | Montage source, suite, modèle de mouvement, chemin de caméra, coupes, rythme ou structure temporelle | Remplacement garanti, physique exacte ou copie pixel par pixel |
<Audio N> | Timbre de voix, rythme, signal de dialogue, effet sonore, traits musicaux, continuité ou réutilisation audio directe | Synchronisation labiale garantie ou entrée Ref2VA locale uniquement audio |
Voici le format de la feuille de travail :
| ID du fichier | Type | Droits obtenus ? | Rôle principal | Rôle secondaire | Conserver, transférer ou modifier | Plage de plans | Vérification de conflit ou d’acceptation |
|---|---|---|---|---|---|---|---|
| Picture 1 | Image | Oui | Aspect et étiquette de la bouteille | Couleur du matériau | Conserver la géométrie et le capuchon noir mat | Tous les plans | L'étiquette reste orientée vers l'avant |
| Picture 2 | Image | Oui | Environnement de serre | Palette de l'aube | Transférer uniquement le décor, pas ses accessoires | Tous les plans | Aucun deuxième produit n'apparaît |
| Video 1 | Vidéo | Oui | Arc de caméra dans le sens des aiguilles d'une montre | Rythme lent | Transférer le chemin de la caméra uniquement | Plan 1 | La bouteille ne reprend pas la forme de la source |
| Audio 1 | Audio | Oui | Texture de carillon en verre | Timing du son final | Référencer la texture sans copier le signal | Plan 2 | Un carillon net après le clic du capuchon |
Les critères d’acceptation permettent de vérifier chaque rôle séparément.
Pour les projets de produit, le guide de cohérence produit-vidéo ajoute des vérifications de géométrie et d’étiquettes.
Résolvez les conflits avant de rédiger le prompt
Cette consigne ne définit aucune priorité :
Use the silver cap from Picture 1 and the black cap from Picture 2. Keep both exact.
Cette version attribue la responsabilité :
Picture 1 controls the bottle geometry, amber glass, matte-black cap, and label. Picture 2 controls only the greenhouse environment and dawn lighting; ignore the container shown in Picture 2.
Lorsqu'une performance de référence compte plus que son interprète, indiquez explicitement cette limite : Video 1 contrôle uniquement le mouvement et la caméra ; ignorez son interprète et son cadre.
Utilisez correctement les étiquettes Subject, Picture, Video et Audio
Gardez les numéros d’étiquette stables dans les six sections.
Subject représente une abstraction
<Subject N> désigne un élément visible réutilisable ou modifiable, tel qu'une personne, un produit, un environnement, une action, une pose, une interface ou un style.
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
Picture représente une image concrète ou un repère de composition
Utilisez <Picture N> seul lorsque l’image sert de cadre concret ou de repère de composition.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
Si une image définit uniquement un Subject, citez-la dans la définition de ce Subject.
Video décrit une relation qui porte sur l’ensemble de la vidéo
Utilisez <Video N> pour le montage de la source, la suite, la caméra, les coupes, le rythme ou la structure temporelle. Les personnes et objets extraits ont toujours besoin d’étiquettes Subject.
Audio décrit le signal et son rôle
Utilisez <Audio N> pour une réutilisation directe ou une référence à la voix, au timing, au rythme, aux effets ou aux caractéristiques musicales. Les numéros Audio et Vidéo restent indépendants.
Rédigez les six sections d’un plan complet de références pour H3
Le guide de référence complet de MiniMax utilise six sections dans cet ordre :
subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music
L'API hébergée nécessite du texte, mais elle n'exige pas que chaque utilisateur rédige manuellement cette réécriture complète. H3-Context-IR peut traiter une entrée multimodale de forme libre. Utilisez les six sections comme langage de planification précis, et non comme schéma API brut obligatoire.
L'exemple original ci-dessous applique le format documenté de MiniMax à une photo de produit fictif.
Exemple de fiche d’exécution : Ref2VA · 8 secondes · 16:9 · trois images · une vidéo · une référence audio.
subject_definitions:
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
<Subject 2> is the greenhouse environment from <Picture 2>, with wet black-basalt surfaces, tall fern leaves, glass roof panels, and cold blue dawn light.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
<Video 1> provides the slow clockwise camera arc and measured pacing for [Shot 1], without providing product appearance.
<Audio 1> is the sound-texture reference for one clear glass chime heard after the cap click in [Shot 2].
summary:
[keyframe completion + reference generation + audio reference] The target video presents <Subject 1> inside <Subject 2>. It begins from the composition in <Picture 3>, follows the camera path from <Video 1>, and uses <Audio 1> only as a sound-texture reference for the final chime.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the square amber-glass body, matte-black cap, cream "NORTHLINE" label, and front-facing product identity are retained.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the wet basalt, fern leaves, glass roof, and cold blue dawn lighting are retained.
<Picture 3> ([Shot 1] first frame): fully_preserved - the opening bottle position, plinth angle, and right-side negative space are retained.
<Video 1> (camera path and pacing): partially_preserved - its slow clockwise arc and measured speed guide [Shot 1], while its source subjects and setting are excluded.
<Audio 1>: reference - its clean glass-chime texture guides one newly generated accent without copying the original signal.
detailed_description:
The target video uses a live-action cinematic product-film style with restrained movement and cool dawn lighting.
[Shot 1] The shot begins from <Picture 3>. <Subject 1>, the square amber-glass perfume bottle with a matte-black cap and cream "NORTHLINE" label, stands on the wet basalt plinth inside <Subject 2>. The camera follows the slow clockwise arc and measured pacing referenced from <Video 1>. Cold blue light enters from the right through the greenhouse roof. Water beads slide down the amber glass. Fern leaves move slightly behind the product. The bottle stays fixed, front-facing, and unchanged while the camera completes the arc. No second bottle, subtitle, or watermark appears.
[Shot 2] At 00:05.000, the camera cuts to a static close-up of <Subject 1>. A clean hand enters from the upper right, presses the matte-black cap down once, and releases it. The cap makes a dry click. A single newly generated glass chime follows, using the clear texture referenced from <Audio 1> without copying its signal. A narrow amber reflection crosses the cream "NORTHLINE" label from left to right. The hand exits. The bottle remains centered and readable through the final frame.
overall_soundscape:
Light rain taps on the glass roof throughout the video. Fern leaves brush softly in the background, while water drops strike the basalt and the cap produces one dry mechanical click.
non_diegetic_music:
N/A
Le plan indique ce que chaque source contrôle et exclut.
Transformez les rôles de référence en une chronologie de prise de vue
Attribuez des rôles par plan, car une référence peut n'avoir d'importance que pour une partie du clip.
Utilisez cet ordre pour chaque prise de vue :
- Établissez la composition actuelle et les sujets actifs.
- Nommez la référence lorsque son influence commence.
- Décrivez l’action physique et les changements d’état.
- Indiquez le mouvement de la caméra et le moment de la coupe.
- Placez un dialogue ou un son synchronisé lors de son événement.
- Terminez sur l’état nécessaire au plan suivant.
Le premier plan ne comporte pas d’horodatage. Pour les plans suivants, utilisez [Shot N] At MM:SS.mmm, ... avec des temps de coupe croissants. Si deux vidéos guident le mouvement, attribuez le mouvement du corps à l’une et la caméra à l’autre.
Décidez si l'audio est copié ou référencé
Choisissez le marqueur audio qui correspond à la relation de signal souhaitée.
| Marqueur | Signification en langage simple |
|---|---|
fully_copy | Réutilisez l’intégralité de l’audio source comme piste audio finale complète |
partially_copy | Copiez une partie de la timeline ou certains calques, puis modifiez le reste |
reference | Générez un nouvel audio guidé par le timbre, le rythme, le style, les mots, la pulsation ou la texture sonore |
weak_reference | Ne conserver que la catégorie générale ou la similarité atmosphérique |
Lorsque l’audio guide un locuteur cible, associez-le au même identifiant stable (Sx) que dans detailed_description. Si seul le timbre est transféré, ne copiez pas le dialogue source dans la sortie.
N’oubliez pas la restriction locale : l'audio ne peut pas être la seule référence média pour H3-Base-Ref2VA. Incluez une image ou une vidéo.
Évaluez le premier résultat avec une seule grille d’acceptation
Classez chaque rôle prévu comme conservé, partiellement conservé, absent ou en conflit.
| Critère | Question |
|---|---|
| Identité | La personne ou l’objet visé reste-t-il reconnaissable à travers ses prises de vue ? |
| Apparence | Les couleurs, vêtements, matériaux, étiquettes ou styles nommés sont-ils présents ? |
| Géométrie | Le produit a-t-il conservé sa forme et ses relations entre les pièces ? |
| Mouvement | L’action demandée suit-elle le chemin et le rythme prévus ? |
| Caméra | La caméra a-t-elle utilisé la direction demandée sans hériter du contenu source indésirable ? |
| Timing | Chaque référence a-t-elle commencé et cessé d’agir dans la plage de plans prévue ? |
| Son | L'audio a-t-il été copié, référencé ou nouvellement généré comme prévu ? |
| Conflits | Deux références sont-elles en compétition pour le même attribut ? |
Révisez une relation à la fois. Si seule la caméra pose problème, précisez que Video 1 contrôle uniquement la caméra et excluez le produit de la source.
Pourquoi H3 pourrait-il affaiblir ou ignorer une référence ?
Vérifiez les entrées officielles et votre plan de rôles avant d’attribuer le problème au modèle.
- Le rôle n’est pas explicite : Nommez le sujet exact, l'attribut, la plage de prise de vue et la relation souhaitée.
- Deux sources s'opposent : Choisissez quel fichier contrôle cet attribut et excluez la version de l’autre source.
- La source n'a aucune importance : Remplacez un fichier surchargé ou ambigu par un autre qui montre clairement le rôle visé.
- Le mauvais mode est actif : Utilisez FL2VA pour les points finaux fixes et Ref2VA pour le guidage multimodal.
- Le checkpoint est erroné : Le travail local de référence mixte utilise H3-Base-Ref2VA, et non le checkpoint FL2VA.
- Les rôles de l'API sont en conflit : Ne mélangez pas les rôles de première/dernière image avec les rôles de support de référence.
- Une entrée dépasse une limite : Revérifiez le nombre, les durées, les formats, les tailles, les dimensions, les fréquences d'images et la taille du corps de la demande.
- Le prompt en demande trop : Supprimez les références de priorité inférieure et testez d’abord la relation principale.
Le cache, la quantification, le nombre de pas, les nœuds et la VRAM peuvent affecter une configuration locale spécifique. Leurs effets varient selon la configuration.
Comment H3-Base en 768p et Regenerate-2K s’articulent
H3-Base en local produit une vidéo 768p avec un audio stéréo natif. La version publique comprend des checkpoints FL2VA et Ref2VA distincts.
Le système complet comprend également H3-Context-IR et H3-Regenerate-2K hébergés. Regenerate-2K utilise le résultat 768p ainsi que le contexte d'origine pour régénérer jusqu'à 2K.
Regenerate-2K n'est pas un upscaler conventionnel, et il ne figure pas dans la publication actuelle des poids ouverts. Le téléchargement de Ref2VA seul ne fournit donc pas le flux de travail 2K local complet.
FAQ sur Reference-to-Video dans MiniMax H3
Quelle est la différence entre H3 FL2VA et Ref2VA ?
FL2VA fixe la première image, la dernière ou les deux. Ref2VA attribue des rôles d’identité, de style, de mouvement, de caméra, de temps ou de son aux images, vidéos et fichiers audio de référence.
Combien de fichiers de référence H3-Base-Ref2VA accepte-t-il en local ?
La fiche du modèle indique jusqu’à 9 images, 3 vidéos et 3 fichiers audio, avec un maximum de 12 fichiers mixtes. La durée totale des vidéos et celle des fichiers audio ne peuvent chacune dépasser 15 secondes.
L’audio peut-il être la seule référence dans MiniMax H3 ?
Pas dans le flux Ref2VA local documenté. L’audio de référence doit accompagner une image ou une vidéo. L’API hébergée applique des règles de demande distinctes.
Ai-je besoin des six sections Ref2VA pour l’API ?
Non. L’API exige du texte, mais n’impose pas de soumettre manuellement les six sections. Cette structure est une méthode de planification précise.
H3 peut-il copier le mouvement d’une vidéo de référence ?
La vidéo peut guider un schéma de mouvement, une trajectoire de caméra, un rythme ou une structure temporelle. Considérez-la comme un guide, pas comme la garantie d’une reproduction exacte.
H3-Base-Ref2VA peut-il générer une vidéo 2K en local ?
H3-Base génère du 768p en local. La chaîne officielle vers le 2K dépend de l’étape hébergée Regenerate-2K, absente de la publication actuelle des poids ouverts.
Préparez votre prochain test Ref2VA avec H3
Avant votre prochaine demande Ref2VA, créez la fiche des rôles de référence. Attribuez un rôle principal à chaque source, puis évaluez le premier résultat selon ce rôle.
MiniMax H3 est désormais disponible dans DomoAI via Omni Reference.



