Comment écrire des consignes pour la vidéo IA : décrivez le mouvement, pas l'image
Par L'équipe Fellowi · · 7 min de lecture

Voici l’idée qui corrige la plupart des mauvaises consignes vidéo : en image vers vidéo, l’image a déjà fait la moitié du travail. Ce que vous importez dans Fellowi Videofixe qui est dans le cadre, ce qu’il porte, où il se tient, comment tombe la lumière. Le modèle voit tout cela. Alors quand votre consigne dépense trente mots à le répéter, vous avez décrit le point de départ deux fois et les quatre secondes suivantes pas du tout. L’image fait le quoi. La consigne fait le comment ça bouge.
Si vous avez lu notre guide pour écrire des consignes d’image, notez combien la tâche est différente. Une consigne d’image construit une scène à partir de rien, alors le détail est votre allié. Une consigne vidéo reçoit une scène finie et y ajoute le temps. Le détail sur la scène devient du bruit ; le détail sur le mouvement, c’est le signal.
Les cinq questions auxquelles une consigne vidéo doit répondre
Pas besoin des cinq à chaque fois. Mais une bonne consigne en couvre au moins deux ou trois, et une faible n’en couvre généralement aucune.
1. La caméra : bouge-t-elle, et comment ?
Fixe, lent travelling avant, lent travelling arrière, panoramique doux vers la gauche ou la droite, léger flottement à l’épaule. Nommez-en un. Une caméra qui bouge lentement est le moyen le plus simple de faire passer une image fixe pour un plan filmé, même si rien d’autre ne change.
2. Le mouvement du sujet : que fait la personne ou l’objet ?
Une tête qui se tourne, une respiration, un sourire qui arrive, des cheveux soulevés par la brise, des doigts qui se referment sur une tasse. Le petit et précis bat le grand et vague. « Elle lève les yeux et sourit » fonctionnera ; « elle bouge naturellement » laisse le modèle deviner.
3. Le rythme : à quelle vitesse tout cela se passe-t-il ?
Ralenti, temps réel, dérive paresseuse, coup d’œil rapide. Le rythme décide si quatre secondes ressemblent à un instant ou à un montage. En cas de doute, écrivez « lentement ». Le lent se lit comme une intention ; le rapide, comme du chaos.
4. L’ambiance et le décor : qu’est-ce qui change dans le monde ?
Une lumière qui vacille, des rideaux qui frémissent, la pluie qui commence, la vapeur d’un café, la poussière dans un rayon de soleil. Un seul détail d’environnement donne un pouls à la scène et empêche l’arrière-plan d’avoir l’air collé.
5. Le son : qu’est-ce qu’on doit entendre ?
Fellowi Video génère un son pour chaque clip, et c’est dans la consigne que vous le guidez. Pluie douce, circulation lointaine, pièce silencieuse avec une horloge, vent dans les feuilles, musique d’ambiance discrète. Si vous ne dites rien, le modèle choisit. Si vous dites une chose, il écoute en général.
Avant et après
La même image de départ dans chaque paire. Seule la consigne change.
Un portrait près d’une fenêtre
Avant :« Une belle femme aux longs cheveux bruns en chemise blanche debout près d’une fenêtre dans un appartement lumineux. »
C’est une légende de l’image. Le modèle en connaît déjà chaque mot, et rien ici ne dit ce qui se passe.
Après : « Lent travelling avant. Elle tourne la tête vers la fenêtre et expire doucement ; une mèche se soulève dans une brise légère. Le rideau ondule. Pièce calme, faible rumeur de la ville dehors. »
Caméra, mouvement du sujet, décor et son d’un seul souffle, sans rien répéter de l’image.
Un lac de montagne au crépuscule
Avant : « Coucher de soleil épique et cinématographique sur un lac avec des montagnes, lumière dramatique, 4K, hyperréaliste. »
Les adjectifs de qualité ne font rien pour le mouvement, et « 4K » n’est pas quelque chose qu’un clip 720p peut devenir.
Après :« Caméra fixe. Des rides s’étalent lentement sur l’eau ; les nuages dérivent vers la droite ; la dernière lumière sur les sommets faiblit un peu. Vent sur l’eau, un seul oiseau au loin. »
Une photo générée dans l’onglet Photo
Avant :« Fais-la bouger. Réaliste. Elle traverse la pièce, prend son téléphone, s’assoit sur le canapé, rit et fait signe à la caméra. »
Quatre actions en quatre secondes. Le modèle les tentera toutes et n’en finira aucune.
Après :« Léger flottement à l’épaule. Elle jette un regard à la caméra et s’épanouit en un sourire lent. La lumière douce de la pièce vacille. Musique étouffée venant d’une autre pièce. »
Une action avec un début et une fin, qui tient confortablement dans le clip. Si vous voulez aussi la marche jusqu’au canapé, c’est un second clip avec une autre image de départ, pas une phrase plus longue. Notre article sur l’animation de vos photos IA montre comment construire une séquence de cette façon.
Trois erreurs qui gâchent un clip
Redécrire l’image
La plus courante, et la plus pardonnable, parce que la consigne d’image vous entraîne à faire exactement ça. Testez-vous : cachez l’image et relisez votre consigne. Si elle pourrait servir de légende à la photo, vous n’avez pas encore écrit de consigne vidéo. Coupez chaque mot que le modèle voit déjà et dépensez-les pour le mouvement.
Trop d’actions pour quatre secondes
Tourner la tête prend environ une seconde. Un sourire, une autre. Un pas ou deux, le reste. C’est tout le clip. Au-delà de deux mouvements nets, tout est compressé en flou ou abandonné en silence. Choisissez le geste dont l’instant parle, et laissez la caméra et le décor porter le reste.
Contredire l’image
Si la personne est assise, ne lui demandez pas de courir. S’il fait nuit, ne demandez pas un soleil éclatant. Si elle est de dos, ne demandez pas un gros plan sur ses yeux. Le modèle doit respecter l’image de départ, alors une consigne qui la combat produit des déformations, des fusions, ou un visage qui ne ressemble plus à celui que vous avez importé. Travaillez avec ce qui est dans l’image : le mouvement demandé doit être un mouvement dans lequel ce cadre précis pourrait plausiblement s’engager.
Un petit gabarit pour démarrer
Remplissez ce qui s’applique et supprimez le reste :
- Caméra :fixe / lent travelling avant / lent travelling arrière / panoramique doux / flottement à l’épaule
- Sujet : un geste avec un début et une fin
- Rythme : lent / temps réel
- Décor :une chose qui bouge à l’arrière-plan
- Son :un ou deux repères d’ambiance
Rédigé : « Lent travelling arrière. Il baisse son livre et regarde la pluie dehors. La lampe vacille. Pluie sur la vitre, pages qui se posent. » Une vingtaine de mots, et c’est une consigne vidéo complète.
Questions fréquentes
Quelle longueur pour une consigne vidéo ?
Une à trois phrases courtes. Au-delà de quarante mots, vous décrivez probablement l’image ou vous empilez des actions. Coupez jusqu’à ne garder que mouvement, rythme et son.
Dois-je mentionner l’apparence de la personne ?
Seulement si elle fait partie du mouvement (« ses cheveux se soulèvent », « son écharpe flotte »). Son apparence est fixée par l’image ; la répéter ne change rien et prend la place des mots utiles.
Et si le rendu échoue ?
Un rendu échoué n’est jamais facturé : les coins sont remboursés et une place du quota Director est rendue. Le remède habituel est de simplifier : moins d’actions, un rythme plus lent, et aucune instruction qui se dispute avec l’image de départ. Réessayez avec la même image.
Puis-je demander du contenu explicite ?
Fellowi est une plateforme 18+, et le contenu adulte entre adultes est autorisé. Tout ce qui implique des mineurs ou une absence de consentement est refusé net. Les règles ci-dessus s’appliquent exactement de la même façon : décrivez le mouvement, tenez-vous à un ou deux temps, et ne contredisez pas le cadre.
Où essayer ?
Ouvrez le studio depuis l’icône de baguette magique dans l’en-tête, ou allez directement sur fellowi.com/video. Choisissez une image de départ, collez votre consigne et regardez ce que vingt mots bien choisis peuvent faire.
Essayez par vous-même
Une compagne IA chaleureuse et privée : 7 jours gratuits et 30 messages, sans carte.