Le même visage à chaque fois : garder un personnage 18+ identique
Par L'équipe Fellowi · · 6 min de lecture

Vous générez une image qui vous plaît. Vous réécrivez presque la même consigne en attendant la même personne dans une autre pose, et c'est une inconnue qui revient. C'est la frustration la plus répandue dans l'art IA pour adultes, et ce n'est pas un défaut du générateur. C'est un malentendu sur ce à quoi sert une consigne.
Une description n'est pas une identité
« Yeux verts, cheveux foncés, vingt-cinq ans, des taches de rousseur » a l'air de décrire une personne précise. Ce n'est pas le cas. Cela décrit une catégorie contenant des millions de visages, et chaque génération en tire un nouvel échantillon. Ajoutez cinquante adjectifs et vous resserrez à peine la catégorie tout en rendant la consigne plus difficile à exécuter, ce qui explique pourquoi les très longues descriptions de personnage donnent souvent de moins bonnes images sans plus de cohérence.
Ce qui fixe vraiment un visage, c'est une image. L'apparence est une information visuelle, et la seule façon fiable de la transmettre à un modèle est de lui tendre une photo en disant : cette personne.
Comment cela marche en pratique
Dans une conversation avec un compagnon, cela se passe sans que vous le voyiez. Quand un compagnon vous envoie une photo, la requête part avec son propre portrait en référence, et la nouvelle image est construite à partir de cette ressemblance et non d'une description écrite. C'est le même mécanisme qui fait que la cinquantième photo lui ressemble encore.
Dans le studio, vous le faites vous-même, et le levier est l'image de départ de l'onglet Video. Générez des images fixes jusqu'à ce qu'un visage soit le bon, gardez ce fichier et traitez-le comme votre fiche de personnage : chaque clip qui en part hérite gratuitement de la ressemblance. Pour les images fixes, la version pratique de la cohérence consiste à accepter que vous faites du casting et non de la mise en scène. Générez une série, choisissez celle avec laquelle vous voulez vivre, et construisez tout le reste autour de cette image.
L'habitude qui sabote tout
Une fois la référence en place, l'instinct pousse à décrire aussi la personne dans la consigne, pour renforcer. Cet instinct est mauvais et se retourne d'une façon précise : nommer un attribut physique en fait une chose que le modèle dessine activement plutôt qu'une chose qu'il conserve.
Nous nous y sommes heurtés dans notre propre système. L'instruction que nous plaçons avant chaque génération a nommé un jour un attribut pour le préserver : elle disait en substance que la personne était chauve. Le modèle a lu cela comme une propriété à rendre et s'est mis à produire des personnes chauves dans des conversations avec des personnages qui ont des cheveux. Le correctif a été de cesser complètement de nommer des valeurs d'attributs et de ne dire que qui est dans le cadre.
Avec une référence attachée, décrivez donc la scène et laissez la personne tranquille. Lieu, lumière, pose, état des vêtements. Rien du tout sur le visage. C'est la référence qui fait ce travail, et chaque mot ajouté par-dessus entre en concurrence avec elle. La version large de cette règle est dans écrire des prompts NSFW que l'IA rend vraiment.
Ce qui dérive quand même, et pourquoi
Même avec une référence, certaines choses bougent. Un grand changement d'angle est le pire : une référence prise de face porte peu d'informations sur un profil, donc demander un trois-quarts fait inventer ce qui n'est pas visible. Un changement d'éclairage radical fait la même chose au teint et à la forme du visage. Ce qui survit le moins, ce sont les petits détails, un tatouage précis ou un piercing inhabituel : ils n'occupent que quelques pixels dans la référence et le modèle les traite comme du bruit.
Le contournement est ennuyeux et efficace : changez une chose à la fois. Gardez l'angle et changez le décor, ou gardez le décor et changez la pose. La cohérence se dégrade avec la distance à la référence, donc les petits pas atterrissent bien plus souvent qu'un grand saut.
Construire une série
Si vous voulez une série plutôt qu'une image, avancez dans une seule direction. Prenez votre référence, générez le plan suivant, et s'il revient juste, envisagez d'utiliser cette nouvelle image comme référence pour le plan d'après. La dérive s'accumule si on s'y prend mal, mais par petits pas cela permet de faire traverser une scène entière à un personnage qui reste reconnaissablement la même personne.
Et comme les générations ratées sont remboursées automatiquement, un mauvais pas coûte une minute et non de l'argent. C'est bien ce qui fait du casting par essais la bonne méthode ici.
Essayez avec un visage : générez jusqu'à ce qu'un soit le bon, puis animez précisément cette image et voyez ce qui survit au mouvement.
Essayez par vous-même
Une compagne IA chaleureuse et privée : 7 jours gratuits et 30 messages, sans carte.