Canvas Anvil

Maintenir la cohérence d'un personnage dans les images générées par IA

Comment garantir la cohérence visuelle d'un personnage à travers plusieurs images générées par IA ?

Maintenir la cohérence d'un personnage dans les images générées par IA

Vos personnages apparaissent différemment sur chaque image car les modèles de diffusion traitent chaque invite comme une nouvelle instance isolée, sans mémoire des sorties précédentes. Vous imposez la cohérence en contrôlant le chemin de génération, en fournissant des références visuelles et en rédigeant des descripteurs structurels qui ancrent les traits identitaires.

La cause racine : pourquoi les modèles de diffusion traitent chaque invite comme une nouvelle instance

Les modèles de diffusion ne possèdent pas d'état persistant. Lorsque vous générez une image, le modèle part d'un bruit aléatoire et suit un chemin déterminé par votre invite, la graine aléatoire et les poids internes du modèle. Si vous ne contrôlez pas ces variables, le modèle interprétera votre description de manière légèrement différente à chaque fois.

Le problème n'est pas que le modèle « oublie » votre personnage. C'est que le modèle n'a pas de concept de personnage en tant qu'entité persistante. Il ne sait que générer une image correspondant à une description textuelle. Si votre description est ambiguë, le modèle comble les lacunes avec ses propres biais statistiques. Si vous décrivez une « femme aux cheveux roux », une génération pourrait placer ses cheveux à gauche, une autre à droite, une autre encore pourrait changer entièrement la texture des cheveux. Le modèle n'est pas incohérent ; il est fidèle à une instruction vague.

Pour résoudre cela, vous devez passer de la description d'un personnage à la spécification d'un personnage. Cela nécessite trois leviers : la graine, l'image de référence et le descripteur structurel.

Les trois leviers de la cohérence : graine, image de référence et descripteurs structurels

La graine est le nombre aléatoire qui détermine le motif de bruit de départ. Si vous maintenez la graine fixe, le modèle suit le même chemin à travers l'espace de bruit. Cependant, si vous modifiez même légèrement l'invite, le chemin diverge. La graine seule ne suffit pas.

L'image de référence est un ancrage visuel. Vous fournissez une image du personnage et demandez au modèle de l'utiliser comme guide pour l'identité et le style. C'est plus puissant que le texte car cela contourne l'ambiguïté du langage. Le modèle peut voir la forme spécifique du nez, la coupe de la veste et la couleur des yeux.

Le descripteur structurel est une description précise et géométrique des traits identitaires du personnage. Au lieu de dire « cool », vous dites « lunettes asymétriques, lentille gauche fissurée, lentille droite intacte ». Cela donne au modèle une cible stable à viser.

Utilisation des valeurs de graine pour verrouiller le chemin de génération

Si vous utilisez un outil permettant de définir une valeur de graine, comme Midjourney ou Stable Diffusion, vous pouvez verrouiller le chemin de génération. Commencez par une graine qui produit une bonne image de base. Ensuite, maintenez cette graine fixe pendant que vous affinez votre invite. Cela garantit que les modifications de votre invite ne poussent pas le modèle à dériver vers une interprétation complètement différente.

Cependant, sachez que les graines sont fragiles. Si vous changez le ratio d'aspect, la version du modèle ou la structure de l'invite, la graine ne produira peut-être plus le même résultat. Traitez la graine comme un contrôle local, pas global. Elle fonctionne dans une fenêtre étroite de paramètres.

Mise en œuvre de workflows image-à-image pour l'affinement itératif

La méthode la plus fiable pour maintenir la cohérence est l'affinement itératif utilisant des workflows image-à-image. Vous commencez par une bonne image du personnage. Vous utilisez ensuite cette image comme référence pour la génération suivante. Vous ajustez l'invite pour changer la scène, la pose ou l'éclairage, tout en conservant les traits identitaires du personnage intacts.

Des outils comme Adobe Firefly, Krea et Runway sont utilisés pour ce type de tâche. Ils vous permettent de téléverser une image spécifique du personnage et de guider la nouvelle génération basée sur cette entrée visuelle. Lorsque vous utilisez ces outils, jugez la sortie sur la façon dont elle préserve les traits identitaires spécifiques qui vous importent : la forme du visage, le style des vêtements, la palette de couleurs. Si la sortie dérive, augmentez le poids de l'image de référence ou resserrez vos descripteurs structurels.

Rédaction de descripteurs structurels qui ancrent les traits identitaires

Votre invite doit contenir des descripteurs structurels impossibles à mal interpréter. Évitez les adjectifs subjectifs, tels que « beau », « cool » ou « mystérieux ». Au contraire, utilisez des descripteurs géométriques et spécifiques.

  • « Cheveux courts, coupés avec une frange droite » est meilleur que « cheveux courts ».
  • « Une veste en cuir avec un col haut et sans capuche » est meilleur que « une veste ».
  • « Des yeux écartés et légèrement baissés » est meilleur que « des yeux tristes ».

Ces descripteurs ancrent l'identité. Ils donnent au modèle une cible stable. Si vous utilisez Stable Diffusion ou ComfyUI, vous pouvez combiner ces descripteurs avec l'entraînement LoRA sur des jeux de données de personnages spécifiques. Cela permet au modèle d'apprendre les traits visuels spécifiques de votre personnage et de les appliquer de manière cohérente à travers différentes scènes.

Erreurs courants : sur-dépendance aux noms vs sous-spécification de la géométrie

L'erreur la plus courante est de dépendre d'un nom. Si vous nommez votre personnage « Alice », le modèle n'a aucune idée de qui est Alice. Il générera une femme générique. Le nom est sans signification pour le modèle.

La deuxième erreur est la sous-spécification de la géométrie. Si vous dites « une femme aux yeux bleus », le modèle variera la forme des yeux, la taille des pupilles et l'angle du regard. Vous devez spécifier la géométrie : « yeux en amande avec un léger plissement de la paupière supérieure ».

Ne confondez pas identité et style. L'identité est le noyau stable : le visage, les cheveux, le type de corps. Le style est la variable : l'éclairage, l'arrière-plan, la pose. Votre invite doit séparer ces deux éléments. Les traits identitaires doivent être décrits avec précision. Les caractéristiques de style peuvent être laissées plus ouvertes.

Workflow : générer une fiche personnage avant la création de scène

Avant de créer toute scène, générez une fiche personnage. C'est un ensemble d'images montrant votre personnage sous plusieurs angles : face, profil, dos et gros plan. Utilisez une graine fixe et une image de référence fixe pour générer ceux-ci. Affinez les invites jusqu'à ce que la fiche personnage soit cohérente.

Une fois que vous avez une fiche personnage cohérente, utilisez-la comme référence pour toutes les générations ultérieures. Lorsque vous créez une scène, vous utiliserez l'image de la fiche personnage comme entrée de référence. Vous ajusterez l'invite pour décrire la scène, mais vous maintiendrez les traits identitaires ancrés par les descripteurs structurels.

Ce workflow est applicable à travers les outils. Que vous utilisiez Leonardo.ai pour ses capacités d'entraînement de modèle ou DALL-E 3 pour l'ingénierie d'invite détaillée, le principe est le même : établir l'identité d'abord, puis varier la scène. Si vous sautez la fiche personnage, vous passerez plus de temps à corriger les incohérences qu'à créer du contenu.

Le guide payant, The AI Creative Workflow Guide, est destiné aux concepteurs et créateurs de médias qui ont déjà décidé d'utiliser des outils IA et ont besoin d'une méthode systématique pour maintenir la cohérence dans leur travail. Il ne s'adresse pas à ceux qui cherchent une solution rapide ou un bouton magique. Si vous vous attendez à générer des personnages parfaits sans fournir le travail nécessaire pour les spécifier, n'achetez pas.

Advertisement
Advertisement