Garder ton perso cohérent entre images et vidéo IA : workflow FLUX.2 et Kling
18 septembre 2026 • 9 min de lecture
Dernière mise à jour le 18 septembre 2026
La cohérence du personnage s’améliore quand tu arrêtes de demander à un seul prompt de recréer quelqu’un de mémoire. Construis d’abord une image de référence validée. Réutilise-la en ne changeant qu’une décision visuelle à la fois, puis anime le still final en image-to-video.
Ça ne fait pas disparaître la dérive. En revanche, tu repères et corriges les ratés plus facilement.
Pourquoi les personnages IA changent entre les générations ?
Les personnages IA changent parce que chaque génération échantillonne une nouvelle solution visuelle. Une description du type « femme aux cheveux bleus et veste en cuir » laisse le modèle réinterpréter proportions du visage, longueur des cheveux, coupe de la veste, lumière et distance caméra.
La solution n’est pas un paragraphe d’adjectifs plus long. C’est une source de vérité plus serrée.
Utilise trois couches :
- Description canonique : les détails qui ne doient pas bouger.
- Image de référence : visage, silhouette et palette validés.
- Consigne de plan : l’expression, la pose ou le mouvement à changer maintenant.
Pour un companion IA, la description canonique peut fixer un visage en cœur, des yeux ambrés, un carré argenté court, un seul ear cuff noir et une bomber anthracite avec doublure rouge. C’est plus facile à vérifier que « héroïne cyberpunk frappante ».
Comment créer le portrait d’ancrage dans FLUX.2 ?
Crée le portrait d’ancrage comme référence de prod neutre et lisible. Un cadrage face ou trois-quarts avec lumière uniforme donne plus d’infos utiles sur le visage et la tenue qu’un gros plan extrême ou des ombres dramatiques.
AI Art Create facture actuellement 6 crédits par image FLUX.2. Entrée référence et ratios carré, portrait et paysage courants sont pris en charge. Tu peux ouvrir le générateur texte-vers-image ou parcourir les détails du modèle FLUX.2 avant de commencer.
Utilise un prompt dans un ordre fixe :
Des détails courts et observables battent les mots de personnalité abstraits. « Single black ear cuff » est testable. « Mysterious energy » ne l’est pas.
Étape 1 : Générer un petit set d’ancrage
Génère plusieurs portraits avant de t’engager. Compare le visage, la silhouette des cheveux, la construction des vêtements et la palette plutôt que de choisir seulement sur la beauté globale.
La comparaison de modèles côte à côte est utile ici : un même texte peut produire des interprétations de personnage nettement différentes selon le modèle.
Étape 2 : Valider une source visuelle unique
Télécharge le portrait le plus solide et traite-le comme référence canonique. Ne alterne pas entre plusieurs visages « presque bons ». Ça crée de l’ambiguïté dans chaque décision suivante.
Note la description canonique à côté de l’image. Le texte protège les détails partiellement cachés dans une pose.
Étape 3 : Changer une seule variable par génération
Upload la référence et demande un seul changement contrôlé :
Si tu changes expression, angle caméra, tenue et lieu ensemble, tu ne sauras pas quelle consigne a causé la dérive d’identité.
Comment construire un pack d’expressions sans perdre le visage ?
Construis les packs d’expressions à partir d’un portrait neutre stable et garde le crop cohérent. Génère séparément neutre, joyeux, inquiet, surpris et agacé. Vérifie à la taille où ça s’affichera vraiment.
Dans un chat companion, un portrait de réaction peut faire quelques centaines de pixels de large. De petits changements de sourcils et de bouche se lisent clairement. Bijoux en plus et textures de tissu fines deviennent souvent du bruit.
Pour les PNGTubers, les états bouche ouverte et bouche fermée demandent une position de tête et une silhouette quasi identiques. AI Art Create produit les images sources ; le basculement réactif se fait dans un logiciel comme Veadotube Mini ou un setup OBS. Le workflow assets VTuber couvre ce passage.
Comment animer un personnage cohérent avec Kling AI ?
Anime le still validé au lieu de reconstruire le personnage en texte-vers-vidéo. Kling 3.0 Pro accepte une référence image et produit des clips de 5 ou 10 secondes dans le catalogue actuel. Chaque requête coûte 100 crédits.
Garde le mouvement court et ciblé :
Une action claire est plus sûre qu’une suite de gestes. Un prompt qui demande tourner, marcher, ramasser un objet, parler et traverser un nouvel environnement donne au modèle vidéo plus d’occasions de réinterpréter la source.
Utilise Wan 2.2 pour des tests 5 secondes moins chers à 45 crédits. Passe à Kling 3.0 Pro quand la continuité faciale et un langage caméra dirigé comptent plus que le coût d’itération.
Qu’est-ce qui provoque la dérive faciale en image-to-video ?
La dérive faciale grossit surtout quand le visage est caché, très petit, fortement tourné ou flou de mouvement. Des mouvements caméra rapides et des interactions complexes forcent aussi le modèle à inventer ce qui n’était pas visible dans la frame source.
Réduis le risque avec ces contraintes :
- Garde le visage lisible sur la première frame.
- Demande un seul beat de mouvement.
- Évite un profil complet si la référence ne montre que la face.
- Éloigne les mains du visage lors des premiers tests.
- Caméra statique avant de tester une orbite ou un push-in rapide.
- Regarde la dernière frame, pas seulement la première seconde flatteuse.
Aucun moteur texte-vers-vidéo cohérent ne garantit l’identité. L’image-to-video guidée par référence laisse simplement moins à inventer au modèle.
Quand faire appel à un artiste humain ?
Fais appel à un artiste humain quand la répétabilité exacte est une exigence de production. Les model sheets d’animation, systèmes de mascottes sous licence et personnages de marque payants demandent correction délibérée, turnarounds propres et règles de construction documentées.
La génération IA est la plus forte en exploration et prod à faible risque : portraits companion, clips sociaux, planches concept, expériences de réaction. Elle peut cadrer vite la direction. Ce n’est pas un substitut à la direction artistique finale quand chaque trait doit matcher.
Lancer le workflow personnage
Commence par un portrait clair. Crée une référence de personnage companion, compare les modèles image, et n’anime qu’une fois l’identité au point. Ta première génération est gratuite, sans carte bancaire.
Auteur : AI Art Create
Expert image & vidéo IA
Créateur et auteur de workflows IA chez AI Art Create. Focus sur pipelines image, vidéo et stream prêts à l'emploi.