Manter o personagem consistente entre imagem e vídeo IA: workflow FLUX.2 e Kling
18 de setembro de 2026 • 9 min de leitura
Atualizado em 18 de setembro de 2026
A consistência do personagem melhora quando você para de pedir pra um prompt recriar alguém de memória. Monta primeiro uma imagem de referência aprovada. Reutiliza ela mudando só uma decisão visual por vez e, depois, anima o still final com image-to-video.
Isso não faz o drift sumir. Mas deixa falhas mais fáceis de ver e corrigir.
Por que personagens de IA mudam entre gerações?
Personagens mudam porque cada geração sorteia uma solução visual nova. Uma descrição tipo “mulher de cabelo azul e jaqueta de couro” deixa o modelo reinterpretar proporção do rosto, comprimento do cabelo, corte da jaqueta, luz e distância da câmera.
O fix não é um parágrafo maior de adjetivos. É uma fonte da verdade mais apertada.
Use três camadas:
- Descrição canônica: detalhes que não devem mudar.
- Imagem de referência: rosto, silhueta e paleta aprovados.
- Instrução do shot: a expressão, pose ou movimento que muda agora.
Pra um companion de IA, a descrição canônica pode fixar rosto em coração, olhos âmbar, bob prateado curto, um ear cuff preto e bomber carvão com forro vermelho. Dá pra checar isso melhor do que “heroína cyberpunk marcante”.
Como criar o retrato âncora no FLUX.2?
Crie o retrato âncora como referência de produção neutra e legível. Composição de frente ou três quartos com luz uniforme entrega mais info útil de rosto e roupa do que close extremo ou sombra dramática.
No AI Art Create, uma imagem FLUX.2 custa 6 créditos hoje. Tem entrada de referência e proporções comuns quadrada, retrato e paisagem. Você pode abrir o gerador text-to-image ou ver os detalhes do modelo FLUX.2 antes de começar.
Use um prompt em ordem fixa:
Detalhes curtos e observáveis vencem palavras abstratas de personalidade. “Um ear cuff preto” dá pra testar. “Energia misteriosa” não.
Passo 1: Gerar um conjunto âncora pequeno
Gere vários retratos antes de cravar. Compare rosto, silhueta do cabelo, construção da roupa e paleta — não escolha só pelo “bonito no geral”.
A comparação de modelos lado a lado ajuda aqui: o mesmo texto pode dar interpretações bem diferentes do personagem entre modelos.
Passo 2: Aprovar uma fonte visual única
Baixe o retrato mais forte e trate como referência canônica. Não fique alternando entre vários rostos “quase certos”. Isso cria ambiguidade em toda decisão depois.
Anote a descrição canônica ao lado da imagem. O texto protege detalhes que podem ficar parcialmente escondidos numa pose.
Passo 3: Mudar uma variável por geração
Envie a referência e peça uma mudança controlada:
Se você muda expressão, ângulo, roupa e cenário juntos, não dá pra saber qual instrução causou o drift de identidade.
Como montar um pack de expressões sem perder o rosto?
Monte packs a partir de um retrato neutro estável e mantenha o crop consistente. Gere neutro, feliz, preocupado, surpreso e irritado separadamente. Revise no tamanho em que vai aparecer de verdade.
Num chat de companion, um retrato de reação pode ter só algumas centenas de pixels de largura. Pequenas mudanças de sobrancelha e boca leem bem. Joias extras e textura fina de tecido viram ruído com frequência.
Pra PNGTubers, estados boca aberta e boca fechada precisam de posição de cabeça e silhueta quase idênticas. O AI Art Create gera as imagens fonte, mas a troca reativa rola em software tipo Veadotube Mini ou setup no OBS. O workflow de assets VTuber cobre essa passagem.
Como animar um personagem consistente com Kling AI?
Anime o still aprovado em vez de reconstruir o personagem com text-to-video. O Kling 3.0 Pro aceita referência de imagem e entrega clipes de 5 ou 10 segundos no catálogo atual. Cada pedido custa 100 créditos.
Mantenha o movimento curto e focado:
Uma ação clara é mais segura que sequência de gestos. Um prompt pedindo virar, andar, pegar objeto, falar e atravessar ambiente novo dá ao modelo de vídeo mais chance de reinterpretar a fonte.
Use Wan 2.2 pra testes de 5 segundos mais baratos, 45 créditos. Use Kling 3.0 Pro quando continuidade facial e linguagem de câmera dirigida importam mais que custo de iteração.
O que causa drift facial em image-to-video?
Drift facial costuma crescer quando o rosto fica escondido, muito pequeno, muito rotacionado ou com motion blur. Movimentos rápidos de câmera e interações complexas também forçam o modelo a inventar o que não estava visível no frame fonte.
Reduza risco com estas regras:
- Mantenha o rosto legível no primeiro frame.
- Peça um beat de movimento só.
- Evite perfil completo se a referência só mostra frente.
- Mantenha as mãos longe do rosto nos primeiros testes.
- Câmera estática antes de testar órbita ou push-in rápido.
- Revise o último frame, não só o primeiro segundo bonito.
Nenhum motor text-to-video coerente garante identidade. Image-to-video guiado por referência só deixa menos coisa pro modelo inventar.
Quando contratar um artista humano?
Contrate quando repetibilidade exata é requisito de produção. Model sheets de animação, sistemas de mascote licenciados e personagens de marca pagos precisam de correção deliberada, turnarounds limpos e regras de construção documentadas.
Geração por IA brilha em exploração e produção de baixo risco: retratos de companion, clipes sociais, concept boards, testes de reação. Ela estreita a direção rápido. Não substitui direção de arte final quando cada linha tem que bater.
Comece o workflow do personagem
Comece com um retrato claro. Crie uma referência de companion, compare os modelos de imagem e só anime quando a identidade estiver certa. Sua primeira geração é grátis, sem cartão.
Autor: AI Art Create
Especialista em imagem e vídeo IA
Creator e autor de workflows de IA no AI Art Create. Foco em pipeline prático de imagem, vídeo e kit de stream.