AI画像と動画でキャラクター一貫性を保つ:FLUX.2とKlingのワークフロー
2026年9月18日 • 9分 で読む
最終更新 2026年9月18日
キャラの一貫性は、1本のプロンプトに「記憶から同じ人を描き直して」と頼むのをやめたときに上がります。まず承認済みのリファレンス画像を作る。それを使い回しながら、視覚的な判断は1つずつだけ変える。最後に image-to-video で静止画をアニメ化する、という流れです。
ドリフトが消えるわけではありません。失敗に気づいて直しやすくなる、という話です。
生成のたびに AI キャラが変わるのはなぜ?
毎回、新しいビジュアル解をサンプリングするからです。「青髪でレザージャケットの女性」のような説明だと、顔の比率、髪の長さ、ジャケットの作り、ライティング、カメラ距離をモデルが自由に解釈します。
対策は形容詞を長くすることではなく、真実のソースを絞ることです。
3層で考えます:
- カノン記述: 変えてはいけない細部。
- リファレンス画像: 承認済みの顔、シルエット、パレット。
- ショット指示: 今回だけ変える表情・ポーズ・モーション。
AI コンパニオンなら、カノンにハート型の顔、琥珀色の目、短いシルバーボブ、片方の黒いイヤーカフ、赤裏地のチャコールボンバーなどを固定できます。「かっこいいサイバーパンクヒロイン」より検証しやすいです。
FLUX.2 でアンカー肖像を作るには?
アンカー肖像は、中性で読みやすい制作リファレンスにします。正面か3/4、均一なライトの方が、極端なクローズアップやドラマチックな影より、後続生成に顔と衣装の情報を渡しやすいです。
AI Art Create では現在、FLUX.2 画像1枚が 6 クレジットです。リファレンス入力と、正方形・縦・横の一般的な比率に対応しています。始める前に text-to-image ジェネレーターを開く か FLUX.2 モデル詳細 を確認できます。
プロンプトは固定順で:
短く観察できる細部が、抽象的人格語より強いです。「黒いイヤーカフ1つ」はテスト可能。「ミステリアスなオーラ」は無理です。
ステップ 1:小さなアンカーセットを生成
コミット前に複数の肖像を生成します。顔、髪のシルエット、服の構造、パレットを比較し、総合的な「美人さ」だけで選ばない。
モデル並列比較 はここで便利です。同じ文言でもモデルごとにキャラ解釈が大きく違うことがあります。
ステップ 2:視覚的真実のソースを1つ承認
最も強い肖像をダウンロードし、カノンリファレンスとして扱います。「だいたい合ってる」顔を行ったり来たりしない。後の判断すべてが曖昧になります。
画像の横にカノン記述を残します。特定ポーズで隠れる細部をテキストが守ります。
ステップ 3:1生成につき1変数だけ変更
リファレンスをアップロードし、制御された変更を1つだけ依頼:
表情・カメラ角度・衣装・ロケーションを同時に変えると、どの指示がアイデンティティドリフトを起こしたか分かりません。
顔を失わず表情パックを作るには?
安定した中性肖像から expression パックを組み、クロップを揃えます。中性・嬉しい・心配・驚き・イライラを別々に生成。実際に表示されるサイズでレビューします。
コンパニオンチャットでは、リアクション肖像が横幅数百 px 程度のこともあります。眉と口の小さな変化ははっきり読めます。余計なアクセや細かい布地テクスチャはノイズになりがちです。
PNGTuber では口開け・口閉じで頭位置とシルエットをほぼ同一にする必要があります。AI Art Create がソース画像を生成し、リアクティブ切替は Veadotube Mini や OBS などのソフト側です。VTuber アセットワークフロー がその引き渡しを説明しています。
Kling AI で一貫キャラをアニメ化するには?
承認済み still をアニメ化し、text-to-video でキャラを組み直さない。Kling 3.0 Pro は画像リファレンスを受け付け、現行カタログで 5 秒または 10 秒クリップを出力します。1リクエスト 100 クレジットです。
モーションは短く狭く:
1つの明確なアクションが、ジェスチャー列より安全です。振向き・歩行・物を拾う・話す・新環境を移動まで一度に頼むと、動画モデルがソースを再解釈する余地が増えます。
5 秒の低コストテスト(45 クレジット)は Wan 2.2。顔の連続性と指示されたカメラ言語がイテレーションコストより重要なら Kling 3.0 Pro です。
image-to-video で顔ドリフトの原因は?
顔が隠れる、極小、大きく回転、モーションブラーでドリフトが増えやすいです。速いカメラワークや複雑なインタラクションも、ソースフレームに無かった情報をモデルに創作させます。
リスクを下げる制約:
- 最初のフレームで顔を読める状態に。
- モーションビートは1つ。
- リファレンスが正面だけなら完全プロフィールは避ける。
- 初期テストでは手を顔から離す。
- orbit や急な push-in の前に固定カメラ。
- 魅力的な最初の1秒だけでなく最終フレームも見る。
一貫した text-to-video エンジンがアイデンティティを保証することはありません。リファレンス主導の image-to-video は、創作する量を減らすだけです。
人間のアーティストが必要なのはいつ?
完全な再現性が制作要件のときです。アニメのモデルシート、ライセンス mascot 体系、有償ブランドキャラは、意図的な修正、クリーンな turnaround、文書化された構造ルールが要ります。
AI 生成が強いのは探索と低リスク制作:コンパニオン肖像、SNS クリップ、コンセプトボード、リアクション実験。方向を素早く絞れます。すべての線が一致しなければならない最終アートディレクションの代わりにはなりません。
キャラワークフローを始める
はっきりした肖像1枚から。コンパニオンキャラのリファレンスを作成し、画像モデルを比較し、アイデンティティが合ってからアニメ化。初回生成は無料、クレジットカード不要です。
著者: AI Art Create
AI画像・動画生成の専門家
AI Art Createのクリエイター兼AIワークフロー執筆者です。実践的な画像・動画・配信パイプラインを中心に執筆しています。