Kostenlos starten

Charakterkonsistenz bei KI-Bildern und Video: FLUX.2- und Kling-Workflow

Charakterkonsistenz bei KI-Bildern und Video: FLUX.2- und Kling-Workflow – AI Art Create Blogbeitrag
Charakterkonsistenz KI
FLUX.2
Kling AI
Bild zu Video
KI-Companion

18. September 2026 • 9 Min. Lesezeit

Zuletzt aktualisiert am 18. September 2026

Charakter-Konsistenz wird besser, wenn du aufhörst, einen Prompt dazu zu zwingen, eine Person aus dem Gedächtnis neu zu erfinden. Baue zuerst ein freigegebenes Referenzbild. Nutze dieses Bild weiter und ändere jeweils nur eine visuelle Entscheidung – animiere den finalen Still erst danach per Image-to-Video.

So verschwindet Drift nicht. Du erkennst und korrigierst Fehler aber leichter.

Warum verändern sich KI-Charaktere zwischen Generierungen?

KI-Charaktere wechseln, weil jede Generierung eine neue visuelle Lösung sampled. Eine Beschreibung wie „Frau mit blauen Haaren und Lederjacke“ lässt das Modell Gesichtsproportionen, Haarlänge, Jackenschnitt, Licht und Kameradistanz neu interpretieren.

Der Fix ist kein längerer Adjektiv-Paragraph. Es braucht eine engere Quelle der Wahrheit.

Nutze drei Ebenen:

  1. Kanonische Beschreibung: Details, die gleich bleiben sollen.
  2. Referenzbild: Freigegebenes Gesicht, Silhouette und Palette.
  3. Shot-Anweisung: Der eine Ausdruck, die Pose oder die Bewegung, die jetzt wechseln soll.

Für einen KI-Companion kann die kanonische Beschreibung herzförmiges Gesicht, bernsteinfarbene Augen, kurzen silbernen Bob, einen schwarzen Ohr-Cuff und eine anthrazitfarbene Bomberjacke mit rotem Futter festhalten. Das lässt sich leichter prüfen als vages Zeug wie „markante Cyberpunk-Heldin“.

Wie erstellst du das Anker-Portrait in FLUX.2?

Erstelle das Anker-Portrait als neutrale, gut lesbare Produktionsreferenz. Frontal oder Dreiviertel mit gleichmäßigem Licht liefert später mehr nutzbare Infos zu Gesicht und Outfit als Extreme Close-up oder harte Schatten.

AI Art Create berechnet aktuell 6 Credits pro FLUX.2-Bild. Referenz-Input und gängige Quadrat-, Portrait- und Landscape-Ratios sind drin. Du kannst den Text-zu-Bild-Generator öffnen oder vor dem Start die FLUX.2-Modelldetails checken.

Nutze einen Prompt mit fester Reihenfolge:

Original-Companion-Charakter, Portrait bis zur Taille, Dreiviertel.
Herzförmiges Gesicht, bernsteinfarbene Augen, kurzer silberner Bob, ein schwarzer Ohr-Cuff.
Anthrazit-Bomberjacke mit rotem Futter, schlichtes dunkles Shirt.
Neutraler aufmerksamer Ausdruck, Kamera auf Augenhöhe, weiches gleichmäßiges Studiolicht.
Sauberer dunkelgrauer Hintergrund, klare halbrealistische Illustration.

Kurze, beobachtbare Details schlagen abstrakte Persönlichkeitswörter. „Single black ear cuff“ ist testbar. „Mysterious energy“ nicht.

Schritt 1: Kleines Anker-Set generieren

Generiere mehrere Portraits, bevor du dich festlegst. Vergleiche Gesicht, Haar-Silhouette, Kleidungskonstruktion und Palette – wähle nicht nur nach „schön insgesamt“.

Der Modellvergleich nebeneinander hilft hier: Identischer Wortlaut kann bei verschiedenen Modellen spĂĽrbar andere Charakter-Interpretationen liefern.

Schritt 2: Eine visuelle Quelle der Wahrheit freigeben

Lade das stärkste Portrait runter und behandle es als kanonische Referenz. Wechsel nicht ständig zwischen mehreren „fast richtigen“ Gesichtern. Das macht jede spätere Entscheidung mehrdeutig.

Notiere die kanonische Beschreibung neben dem Bild. Der Text schĂĽtzt Details, die in einer Pose teilweise verdeckt sind.

Schritt 3: Pro Generierung nur eine Variable ändern

Lade die Referenz hoch und fordere genau eine kontrollierte Änderung:

Gesicht, silberner Bob, bernsteinfarbene Augen, Ohr-Cuff,
Jackendesign, Palette und Illustrationsstil beibehalten.
Nur den Ausdruck zu einem zurückhaltenden Lächeln ändern.
Gleiche Kameradistanz und Beleuchtung.

Wenn du Ausdruck, Kamerawinkel, Outfit und Location gleichzeitig änderst, siehst du nicht, welche Anweisung den Identity-Drift ausgelöst hat.

Wie baust du ein Expression-Pack, ohne das Gesicht zu verlieren?

Baue Expression-Packs von einem stabilen neutralen Portrait und halte den Crop konsistent. Generiere neutral, happy, concerned, surprised und annoyed getrennt. Review in der Größe, in der es später wirklich angezeigt wird.

Im Companion-Chat kann ein Reaktions-Portrait nur ein paar hundert Pixel breit sein. Kleine Änderungen an Augenbraue und Mund wirken klar. Extra-Schmuck und feine Stofftexturen werden oft zu Noise.

Bei PNGTubern mĂĽssen Mund-offen und Mund-zu fast identische Kopfposition und Silhouette haben. AI Art Create liefert die Source-Bilder; reaktives Umschalten passiert in Software wie Veadotube Mini oder einem OBS-Setup. Der VTuber-Asset-Workflow beschreibt diesen Handoff.

Wie animierst du einen konsistenten Charakter mit Kling AI?

Animiere den freigegebenen Still statt den Charakter per Text-to-Video neu zu bauen. Kling 3.0 Pro nimmt eine Bildreferenz und liefert im aktuellen Katalog 5- oder 10-Sekunden-Clips. Jeder Request kostet 100 Credits.

Halte die Motion kurz und eng:

Der Charakter zeigt ein kleines wissendes Lächeln und dreht langsam den Kopf.
Dezente Atmung. Haare bewegen sich leicht.
Statische Kamera auf Augenhöhe. Gesicht, Jacke und Hintergrund beibehalten.

Eine klare Aktion ist sicherer als eine Gesten-Sequenz. Ein Prompt, der Drehen, Gehen, Objekt aufheben, Sprechen und neue Umgebung verlangt, gibt dem Video-Modell mehr Chancen, die Quelle neu zu interpretieren.

Nutze Wan 2.2 für günstigere 5-Sekunden-Tests à 45 Credits. Nimm Kling 3.0 Pro, wenn Gesichtskontinuität und klare Kamera-Sprache wichtiger sind als Iterationskosten.

Was verursacht Gesichts-Drift bei Image-to-Video?

Gesichts-Drift wächst meist, wenn das Gesicht verdeckt, sehr klein, stark gedreht oder motion-blurred ist. Schnelle Kamerafahrten und komplexe Interaktionen zwingen das Modell, Infos zu erfinden, die im Source-Frame nicht sichtbar waren.

Reduziere Risiko mit diesen Constraints:

  • Gesicht im ersten Frame lesbar halten.
  • Nur einen Motion-Beat anfordern.
  • Keinen vollen Profil-Dreh, wenn die Referenz nur Front zeigt.
  • Hände vom Gesicht fern in frĂĽhen Tests.
  • Statische Kamera, bevor du Orbit oder schnellen Push-in testest.
  • Letztes Frame reviewen, nicht nur die erste attraktive Sekunde.

Keine kohärente Text-to-Video-Engine garantiert Identität. Referenz-geführtes Image-to-Video lässt dem Modell weniger zu erfinden.

Wann solltest du einen menschlichen Artist nehmen?

Nimm einen menschlichen Artist, wenn exakte Wiederholbarkeit Produktions-Pflicht ist. Model Sheets fĂĽr Animation, lizenzierte Maskottchen-Systeme und bezahlte Brand-Charaktere brauchen bewusste Korrektur, saubere Turnarounds und dokumentierte Konstruktionsregeln.

KI-Generierung ist am stärksten bei Exploration und Low-Risk-Produktion: Companion-Portraits, Social-Clips, Concept Boards, Reaktions-Experimente. Sie kann die Richtung schnell eingrenzen. Sie ist kein Ersatz für finale Art Direction, wenn jede Linie matchen muss.

Character-Workflow starten

Starte mit einem klaren Portrait. Erstelle eine Companion-Charakter-Referenz, vergleiche die Bildmodelle und animiere erst, wenn die Identität stimmt. Deine erste Generierung ist gratis, ohne Kreditkarte.

A

Autor: AI Art Create

Experte fĂĽr KI-Bilder & Video

Creator und KI-Workflow-Autor bei AI Art Create. Fokus auf praxisnahe Bild-, Video- und Stream-Pipelines.