Как не ломать персонажа между AI-картинками и видео: воркфлоу FLUX.2 и Kling
18 сентября 2026 г. • 9 мин чтения
Обновлено 18 сентября 2026 г.
Стабильность персонажа растёт, когда ты перестаёшь просить один промпт воссоздать человека по памяти. Сначала собери утверждённый референс. Потом меняй за раз только одно визуальное решение и уже после этого анимируй финальный кадр через image-to-video.
Так дрейф не исчезает. Зато ошибки проще заметить и поправить.
Почему AI-персонажи меняются между генерациями?
Персонажи меняются, потому что каждая генерация сэмплит новое визуальное решение. Описание вроде «женщина с синими волосами и кожаной курткой» даёт модели свободу переосмыслить пропорции лица, длину волос, крой куртки, свет и дистанцию камеры.
Фикс — не абзац прилагательных подлиннее. Нужен более жёсткий источник правды.
Используй три слоя:
- Каноническое описание: детали, которые не должны меняться.
- Референс-картинка: утверждённое лицо, силуэт и палитра.
- Инструкция кадра: одно выражение, поза или движение, которое меняется сейчас.
Для AI-компаньона в каноне могут быть сердцевидное лицо, янтарные глаза, короткое серебряное каре, один чёрный ear cuff и угольная бомбер с красной подкладкой. Это проще проверить, чем «выразительная cyberpunk-героиня».
Как создать якорный портрет во FLUX.2?
Делай якорный портрет нейтральным и читаемым продакшен-референсом. Анфас или три четверти с ровным светом дают следующим генерациям больше полезной информации о лице и одежде, чем экстремальный крупный план или жёсткие тени.
В AI Art Create сейчас FLUX.2 стоит 6 кредитов за запрос. Есть референс на входе и обычные квадратные, портретные и альбомные соотношения. Можешь открыть генератор text-to-image или глянуть детали модели FLUX.2 перед стартом.
Используй промпт в фиксированном порядке:
Короткие наблюдаемые детали лучше абстрактных слов о характере. «Один чёрный ear cuff» можно проверить. «Таинственная энергия» — нет.
Шаг 1: Сгенерировать небольшой якорный набор
Сделай несколько портретов, прежде чем зафиксироваться. Сравнивай лицо, силуэт волос, конструкцию одежды и палитру, а не только «красиво в целом».
Сравнение моделей бок о бок тут полезно: один и тот же текст может дать заметно разные трактовки персонажа на разных моделях.
Шаг 2: Утвердить один визуальный источник правды
Скачай сильнейший портрет и считай его каноническим референсом. Не переключайся между несколькими «почти теми» лицами — это размывает каждое следующее решение.
Запиши каноническое описание рядом с картинкой. Текст сохраняет детали, которые в конкретной позе частично скрыты.
Шаг 3: Менять одну переменную за генерацию
Загрузи референс и попроси одно контролируемое изменение:
Если одновременно меняешь выражение, угол камеры, outfit и локацию, не поймёшь, какая инструкция дала дрейф идентичности.
Как собрать набор выражений, не потеряв лицо?
Собирай expression pack от стабильного нейтрального портрета и держи кроп одинаковым. Генерируй нейтральное, радостное, обеспокоенное, удивлённое и раздражённое отдельно. Смотри в том размере, где это реально будет на экране.
В чате с компаньоном реакционный портрет может быть шириной в пару сотен пикселей. Мелкие сдвиги бровей и рта читаются чётко. Лишние украшения и сложная фактура ткани часто превращаются в шум.
У PNGTuber состояния «рот открыт» и «рот закрыт» требуют почти одинаковой позиции головы и силуэта. AI Art Create делает исходные картинки, а переключение в реальном времени — в софте вроде Veadotube Mini или OBS. Workflow VTuber-ассетов описывает этот handoff.
Как анимировать стабильного персонажа в Kling AI?
Анимируй утверждённый still, а не пересобирай персонажа через text-to-video. Kling 3.0 Pro принимает референс-картинку и в текущем каталоге даёт клипы на 5 или 10 секунд. Каждый запрос — 100 кредитов.
Держи движение коротким и узким:
Одно ясное действие безопаснее цепочки жестов. Промпт с поворотом, ходьбой, поднятием предмета, речью и новой локацией даёт видео-модели больше поводов переинтерпретировать источник.
Для более дешёвых 5-секундных тестов за 45 кредитов используй Wan 2.2. Бери Kling 3.0 Pro, когда важнее непрерывность лица и управляемый язык камеры, чем цена итераций.
Что вызывает дрейф лица в image-to-video?
Дрейф лица обычно растёт, когда лицо закрыто, очень мало, сильно повёрнуто или размыто движением. Быстрые движения камеры и сложные взаимодействия заставляют модель додумывать то, чего не было видно в исходном кадре.
Снижай риск такими ограничениями:
- Лицо читаемо в первом кадре.
- Один motion beat за раз.
- Без полного профиля, если референс только анфас.
- На ранних тестах руки подальше от лица.
- Статичная камера до orbit или резкого push-in.
- Смотри последний кадр, а не только красивую первую секунду.
Ни один связный text-to-video не гарантирует идентичность. Image-to-video с референсом просто оставляет модели меньше поля для выдумки.
Когда нужен живой художник?
Подключай художника, когда точное повторение — требование продакшена. Model sheet для анимации, лицензированные маскоты и платные brand-персонажи требуют осознанной правки, чистых turnarounds и задокументированных правил построения.
Генерация AI сильнее на этапе исследования и low-risk продакшена: портреты компаньонов, соц-клипы, concept board, эксперименты с реакциями. Она быстро сужает направление. Это не замена финальной art direction, когда каждая линия должна совпасть.
Запусти workflow персонажа
Начни с одного ясного портрета. Создай референс companion-персонажа, сравни image-модели и анимируй только когда идентичность ощущается правильной. Первая генерация бесплатна, карта не нужна.
Автор: AI Art Create
Эксперт по AI-картинкам и видео
Креатор и автор AI-воркфлоу в AI Art Create. Делаю практичные пайплайны для картинок, видео и стрим-кита.