Что получилось в цифрах
Мы сделали 2-минутный анимационный клип на оригинальную песню, где Ава и Джордан проходят через весь ролик от первого до последнего кадра. Весь продакшен занял 7 календарных дней: с 10 по 16 августа 2026 года.
Главная история оказалась в воронке. Мы запустили 205 генераций, получили 20 минут видео и оставили в финальной версии 1 минуту 58 секунд — примерно соотношение 10:1.
Именно это соотношение, а не качество отдельного удачного фрагмента, чаще всего недооценивают, когда делают клип с AI. Хороший AI-генератор видео может выдавать сильные куски, но готовый клип всё равно рождается из отбора, тайминга, повторного использования материала и монтажа.
| Этап | Результат |
|---|---|
| Запущено видеогенераций | 205 |
| Успешно завершено | 203 |
| Сгенерировано материала | 20 мин 10 с |
| Оставлено после просмотра | 152 |
| Использовано в финальном монтаже | ~90 |
| Планов в финальной версии | 142 |
| Финальная длительность | 1 мин 58 с |
| Календарное время | 7 дней |
Кадры, движение и липсинк для вашего музыкального видео — в одной студии.
Открыть студиюСначала появился стиль: концепт-арт, потом кадры
Мы не анимировали ничего, пока не был найден визуальный образ. Концепт-арт закрепил палитру, одежду и лица обоих героев ещё до того, как мы перешли к производству планов.
После этого для каждого плана мы делали отдельный стартовый кадр в Nano Banana 2 на основе концепт-арта. Часть кадров потом дорабатывали в редакторе изображений; всего в проекте использовали 151 кадр.
Такой порядок был важен: генерация из изображения в видео наследовала композицию, свет и персонажа из статичного кадра. Слабый стартовый кадр не спасался даже хорошим промптом на движение.
Мы также дали героям имена — Ава и Джордан — и использовали их в промптах. В 22 промптах персонажи назывались по имени, и это лучше удерживало их идентичность, чем каждый раз заново описывать волосы и одежду. Это стал один из самых наглядных уроков по стабильности персонажей в AI-видео.



Концепт-арт был готов до первой анимации. Он зафиксировал палитру, одежду и лица — дальше всему материалу было с чем совпадать.
Что понадобилось: движки, настройки и кредиты
Для видеогенерации 204 из 205 запусков шли через Seedance 2.0 в режиме image-to-video с разрешением 1080p. Внутри этого объёма было 155 клипов по 5 секунд за 15 кредитов каждый и 35 клипов по 10 секунд за 30 кредитов каждый.
Средний рендер занимал 94 секунды, самый долгий — 19 минут, а суммарно проект использовал 5.3 часа машинного времени. По видеожурналу цифра точная: списано 3,613 кредитов, 30 вернулись за два неудачных запуска, итого 3,583 кредита нетто.
Весь проект вышел примерно в 4,500 кредитов, но две части считались по-разному. Видео мы взяли из фактической истории аккаунта; кадры и липсинк оценили по публичному прайсу, потому что эти инструменты не списывались с аккаунта, на котором мы работали.
Изображения в Nano Banana 2 стоят 2 кредита при генерации по промпту или 4 кредита через редактор. У нас был смешанный сценарий, поэтому 151 кадр вышел примерно в 453 кредита. Липсинк в Kling 2.6 считается по 2 кредита за секунду аудио: 27 оставленных липсинк-клипов дали 209 оплачиваемых секунд, то есть 402 кредита, а все 33 запуска липсинка вместе — около 491 кредита.
Кадры
- Движок
- Nano Banana 2
- Запуски
- 151 изображение
- Настройки
- Text-to-image и проходы через редактор на основе концепт-арта
- Кредиты
- ~453
Движение
- Движок
- Seedance 2.0
- Запуски
- 204 генерации
- Настройки
- 5 с и 10 с в 1080p, image-to-video
- Кредиты
- 3,608
Один план
- Движок
- Kling 2.6
- Запуски
- 1 генерация
- Настройки
- 5 с, первый кадр + последний кадр
- Кредиты
- 5
Липсинк
- Движок
- Kling 2.6
- Запуски
- 33 запуска, 27 оставлено
- Настройки
- 2 кредита за секунду аудио
- Кредиты
- ~491
Музыка
- Движок
- Suno
- Запуски
- 1 трек
- Настройки
- 2 мин 37 с, обрезан до 1:58
- Кредиты
- отдельная подписка
Итого
- Движок
- —
- Запуски
- —
- Настройки
- Видео посчитано фактически; кадры и липсинк — по прайсу
- Кредиты
- ≈ 4,500
Сложность №1: просишь одну эмоцию, получаешь другую
Это была самая частая борьба. Мы просили исполнение припева, а модель снова и снова уходила в свой дефолт: широко раскрытые глаза, искренность и лёгкая грусть. Нам же нужны были холоднее, увереннее, с самоиронией и лёгкой улыбкой.
Одного позитивного описания не хватало. Помогло прописывать выражение лица как дугу внутри одного плана: эмоция меняется со временем, а не держится на одном прилагательном десять секунд. Такую дугу мы использовали в 26 промптах.
Второй приём — прямо назвать нежелательный дефолт и запретить его. Мы писали фразы вроде "no deer eyes, no innocent wide-eyed expression, no ballad sadness"; похожий запрет был в 19 промптах. Когда у модели сильное внутреннее смещение, негативное указание работает точнее, чем ещё одно прилагательное.
Здесь работают две вещи. Во-первых, выражение лица задано как дуга внутри одного плана: сначала игриво, к финалу искреннее, а не одно прилагательное на десять секунд. Во-вторых, последняя строка оставляет рот «свободным»: движение должно быть спокойным, потому что липсинк добавляется позже. В парном дубле мы пошли дальше и прямо запретили дефолт ("no deer eyes, no innocent wide-eyed expression, no ballad sadness") — и именно это наконец изменило считывание эмоции.
Показать промпт
10-second 16:9 animated music-video shot. Preserve the exact girl, face, bright blue eyes, long straight blonde hair, silver hair clip, denim jacket, black top, proportions and illustrated visual style from the reference image. She performs the chorus while sitting at her school desk, looking directly toward camera. Start playful and self-confident: soft knowing smile, slightly raised eyebrow. Then her expression gradually becomes more sincere and vulnerable, like she suddenly means the words more than she expected. Small head tilts, subtle shoulder rhythm, fingers lightly tapping the desk to the beat. Gentle hair movement. Slow cinematic push-in from medium shot to medium close-up. Background students stay soft and secondary. Keep mouth movement subtle and relaxed for later lip sync. No exaggerated gestures, no camera shake, no text, no style change.
Если эмоция читается неправильно, лучше всего помогает список того, чего делать НЕ нужно.
Сложность №2: та же локация с другого ракурса
Когда локация уже появилась, вернуться в неё со второго ракурса оказалось одной из самых дорогих частей процесса. Переписывание промпта часто меняло слишком многое, поэтому больше пользы давал повторный запуск того же самого промпта без правок.
Всего 21 промпт отправлялся повторно байт в байт, и это дало ещё 29 генераций. Ещё мы фиксировали оба конца движения — первый и последний кадр; именно для этого в проекте была единственная генерация Kling 2.6.
Оставшиеся несовпадения помогала скрывать малая глубина резкости. В 34 промптах фон специально уводился в мягкий, второстепенный слой, чтобы заново сгенерированная локация не обязана была совпадать до каждой детали.
Этот промпт отправлялся четыре раза за один час — без единого изменения. С формулировкой всё было нормально: модель просто нужно было попросить несколько раз, прежде чем парень подошёл сзади и герои не начали сливаться друг с другом. Из 205 генераций 29 держались именно на повторных запусках, а не на переписывании промптов.
Показать промпт
cinematic shot based on the reference image. The blonde girl stands beside the punch bowl, relaxed and confident, holding a plastic cup. She raises the cup and takes one large sip of the party punch. At the same time, the dark-haired boy quietly approaches her from behind, naturally closing the distance through the party crowd. Just as she finishes the sip, he gently places one hand on her shoulder to get her attention. She has not turned around yet. Background guests continue talking, drinking and moving naturally. Warm amber party lighting, subtle camera push-in, realistic body movement. Preserve both characters, outfits, room layout and anime-cinematic style. No sudden motion, no morphing, no extra limbs.
Две версии были сгенерированы с разницей в 14 минут: в одной они целуются, в другой тянутся друг к другу и останавливаются. Сохранить обе стоило 60 кредитов, зато финал стал монтажным решением, а не генерационным. Менять мнение на монтаже дешевле.
Показать промпт
Animate the provided image, preserving the exact faces, hairstyles, clothing and anime style of both characters. They stand very close, hold soft eye contact, slowly lean in but don't kiss. At the exact moment the camera begins a smooth cinematic 360° orbit around them, keeping their faces and upper bodies centered and sharp. The couple stays almost still with subtle breathing, blinking and slight hair movement. As the camera circles them, the entire party background gradually becomes heavily blurred with warm golden bokeh from candles and string lights, as if the world disappears around them. Shallow depth of field, natural parallax, warm amber rim light, romantic pacing, stable camera, high character consistency. Avoid face morphing, anatomy errors, camera shake, fast motion, focus loss, or characters rotating instead of the camera. /
Вернуться на уже сгенерированную площадку — самая дорогая задача во всём пайплайне.
Липсинк — только в конце
Порядок был простой: сначала генерируем план, затем накладываем липсинк в Kling 2.6, используя вокал из готового трека. Так мы сделали 33 клипа с липсинком.
Неочевидная часть — промпт на движение. Рот должен был двигаться спокойно и ненавязчиво, потому что позже он заменялся липсинком. В 10 промптах мы прописали это прямо: если исходная артикуляция слишком выразительная, она начинает спорить с липсинком поверх.
Важно, чего исходный промпт НЕ просит: он держит движение сдержанным, а рот расслабленным, потому что позже рот будет заменён. Липсинк добавляется последним — в Kling 2.6, от вокала из готового трека. Этот план в итоге вошёл в финальный монтаж четыре раза.
Показать промпт
Animate this image into a subtle cinematic anime-style video. Preserve the blonde woman’s identity, face, blue eyes, freckles, hair, outfit, headphones, bedroom, lighting, colors, and composition. She lies on her stomach along the bed, hands gently supporting her face, looking into the camera and softly singing along to music in her headphones. Add natural lip-sync, small mouth and jaw movements, gentle blinking, slight eyebrow motion, soft breathing, head movements to the rhythm, and minimal hair motion. Keep her gaze mostly on the camera. Fairy lights softly flicker, candle flame moves naturally, neon heart glow subtly varies. Camera stays almost static with a very slow push-in. Keep motion smooth and restrained. No face changes, warped hands, extra fingers, body distortion, outfit changes, camera cuts, or exaggerated movement.
То, о чём почти не говорят: монтаж
Главный урок проекта: умение генерировать без умения монтировать даёт шоу-рил, а не музыкальный клип. Трек идёт в 130 BPM, а финальное видео содержит 142 плана за 118 секунд.
Медианная длина плана — 0.70 секунды, что соответствует четверти с точкой. 85 планов длились ровно 1.5 доли, 31 — ровно 2 доли, а 117 из 141 склейки попали в сетку половинной доли с погрешностью меньше половины кадра.
Плотность появилась ещё и из-за того, куда ставились склейки. 80 из 141 перехода перебрасывали нас в другую локацию, поэтому видео не проигрывало сцены блоками, а постоянно резало между школой, кафе, спальней и вечеринкой.
Мы намеренно переиспользовали материал: 82 исходных клипа покрыли 123 плана, а некоторые фрагменты появлялись до четырёх раз. Темп был заложен не только в монтаж, но и в генерацию: в 19 промптах указан BPM, а в 3 хореография расписана по долям. Две длинные паузы в районе 77–84 секунд были единственной передышкой — и это было осознанно.
Хореография расписана по долям в тех же 130 BPM, в которых идёт трек: "Beats 1-2: dancers step outward. 3-4: pom-poms rise in alternating diagonals." Движение, сгенерированное по темповой сетке, чисто режется по той же сетке — именно поэтому в 19 наших промптах указан BPM.
Показать промпт
High-angle wide shot. Keep exactly the same five Westfield cheerleaders, uniforms and gym. Animate geometric synchronized choreography at 130 BPM. Beats 1-2: dancers step outward, expanding the formation. 3-4: pom-poms rise in alternating diagonals. 5-6: two quick steps inward while everyone rotates about 45°. 7-8: formation opens into a star-like shape and hits a strong final pose. Maintain precise spacing and synchronization. Camera slowly cranes downward and pushes toward center court. Floor reflections and pom-pom highlights move naturally. No added dancers, morphing, character drift or costume changes.
Девять планов за шесть секунд, со звуком. Медианная длина плана в этом видео — 0.70 с: четверть с точкой при 130 BPM. 117 из 141 склейки попадают в сетку половинной доли с погрешностью меньше половины кадра. Вот что должно выдержать лицо персонажа: по 0.7 секунды за раз, 142 раза подряд.
Генерируйте по сетке — и режьте по сетке.
Что всё ещё ломается
Два типа ошибок всё равно прорывались. На длинных почти статичных планах модель могла дорисовать лишних людей: второй персонаж появлялся из ниоткуда. А текст портился при движении камеры — надпись WESTFIELD на форме чирлидерш за один план расползалась в бессмыслицу.
Практичные обходные решения не выглядят эффектно, но помогают. Мы держали планы короткими — быстрый монтаж и так это делал, — убирали читаемый текст из кадра или уводили его в расфокус и перезапускали генерацию, а не переписывали промпт, если клип был почти удачным.
Посмотрите за её плечо ближе к концу: в кадре из ниоткуда проявляется второй силуэт. На длинных удержаниях почти статичного кадра это видно чаще всего — ещё одна причина, почему монтаж такой короткий. С надписями происходит похожее: WESTFIELD на форме чирлидерш превращается в набор случайных знаков, как только камера начинает двигаться.
Рабочий пайплайн
Вот последовательность, которую мы повторили бы снова — именно в таком порядке.
- 1Сначала закончите трек. Монтаж строится на его темпе, поэтому финальный звук нужен до первой видеогенерации.
- 2Соберите визуальный стиль на бумаге. Концепт-арт с закреплённой палитрой, одеждой и лицами даёт всем последующим промптам общий ориентир.
- 3Дайте персонажам имена и используйте их в каждом промпте — «Ава» и «Джордан» удерживали идентичность между генерациями лучше, чем одни только описания внешности.
- 4Сгенерируйте по одному стартовому кадру на каждый план в Nano Banana 2, опираясь на концепт-арт, а не начиная каждый раз с нуля.
- 5Анимируйте каждый кадр в Seedance 2.0. Пять секунд в 1080p — рабочий стандарт; десять секунд берите только тогда, когда действие действительно требует длины.
- 6Прописывайте движение по долям в темпе трека, чтобы сгенерированное движение попадало в ту же сетку, по которой вы будете монтировать.
- 7Говорите, чего вы не хотите. Неправильная эмоциональная «настройка по умолчанию» — самая частая причина, почему технически нормальный план читается неверно.
- 8Добавляйте липсинк в Kling 2.6 последним — и только на тех планах, где камера действительно держится на лице.
- 9Режьте в бит и перебрасывайте зрителя между локациями, а не проигрывайте каждую сцену отдельным блоком.
