ماذا صنعنا؟ الأرقام أولًا
أنجزنا فيديو موسيقيًا متحركًا مدته دقيقتان تقريبًا لأغنية أصلية، تظهر فيه Ava وJordan من البداية إلى النهاية. استغرق الإنتاج كاملًا 7 أيام تقويمية، من 10-16 August 2026.
الحكاية الحقيقية كانت في القمع الإنتاجي: 205 عمليات توليد، نتج عنها 20 دقيقة من المادة المصورة، ثم انتهى بنا الأمر إلى 1 دقيقة و58 ثانية فقط في المونتاج النهائي؛ أي بنسبة تقارب 10:1.
هذه النسبة، لا جودة لقطة واحدة بعينها، هي ما يستهين به كثيرون عند صناعة ai music video. قد يمنحك ai music video generator لقطات قوية، لكن الفيديو المكتمل يولد من الاختيار، الإيقاع، إعادة الاستخدام، والقطع الذكي.
| المرحلة | النتيجة |
|---|---|
| عمليات توليد الفيديو | 205 |
| اكتملت بنجاح | 203 |
| المادة المصورة الناتجة | 20 دقيقة 10 ثانية |
| اللقطات التي اجتازت المراجعة | 152 |
| اللقطات المستخدمة في النسخة النهائية | ~90 |
| عدد الشوتات في المونتاج النهائي | 142 |
| مدة النسخة النهائية | 1 دقيقة 58 ثانية |
| زمن التنفيذ التقويمي | 7 أيام |
إطارات، حركة، وlip sync لفيديوك الموسيقي — كلها في استوديو واحد.
افتح الاستوديوالشكل البصري قبل الحركة: كونسبت آرت ثم إطارات
لم نحرّك شيئًا قبل أن يتضح الشكل البصري في صور ثابتة. الكونسبت آرت ثبّت لوحة الألوان، الملابس، وملامح الوجهين قبل الدخول في إنتاج الشوتات.
بعدها حصل كل شوت على إطار بداية خاص به، مولّد في Nano Banana 2 انطلاقًا من الكونسبت آرت. جزء من هذه الإطارات خضع لاحقًا للتنقيح داخل محرر صور، ووصل إجمالي الإطارات المستخدمة في المشروع إلى 151 إطارًا.
هذا الترتيب كان فارقًا، لأن image-to-video يرث التكوين، الإضاءة، والشخصية من الصورة الثابتة. الإطار الضعيف لا ينقذه وصف حركة ممتاز.
أعطينا الشخصيتين اسمين، Ava وJordan، واستخدمناهما داخل البرومبتات. ظهر الاسمان في 22 برومبتًا، وكان ذلك أكثر ثباتًا للهوية من إعادة وصف الشعر والملابس كل مرة؛ وأصبح من أوضح دروسنا في اتساق الشخصيات داخل فيديو AI.



الكونسبت آرت صُنع قبل تحريك أي شوت. هو من ثبّت لوحة الألوان، الملابس، والوجهين — وكل ما جاء بعده صار لديه مرجع يطابقه.
ما الذي احتجناه: المحركات، الإعدادات، والكريدت
في توليد الفيديو، استخدمنا Seedance 2.0 image-to-video بدقة 1080p في 204 من أصل 205 عملية. ضمن هذا العمل، كانت 155 لقطة مدتها 5 ثوانٍ بتكلفة 15 كريدت لكل واحدة، و35 لقطة مدتها 10 ثوانٍ بتكلفة 30 كريدت لكل واحدة.
استغرق الرندر في المتوسط 94 ثانية، ووصل أطول رندر إلى 19 دقيقة، واستهلك المشروع إجمالًا 5.3 ساعات من وقت المعالجة الآلية. أما دفتر الفيديو فكان رقمه دقيقًا: 3,613 كريدت مخصومة، و30 كريدت مستردة بسبب عمليتين فاشلتين، أي 3,583 كريدت صافية.
وصل المشروع كاملًا إلى نحو 4,500 كريدت، لكن الرقم جاء من مصدرين مختلفين. رقم الفيديو قسناه من سجل الحساب، أما الإطارات ومزامنة الشفاه فحسبناهما من بطاقة الأسعار المعلنة لأن تلك الأدوات لم تُفوتر على الحساب الذي استخدمناه.
تكلفة صور Nano Banana 2 هي 2 كريدت من برومبت، أو 4 عبر المحرر، ومشروعنا جمع بين الطريقتين؛ لذلك بلغت تكلفة 151 إطارًا نحو 453 كريدت. أما مزامنة الشفاه في Kling 2.6 فتُحسب بواقع 2 كريدت لكل ثانية صوت: الـ 27 لقطة التي احتفظنا بها بلغت 209 ثوانٍ مفوترة، أي 402 كريدت، بينما وصلت كل عمليات lip sync الـ 33 إلى نحو 491 كريدت.
الإطارات
- المحرك
- Nano Banana 2
- العدد
- 151 صورة
- الإعدادات
- Text-to-image وتمريرات تحرير انطلاقًا من الكونسبت آرت
- الكريدت
- ~453
الحركة
- المحرك
- Seedance 2.0
- العدد
- 204 عمليات توليد
- الإعدادات
- 5 ثوانٍ و10 ثوانٍ بدقة 1080p، image-to-video
- الكريدت
- 3,608
شوت واحد
- المحرك
- Kling 2.6
- العدد
- 1 عملية توليد
- الإعدادات
- 5 ثوانٍ، إطار أول + إطار أخير
- الكريدت
- 5
مزامنة الشفاه
- المحرك
- Kling 2.6
- العدد
- 33 عملية، احتفظنا بـ 27
- الإعدادات
- 2 كريدت لكل ثانية صوت
- الكريدت
- ~491
الموسيقى
- المحرك
- Suno
- العدد
- 1 تراك
- الإعدادات
- 2 دقيقة 37 ثانية، قُصّت إلى 1:58
- الكريدت
- اشتراك منفصل
الإجمالي
- المحرك
- —
- العدد
- —
- الإعدادات
- الفيديو مقاس فعليًا؛ الإطارات ومزامنة الشفاه بسعر القائمة
- الكريدت
- ≈ 4,500
الصعوبة الأولى: الشعور الذي تطلبه… والشعور الذي تحصل عليه
كان هذا أكثر صراع تكرر معنا. حين طلبنا أداء الكورس، كان النموذج ينزلق إلى خياره الافتراضي: عينان واسعتان، صدق زائد، وحزن خفيف؛ بينما كنا نريد حضورًا باردًا، واعيًا بذاته، وفيه لمحة تسلية.
الوصف الإيجابي وحده لم يكن كافيًا. ما ساعد فعلًا هو كتابة التعبير كقوس داخل الشوت الواحد، بحيث يتغير الوجه مع الوقت بدل أن يظل عالقًا في صفة واحدة لعشر ثوانٍ؛ استخدمنا هذا الأسلوب في 26 برومبتًا.
الحل الآخر كان تسمية الافتراضي غير المرغوب ومنعه صراحة. استخدمنا عبارات مثل "no deer eyes, no innocent wide-eyed expression, no ballad sadness," وظهر منع مشابه في 19 برومبتًا؛ عندما يكون لدى النموذج انحياز قوي، يصبح النفي أداة أقوى من الصفة.
شيئان ينجزان المهمة هنا. التعبير مكتوب كقوس داخل شوت واحد — مرح في البداية، وأكثر صدقًا في النهاية — لا كصفة واحدة معلّقة لعشر ثوانٍ. والسطر الأخير يترك الفم هادئًا لأن مزامنة الشفاه ستُطبّق لاحقًا. النسخة المرافقة ذهبت أبعد ومنعت الافتراضي صراحة ("no deer eyes, no innocent wide-eyed expression, no ballad sadness")، وهذا ما حرّك قراءة المشهد أخيرًا.
اعرض البرومبت
10-second 16:9 animated music-video shot. Preserve the exact girl, face, bright blue eyes, long straight blonde hair, silver hair clip, denim jacket, black top, proportions and illustrated visual style from the reference image. She performs the chorus while sitting at her school desk, looking directly toward camera. Start playful and self-confident: soft knowing smile, slightly raised eyebrow. Then her expression gradually becomes more sincere and vulnerable, like she suddenly means the words more than she expected. Small head tilts, subtle shoulder rhythm, fingers lightly tapping the desk to the beat. Gentle hair movement. Slow cinematic push-in from medium shot to medium close-up. Background students stay soft and secondary. Keep mouth movement subtle and relaxed for later lip sync. No exaggerated gestures, no camera shake, no text, no style change.
حين يقرأ النموذج الشعور خطأ، اكتب له بوضوح ما الذي لا تريده.
الصعوبة الثانية: العودة إلى نفس المكان من زاوية أخرى
بعد أن يتكوّن موقع ما، تصبح العودة إليه من زاوية ثانية من أغلى أجزاء سير العمل. إعادة كتابة البرومبت كانت تغيّر أشياء أكثر مما نريد، لذلك كانت إعادة تشغيل البرومبت نفسه أكثر جدوى.
إجمالًا، أرسلنا 21 برومبتًا أكثر من مرة، حرفيًا ومن دون أي تغيير، فنتج عنها 29 عملية توليد إضافية. كما ثبّتنا طرفي الحركة بإطار أول وإطار أخير، وهذا تحديدًا سبب وجود عملية Kling 2.6 الوحيدة في المشروع.
عمق المجال ساعد في إخفاء ما تبقى من عدم التطابق. في 34 برومبتًا جعلنا الخلفية ناعمة وثانوية، بحيث لا يحتاج الموقع المعاد توليده إلى مطابقة مثالية في كل تفصيلة.
أُرسل هذا البرومبت نفسه أربع مرات خلال ساعة واحدة، بلا أي تعديل. لم تكن المشكلة في الصياغة؛ النموذج كان يحتاج فقط أن نطلب منه مرارًا حتى يقترب الفتى من الخلف من دون أن يندمج الاثنان. إعادة التشغيل، لا إعادة الكتابة، كانت وراء 29 من أصل 205 عملية توليد.
اعرض البرومبت
cinematic shot based on the reference image. The blonde girl stands beside the punch bowl, relaxed and confident, holding a plastic cup. She raises the cup and takes one large sip of the party punch. At the same time, the dark-haired boy quietly approaches her from behind, naturally closing the distance through the party crowd. Just as she finishes the sip, he gently places one hand on her shoulder to get her attention. She has not turned around yet. Background guests continue talking, drinking and moving naturally. Warm amber party lighting, subtle camera push-in, realistic body movement. Preserve both characters, outfits, room layout and anime-cinematic style. No sudden motion, no morphing, no extra limbs.
وُلدت نسختان بفاصل 14 دقيقة: واحدة يقبلان فيها بعضهما، وأخرى يقتربان ثم يتوقفان. الاحتفاظ بالنسختين كلّف 60 كريدت، وحوّل النهاية إلى قرار مونتاج بدل أن تكون قرار توليد — وهذا هو المكان الأرخص لتغيير رأيك.
اعرض البرومبت
Animate the provided image, preserving the exact faces, hairstyles, clothing and anime style of both characters. They stand very close, hold soft eye contact, slowly lean in but don't kiss. At the exact moment the camera begins a smooth cinematic 360° orbit around them, keeping their faces and upper bodies centered and sharp. The couple stays almost still with subtle breathing, blinking and slight hair movement. As the camera circles them, the entire party background gradually becomes heavily blurred with warm golden bokeh from candles and string lights, as if the world disappears around them. Shallow depth of field, natural parallax, warm amber rim light, romantic pacing, stable camera, high character consistency. Avoid face morphing, anatomy errors, camera shake, fast motion, focus loss, or characters rotating instead of the camera. /
العودة إلى موقع سبق أن ولّدته هي أغلى خطوة في سير العمل كله.
مزامنة الشفاه تأتي في النهاية
كان ترتيبنا بسيطًا: نولّد الشوت أولًا، ثم نطبق مزامنة الشفاه في Kling 2.6 اعتمادًا على الفوكال من النسخة النهائية للأغنية. بهذه الطريقة صنعنا 33 لقطة lip sync.
النقطة غير المتوقعة كانت في برومبت الحركة. كان يجب أن تبقى حركة الفم خفيفة ومرتاحة لأن الفم سيُستبدل لاحقًا؛ ذكرنا ذلك صراحة في 10 برومبتات، أما اللقطات ذات النطق التعبيري القوي فكانت تصطدم بمزامنة الشفاه المضافة فوقها.
لاحظ ما لا يطلبه برومبت المصدر: الحركة تبقى خفيفة والفم مسترخيًا، لأن الفم سيُستبدل لاحقًا. مزامنة الشفاه تأتي أخيرًا، داخل Kling 2.6، وتحركها طبقة الفوكال من التراك النهائي. هذا الشوت دخل النسخة النهائية أربع مرات منفصلة.
اعرض البرومبت
Animate this image into a subtle cinematic anime-style video. Preserve the blonde woman’s identity, face, blue eyes, freckles, hair, outfit, headphones, bedroom, lighting, colors, and composition. She lies on her stomach along the bed, hands gently supporting her face, looking into the camera and softly singing along to music in her headphones. Add natural lip-sync, small mouth and jaw movements, gentle blinking, slight eyebrow motion, soft breathing, head movements to the rhythm, and minimal hair motion. Keep her gaze mostly on the camera. Fairy lights softly flicker, candle flame moves naturally, neon heart glow subtly varies. Camera stays almost static with a very slow push-in. Keep motion smooth and restrained. No face changes, warped hands, extra fingers, body distortion, outfit changes, camera cuts, or exaggerated movement.
الجزء الذي لا يتحدث عنه أحد: المونتاج
أقوى درس في المشروع: مهارة التوليد من دون مهارة المونتاج تنتج showreel لا فيديو موسيقي. كان التراك على 130 BPM، والنسخة النهائية ضمت 142 شوتًا في 118 ثانية.
متوسط طول الشوت كان 0.70 ثانية، مطابقًا تقريبًا لربع منقوط. 85 شوتًا كانت بطول 1.5 ضربة بالضبط، و31 بطول 2 ضربتين، و117 من أصل 141 قطعًا وقع ضمن نصف فريم من شبكة نصف الضربة.
الكثافة جاءت أيضًا من أماكن القطع. 80 من أصل 141 قطعًا انتقلت إلى موقع مختلف، فصار الفيديو يقطع بين المدرسة، المقهى، غرفة النوم، والحفلة بدل أن يعرض كل مشهد ككتلة واحدة.
أعدنا استخدام المادة عمدًا: 82 مقطع مصدر غطت 123 شوتًا، وظهرت بعض المقاطع حتى أربع مرات. حتى الإيقاع بُني داخل التوليد، لا في المونتاج فقط؛ 19 برومبتًا ذكرت BPM، و3 كتبت الكوريغرافيا ضربة بضربة. أما اللقطتان الطويلتان حول 77-84 ثانية فكانتا الاستراحة الوحيدة، وكانت مقصودة.
الكوريغرافيا مكتوبة كضربات، على نفس 130 BPM الذي يعمل عليه التراك: "Beats 1-2: dancers step outward. 3-4: pom-poms rise in alternating diagonals." الحركة التي تُولّد على شبكة الإيقاع تُقطع بسلاسة على شبكة الإيقاع نفسها — لذلك ذكرنا BPM في 19 برومبتًا بالضبط.
اعرض البرومبت
High-angle wide shot. Keep exactly the same five Westfield cheerleaders, uniforms and gym. Animate geometric synchronized choreography at 130 BPM. Beats 1-2: dancers step outward, expanding the formation. 3-4: pom-poms rise in alternating diagonals. 5-6: two quick steps inward while everyone rotates about 45°. 7-8: formation opens into a star-like shape and hits a strong final pose. Maintain precise spacing and synchronization. Camera slowly cranes downward and pushes toward center court. Floor reflections and pom-pom highlights move naturally. No added dancers, morphing, character drift or costume changes.
تسعة شوتات في ست ثوانٍ، مع الصوت. متوسط الشوت في هذا الفيديو 0.70s — ربع منقوط عند 130 BPM — و117 من أصل 141 قطعًا يقع ضمن نصف فريم من شبكة نصف الضربة. هذا ما يجب أن ينجو منه الوجه: 0.7 ثانية في كل مرة، 142 مرة.
ولّد على الشبكة الإيقاعية، واقطع على الشبكة نفسها.
ما الذي لا يزال يتعطل؟
بقي نمطان من الأعطال يظهران رغم كل شيء. في اللقطات الطويلة شبه الثابتة، قد يهلوس النموذج أشخاصًا إضافيين، فتتلاشى شخصية ثانية إلى المشهد من لا شيء؛ كما أن الكتابة تتدهور كلما تحركت الكاميرا، لذلك تحولت كلمة WESTFIELD على زي التشجيع إلى فوضى خلال الشوت.
الحلول العملية لم تكن براقة، لكنها ساعدت. جعلنا اللقطات الثابتة قصيرة، وهو ما يخدمه القطع السريع أصلًا، وأبعدنا النصوص المقروءة عن الكادر أو جعلناها خارج التركيز، وأعدنا تشغيل البرومبت بدل إعادة كتابته عندما تكون اللقطة قريبة من المطلوب.
راقب فوق كتفها قرب النهاية: تظهر شخصية ثانية من العدم. اللقطات الطويلة على إطار شبه ثابت هي المكان الذي يظهر فيه هذا غالبًا، وهذا سبب إضافي لأن يكون المونتاج قصير اللقطات. الكتابة تفشل بالطريقة نفسها — كلمة WESTFIELD على زي التشجيع تتحول إلى لا معنى كلما تحركت الكاميرا.
سير العمل الذي نجح معنا
هذا هو التسلسل الذي سنكرره، وبنفس الترتيب.
- 1أنهِ التراك أولًا. المونتاج يُبنى على إيقاعه، لذلك تحتاج الصوت النهائي قبل توليد أي شوت.
- 2صمّم الشكل على الورق. كونسبت آرت يثبّت لوحة الألوان، الملابس، والوجهين، فيمنح كل برومبت لاحق مرجعًا يطابقه.
- 3سمِّ شخصياتك واستخدم الأسماء في كل برومبت — «Ava» و«Jordan» حافظا على الهوية عبر الأجيال أفضل من الوصف الجسدي وحده.
- 4ولّد إطارًا واحدًا لكل شوت في Nano Banana 2، انطلاقًا من الكونسبت آرت لا من الصفر.
- 5حرّك كل إطار في Seedance 2.0. خمس ثوانٍ بدقة 1080p هي خيار العمل اليومي؛ لا تستخدم عشر ثوانٍ إلا حين تحتاج الحركة ذلك فعلًا.
- 6اكتب الحركة على ضربات إيقاع التراك، حتى تهبط الحركة المولدة على الشبكة نفسها التي سيستخدمها المونتاج.
- 7قل ما لا تريده. الانحيازات العاطفية الخاطئة هي أكثر سبب يجعل شوتًا سليمًا تقنيًا يبدو غير مناسب.
- 8أضف lip sync في النهاية داخل Kling 2.6، وفقط على الشوتات التي تُبقي الكاميرا على الوجه.
- 9اقطع على الإيقاع، وبدّل بين المواقع بدل أن تعرض كل مشهد ككتلة واحدة.
