Lo que hicimos, en números
Creamos un video musical animado de 2 minutos para una canción original, con Ava y Jordan presentes de principio a fin. Toda la producción tomó 7 días calendario, del 10 al 16 de agosto de 2026.
La historia real estuvo en el embudo. Generamos 205 videos, obtuvimos 20 minutos de material y dejamos 1 minuto 58 segundos en la edición final: una proporción cercana a 10:1.
Esa proporción —más que la calidad de un clip aislado— es lo que muchos subestiman al hacer video musical con ia. Un buen ai music video generator puede darte clips potentes, pero el video terminado sale de elegir, medir tiempos, reutilizar y cortar bien.
| Etapa | Resultado |
|---|---|
| Generaciones de video realizadas | 205 |
| Completadas con éxito | 203 |
| Material generado | 20 min 10 s |
| Clips conservados tras revisión | 152 |
| Clips usados en el corte final | ~90 |
| Tomas en el corte final | 142 |
| Duración final | 1 min 58 s |
| Tiempo calendario | 7 días |
Frames, movimiento y lip sync para tu propio video musical, todo en un solo estudio.
Abrir el estudioPrimero definimos el estilo: arte conceptual y luego frames
No animamos nada hasta tener claro el look en imágenes fijas. El arte conceptual definió la paleta, el vestuario y los rostros antes de pasar a producir tomas.
Después, cada toma tuvo su propio frame inicial generado en Nano Banana 2 a partir del arte conceptual. Parte de esos frames se refinó luego en un editor de imágenes, y el proyecto usó 151 frames en total.
Este orden fue clave porque image-to-video heredó composición, iluminación y personaje desde la imagen fija. Un frame débil no se rescata con un buen prompt de movimiento.
También les dimos nombre a los personajes: Ava y Jordan. Usar sus nombres en los prompts ayudó más que volver a describir cabello y ropa cada vez. Veintidós prompts los mencionaron por nombre, y esa fue una de nuestras lecciones más claras sobre consistencia de personajes en video con IA.



Arte conceptual creado antes de animar una sola toma. Definió paleta, vestuario y rostros; todo lo que vino después ya tenía una referencia que seguir.
Lo que usamos: motores, ajustes y créditos
Para generar video, 204 de 205 intentos usaron Seedance 2.0 image-to-video en 1080p. Dentro de ese trabajo, 155 fueron clips de 5 segundos a 15 créditos cada uno, y 35 fueron clips de 10 segundos a 30 créditos cada uno.
El render promedio tomó 94 segundos, el más largo tardó 19 minutos y el proyecto sumó 5.3 horas de tiempo de máquina. En el registro de video, el dato fue exacto: 3,613 créditos cobrados, 30 reembolsados por dos generaciones fallidas y 3,583 créditos netos.
El proyecto completo rondó los 4,500 créditos, aunque las dos mitades salieron de fuentes distintas. El costo de video lo medimos desde el registro de la cuenta; los frames y el lip sync se calcularon con la tarifa pública porque esas herramientas no se cobraron en la cuenta que usamos.
Las imágenes de Nano Banana 2 cuestan 2 créditos desde prompt o 4 desde el editor. Como usamos una mezcla de ambas, los 151 frames quedaron en unos 453 créditos. Kling 2.6 lip sync cobró 2 créditos por segundo de audio: los 27 clips con sincronización labial que conservamos sumaron 209 segundos facturados, equivalentes a 402 créditos; las 33 pruebas de lip sync dieron alrededor de 491 créditos.
Frames
- Motor
- Nano Banana 2
- Pruebas
- 151 imágenes
- Ajustes
- Text-to-image y pasadas de editor a partir del arte conceptual
- Créditos
- ~453
Movimiento
- Motor
- Seedance 2.0
- Pruebas
- 204 generaciones
- Ajustes
- 5 s y 10 s en 1080p, image-to-video
- Créditos
- 3,608
Una toma
- Motor
- Kling 2.6
- Pruebas
- 1 generación
- Ajustes
- 5 s, primer frame + último frame
- Créditos
- 5
Lip sync
- Motor
- Kling 2.6
- Pruebas
- 33 pruebas, 27 conservadas
- Ajustes
- 2 créditos por segundo de audio
- Créditos
- ~491
Música
- Motor
- Suno
- Pruebas
- 1 canción
- Ajustes
- 2 min 37 s, recortada a 1:58
- Créditos
- suscripción aparte
Total
- Motor
- —
- Pruebas
- —
- Ajustes
- Video medido; frames y lip sync a precio de lista
- Créditos
- ≈ 4,500
Primer reto: la emoción que pides vs. la que recibes
Esta fue la pelea más repetida. Pedíamos una interpretación para el coro y el modelo se iba a su gesto por defecto: ojos muy abiertos, sinceridad intensa y un toque triste. Nosotros queríamos algo más cool, consciente de sí mismo y con una sonrisa cómplice.
Describirlo en positivo no alcanzaba. Lo que funcionó fue escribir la expresión como un arco dentro de una sola toma, para que la cara cambiara con el tiempo en vez de sostener un adjetivo durante diez segundos; 26 de nuestros prompts usaron ese recurso.
La otra solución fue nombrar el gesto no deseado y prohibirlo sin rodeos. Usamos frases como "no deer eyes, no innocent wide-eyed expression, no ballad sadness," y 19 prompts incluyeron una restricción parecida. Cuando el modelo trae un sesgo fuerte, una negativa puede ser más precisa que un adjetivo.
Aquí trabajan dos cosas. La expresión está escrita como un arco dentro de una toma —primero juguetona, más sincera al final— y no como un solo adjetivo sostenido por diez segundos. Además, la última línea reserva la boca: el movimiento queda relajado porque el lip sync se aplica después. La toma compañera fue más lejos y prohibió el gesto por defecto ("no deer eyes, no innocent wide-eyed expression, no ballad sadness"), y eso terminó de corregir la lectura emocional.
Ver el prompt
10-second 16:9 animated music-video shot. Preserve the exact girl, face, bright blue eyes, long straight blonde hair, silver hair clip, denim jacket, black top, proportions and illustrated visual style from the reference image. She performs the chorus while sitting at her school desk, looking directly toward camera. Start playful and self-confident: soft knowing smile, slightly raised eyebrow. Then her expression gradually becomes more sincere and vulnerable, like she suddenly means the words more than she expected. Small head tilts, subtle shoulder rhythm, fingers lightly tapping the desk to the beat. Gentle hair movement. Slow cinematic push-in from medium shot to medium close-up. Background students stay soft and secondary. Keep mouth movement subtle and relaxed for later lip sync. No exaggerated gestures, no camera shake, no text, no style change.
Cuando la emoción sale mal, la solución suele ser decirle al modelo exactamente qué NO debe hacer.
Segundo reto: volver al mismo set desde otro ángulo
Cuando una locación ya existía, regresar a ella desde un segundo ángulo se volvió una de las partes más caras del flujo. Reescribir el prompt cambiaba demasiadas cosas, así que obtuvimos más valor repitiendo exactamente el mismo prompt.
En total, 21 prompts se enviaron más de una vez, byte por byte, y eso creó 29 generaciones extra. También bloqueamos los dos extremos de un movimiento con un primer frame y un último frame; para eso se usó la única generación en Kling 2.6 del proyecto.
La profundidad de campo ayudó a cubrir lo que todavía no coincidía. Treinta y cuatro prompts pidieron fondos suaves y secundarios, así que un set regenerado no necesitaba calcar cada detalle.
Este prompt exacto se envió cuatro veces en una hora, sin cambiar una coma. El problema no era la redacción: el modelo simplemente necesitó varios intentos para que el chico se acercara por detrás sin que ambos personajes se fusionaran. Los re-rolls, no las reescrituras, explican 29 de nuestras 205 generaciones.
Ver el prompt
cinematic shot based on the reference image. The blonde girl stands beside the punch bowl, relaxed and confident, holding a plastic cup. She raises the cup and takes one large sip of the party punch. At the same time, the dark-haired boy quietly approaches her from behind, naturally closing the distance through the party crowd. Just as she finishes the sip, he gently places one hand on her shoulder to get her attention. She has not turned around yet. Background guests continue talking, drinking and moving naturally. Warm amber party lighting, subtle camera push-in, realistic body movement. Preserve both characters, outfits, room layout and anime-cinematic style. No sudden motion, no morphing, no extra limbs.
Generamos dos versiones con 14 minutos de diferencia: una donde se besan y otra donde se acercan y se detienen. Conservar ambas costó 60 créditos y convirtió el final en una decisión de edición, no de generación; y editar es el lugar más barato para cambiar de idea.
Ver el prompt
Animate the provided image, preserving the exact faces, hairstyles, clothing and anime style of both characters. They stand very close, hold soft eye contact, slowly lean in but don't kiss. At the exact moment the camera begins a smooth cinematic 360° orbit around them, keeping their faces and upper bodies centered and sharp. The couple stays almost still with subtle breathing, blinking and slight hair movement. As the camera circles them, the entire party background gradually becomes heavily blurred with warm golden bokeh from candles and string lights, as if the world disappears around them. Shallow depth of field, natural parallax, warm amber rim light, romantic pacing, stable camera, high character consistency. Avoid face morphing, anatomy errors, camera shake, fast motion, focus loss, or characters rotating instead of the camera. /
Volver a un set que ya generaste puede ser lo más caro de todo el flujo.
El lip sync va al final
Nuestro orden fue simple: primero generamos la toma y después aplicamos lip sync en Kling 2.6, guiado por la voz de la canción final. Así hicimos 33 clips con sincronización labial.
Lo contraintuitivo estaba en el prompt de movimiento. Tenía que mantener la boca sutil y relajada porque luego se reemplazaba; 10 prompts lo dijeron de forma explícita, y las tomas con articulación de boca demasiado expresiva chocaban con el lip sync encima.
Fíjate en lo que el prompt fuente NO pide: mantiene el movimiento sutil y la boca relajada, porque la boca se reemplaza después. El lip sync va al final, en Kling 2.6, guiado por la voz de la canción terminada. Esta toma terminó apareciendo cuatro veces distintas en el corte final.
Ver el prompt
Animate this image into a subtle cinematic anime-style video. Preserve the blonde woman’s identity, face, blue eyes, freckles, hair, outfit, headphones, bedroom, lighting, colors, and composition. She lies on her stomach along the bed, hands gently supporting her face, looking into the camera and softly singing along to music in her headphones. Add natural lip-sync, small mouth and jaw movements, gentle blinking, slight eyebrow motion, soft breathing, head movements to the rhythm, and minimal hair motion. Keep her gaze mostly on the camera. Fairy lights softly flicker, candle flame moves naturally, neon heart glow subtly varies. Camera stays almost static with a very slow push-in. Keep motion smooth and restrained. No face changes, warped hands, extra fingers, body distortion, outfit changes, camera cuts, or exaggerated movement.
La parte de la que casi nadie habla: la edición
La mayor lección del proyecto fue esta: saber generar sin saber editar produce un showreel, no un video musical con IA. La canción iba a 130 BPM y el video final tuvo 142 tomas en 118 segundos.
La toma mediana duró 0.70 segundos, lo que coincide con una negra con puntillo. Ochenta y cinco tomas duraron exactamente 1.5 beats, 31 duraron exactamente 2 beats, y 117 de 141 cortes cayeron a menos de medio frame de la retícula de medio beat.
La densidad también vino de dónde poníamos los cortes. Ochenta de 141 cortes saltaron a otra locación, así que el video cruzó escuela, cafetería, recámara y fiesta en lugar de mostrar cada escena como un bloque.
Reutilizamos material a propósito: 82 clips fuente cubrieron 123 tomas, y algunos aparecieron hasta cuatro veces. El tempo también se pensó desde la generación, no solo en edición: 19 prompts mencionaron BPM y 3 escribieron la coreografía beat por beat. Las dos pausas largas alrededor de los segundos 77-84 fueron el único respiro, y fueron deliberadas.
La coreografía está escrita en beats, al mismo tempo de 130 BPM de la canción: "Beats 1-2: dancers step outward. 3-4: pom-poms rise in alternating diagonals." El movimiento generado sobre la retícula del tempo se corta limpio sobre esa misma retícula; por eso 19 de nuestros prompts mencionan BPM.
Ver el prompt
High-angle wide shot. Keep exactly the same five Westfield cheerleaders, uniforms and gym. Animate geometric synchronized choreography at 130 BPM. Beats 1-2: dancers step outward, expanding the formation. 3-4: pom-poms rise in alternating diagonals. 5-6: two quick steps inward while everyone rotates about 45°. 7-8: formation opens into a star-like shape and hits a strong final pose. Maintain precise spacing and synchronization. Camera slowly cranes downward and pushes toward center court. Floor reflections and pom-pom highlights move naturally. No added dancers, morphing, character drift or costume changes.
Nueve tomas en seis segundos, con sonido. La toma mediana en este video dura 0.70 s —una negra con puntillo a 130 BPM— y 117 de 141 cortes caen a menos de medio frame de la retícula de medio beat. Eso es lo que un rostro tiene que aguantar: 0.7 segundos a la vez, 142 veces.
Genera sobre la retícula. Corta sobre la retícula.
Lo que todavía falla
Dos fallas siguieron apareciendo. En planos largos y casi estáticos, el modelo podía alucinar figuras extra: una segunda persona aparecía de la nada. Las letras también se degradaban cuando la cámara se movía, así que WESTFIELD en los uniformes de animadoras se convertía en ruido durante la toma.
Las soluciones prácticas no eran glamorosas, pero ayudaron. Mantuvimos los planos cortos —algo que el ritmo rápido ya exigía—, dejamos el texto legible fuera de cuadro o desenfocado, y repetimos generaciones en vez de reescribir cuando un clip ya estaba cerca.
Mira sobre su hombro cerca del final: una segunda figura aparece de la nada. Los planos largos sobre un frame casi estático son donde más pasa esto, otra razón para mantener la edición corta. Las letras fallan igual: WESTFIELD en los uniformes de animadoras se vuelve ilegible cada vez que la cámara se mueve.
El flujo que sí funcionó
Esta es la secuencia que repetiríamos, en este orden.
- 1Termina primero la canción. La edición se construye sobre su tempo, así que necesitas el audio final antes de generar una sola toma.
- 2Diseña el look en papel. El arte conceptual que fija paleta, vestuario y rostros le da a cada prompt posterior algo concreto que seguir.
- 3Ponles nombre a tus personajes y usa esos nombres en cada prompt: "Ava" y "Jordan" sostuvieron la identidad entre generaciones mejor que la descripción física por sí sola.
- 4Genera un frame por toma en Nano Banana 2, partiendo del arte conceptual en lugar de empezar desde cero.
- 5Anima cada frame en Seedance 2.0. Los clips de 5 segundos en 1080p son el caballo de batalla; usa 10 segundos solo cuando la acción realmente lo necesite.
- 6Escribe el movimiento en beats al tempo de la canción, para que lo generado caiga sobre la misma retícula que usarás al editar.
- 7Di también lo que no quieres. Los gestos emocionales por defecto son la causa más común de que una toma técnicamente buena se sienta mal.
- 8Agrega el lip sync al final, en Kling 2.6, y solo en las tomas donde la cámara se queda sobre un rostro.
- 9Corta al beat y cruza locaciones en lugar de reproducir cada escena como un bloque.
