Guías de vídeo con AI Lectura de 11 min

Crear video musical con ia gratis: 2 minutos en 7 días

Crear video musical con ia gratis se entiende mucho mejor cuando aparecen los números: 205 generaciones nos dieron 20 minutos de material, y solo 1:58 llegó al montaje final. En Vynzo hicimos un video musical animado completo de 2 minutos para una canción original, con dos personajes jóvenes adultos recurrentes, Ava y Jordan, entre el 10 y el 16 de agosto de 2026.

Lo que hicimos, en números

Creamos un video musical animado de 2 minutos para una canción original, con Ava y Jordan presentes de principio a fin. La producción completa duró 7 días naturales, del 10 al 16 de agosto de 2026.

El embudo fue la verdadera historia. Generamos 205 piezas, obtuvimos 20 minutos de metraje y dejamos 1 minuto y 58 segundos en el montaje final: una proporción cercana a 10:1.

Esa proporción, más que la calidad de un clip aislado, es lo que se suele subestimar al hacer video musical con IA. Un buen generador de videos musicales con IA puede darte clips potentes, pero el video terminado nace de elegir, medir tiempos, reutilizar y cortar.

FaseResultado
Generaciones de video lanzadas205
Completadas correctamente203
Metraje generado20 min 10 s
Clips conservados tras revisión152
Clips usados en el montaje final~90
Tomas en el montaje final142
Duración final1 min 58 s
Tiempo de calendario7 días

Fotogramas, movimiento y lip sync para tu propio video musical, todo en un solo estudio.

Abrir el estudio

Primero fue el estilo: arte conceptual y luego fotogramas

No animamos nada hasta tener claro el aspecto visual en imágenes fijas. El arte conceptual fijó la paleta, el vestuario y los rostros de ambos personajes antes de pasar a producir tomas.

Después, cada toma tuvo su propio fotograma inicial generado en Nano Banana 2 a partir del arte conceptual. Parte de esos fotogramas se refinó luego en un editor de imagen, y el proyecto utilizó 151 fotogramas en total.

Este orden fue clave porque el image-to-video hereda composición, luz y personaje desde la imagen fija. Un mal fotograma inicial no se arregla con un buen prompt de movimiento.

También dimos nombre a los personajes, Ava y Jordan, y usamos esos nombres en los prompts. Veintidós prompts los mencionaban por su nombre, y eso sostuvo mejor la identidad que volver a describir pelo y ropa cada vez; fue una de las lecciones más claras sobre consistencia de personaje en video con IA.

Concepto — el estilo
Concepto — el estilo
Concepto — la paleta
Concepto — la paleta
Concepto — protagonistas
Concepto — protagonistas

Arte conceptual creado antes de animar una sola toma. Fijó la paleta, el vestuario y los dos rostros: todo lo que vino después tenía una referencia que respetar.

Lo necesario: motores, ajustes y créditos

Para generar video, 204 de las 205 ejecuciones usaron Seedance 2.0 image-to-video a 1080p. Dentro de ese trabajo, 155 fueron clips de 5 segundos a 15 créditos cada uno, y 35 fueron clips de 10 segundos a 30 créditos cada uno.

El render medio tardó 94 segundos, el más largo llegó a 19 minutos y el proyecto consumió 5.3 horas de tiempo de máquina en total. En el registro de video, la cifra fue exacta: 3,613 créditos cargados, 30 devueltos por dos ejecuciones fallidas y 3,583 créditos netos.

El proyecto completo rondó los 4,500 créditos, pero las dos mitades salieron de fuentes distintas. La cifra de video se midió desde el registro de la cuenta; los fotogramas y el lip sync se calcularon con la tarifa pública porque esas herramientas no se facturaron en la cuenta que usamos.

Las imágenes de Nano Banana 2 cuestan 2 créditos desde prompt o 4 desde el editor, y nosotros mezclamos ambas vías, así que 151 fotogramas sumaron unos 453 créditos. El lip sync de Kling 2.6 cobra 2 créditos por segundo de audio: los 27 clips sincronizados que conservamos sumaron 209 segundos facturados, es decir, 402 créditos, mientras que las 33 ejecuciones de lip sync quedaron en torno a 491 créditos.

Fotogramas

Motor
Nano Banana 2
Ejecuciones
151 imágenes
Ajustes
Text-to-image y pasadas de editor a partir del arte conceptual
Créditos
~453

Movimiento

Motor
Seedance 2.0
Ejecuciones
204 generaciones
Ajustes
5 s y 10 s a 1080p, image-to-video
Créditos
3,608

Una toma

Motor
Kling 2.6
Ejecuciones
1 generación
Ajustes
5 s, primer fotograma + último fotograma
Créditos
5

Lip sync

Motor
Kling 2.6
Ejecuciones
33 ejecuciones, 27 conservadas
Ajustes
2 créditos por segundo de audio
Créditos
~491

Música

Motor
Suno
Ejecuciones
1 pista
Ajustes
2 min 37 s, recortada a 1:58
Créditos
suscripción aparte

Total

Motor
Ejecuciones
Ajustes
Video medido; fotogramas y lip sync a tarifa pública
Créditos
≈ 4,500

Primer problema: la emoción que pides no siempre es la que sale

Fue la pelea más repetida del proyecto. Cuando pedíamos una interpretación de estribillo, el modelo volvía una y otra vez a su gesto por defecto: ojos muy abiertos, sinceridad intensa y un punto triste; nosotros queríamos algo más frío, consciente de sí mismo y ligeramente divertido.

Describirlo en positivo no bastaba. Funcionó mejor escribir la expresión como un arco dentro de la misma toma, de modo que la cara cambiara con el tiempo en lugar de sostener un solo adjetivo durante diez segundos; 26 de nuestros prompts usaron ese tipo de arco.

La otra solución fue nombrar el gesto no deseado y prohibirlo de forma directa. Usamos frases como «sin mirada de cervatillo, sin expresión inocente de ojos abiertos, sin tristeza de balada», y 19 prompts incluyeron una prohibición similar; cuando un modelo tiene un sesgo fuerte, una negación puede ser más eficaz que un adjetivo.

Seedance 2.0 — interpretando el estribillo

Aquí hay dos cosas haciendo el trabajo. La expresión está escrita como un arco dentro de una sola toma —primero juguetona, sincera al final—, no como un adjetivo fijo durante diez segundos. Y la última línea reserva la boca: el movimiento se mantiene relajado porque el lip sync se aplica después. La toma compañera fue más lejos y prohibió directamente el gesto por defecto («sin mirada de cervatillo, sin expresión inocente de ojos abiertos, sin tristeza de balada»), y eso fue lo que por fin cambió la lectura.

Ver el prompt

10-second 16:9 animated music-video shot. Preserve the exact girl, face, bright blue eyes, long straight blonde hair, silver hair clip, denim jacket, black top, proportions and illustrated visual style from the reference image. She performs the chorus while sitting at her school desk, looking directly toward camera. Start playful and self-confident: soft knowing smile, slightly raised eyebrow. Then her expression gradually becomes more sincere and vulnerable, like she suddenly means the words more than she expected. Small head tilts, subtle shoulder rhythm, fingers lightly tapping the desk to the beat. Gentle hair movement. Slow cinematic push-in from medium shot to medium close-up. Background students stay soft and secondary. Keep mouth movement subtle and relaxed for later lip sync. No exaggerated gestures, no camera shake, no text, no style change.

Para corregir una emoción mal leída, a veces lo que mejor funciona es decir exactamente qué NO quieres.

Segundo problema: volver al mismo set desde otro ángulo

Cuando una localización ya existía, regresar a ella desde un segundo ángulo se convirtió en una de las partes más caras del flujo. Reescribir el prompt solía cambiar demasiadas cosas, así que obtuvimos más valor repitiendo exactamente el mismo prompt.

En total, 21 prompts se enviaron más de una vez byte por byte, lo que generó 29 generaciones extra. También fijamos los dos extremos de un movimiento con un primer y un último fotograma; para eso fue la única generación de Kling 2.6 del proyecto.

La profundidad de campo ayudó a tapar el resto de diferencias. Treinta y cuatro prompts mandaban el fondo a un plano suave y secundario, así que un set regenerado no tenía que coincidir al milímetro en cada detalle.

Seedance 2.0 — el ponche

Este prompt exacto se envió cuatro veces en una hora, sin cambiar una coma. El texto no estaba mal: simplemente hubo que pedirle al modelo varias veces que el chico se acercara por detrás sin que ambos personajes se fusionaran. Los re-rolls, no las reescrituras, explican 29 de nuestras 205 generaciones.

Ver el prompt

cinematic shot based on the reference image. The blonde girl stands beside the punch bowl, relaxed and confident, holding a plastic cup. She raises the cup and takes one large sip of the party punch. At the same time, the dark-haired boy quietly approaches her from behind, naturally closing the distance through the party crowd. Just as she finishes the sip, he gently places one hand on her shoulder to get her attention. She has not turned around yet. Background guests continue talking, drinking and moving naturally. Warm amber party lighting, subtle camera push-in, realistic body movement. Preserve both characters, outfits, room layout and anime-cinematic style. No sudden motion, no morphing, no extra limbs.

Seedance 2.0 — el casi beso

Generamos dos versiones con 14 minutos de diferencia: una en la que se besan y otra en la que se acercan y se detienen. Conservar ambas costó 60 créditos y convirtió el final en una decisión de montaje, no de generación; y cambiar de opinión es más barato en la edición.

Ver el prompt

Animate the provided image, preserving the exact faces, hairstyles, clothing and anime style of both characters. They stand very close, hold soft eye contact, slowly lean in but don't kiss. At the exact moment the camera begins a smooth cinematic 360° orbit around them, keeping their faces and upper bodies centered and sharp. The couple stays almost still with subtle breathing, blinking and slight hair movement. As the camera circles them, the entire party background gradually becomes heavily blurred with warm golden bokeh from candles and string lights, as if the world disappears around them. Shallow depth of field, natural parallax, warm amber rim light, romantic pacing, stable camera, high character consistency. Avoid face morphing, anatomy errors, camera shake, fast motion, focus loss, or characters rotating instead of the camera. /

Volver a un set que ya generaste es de lo más caro en todo el flujo de trabajo.

El lip sync va al final

Nuestro orden fue sencillo: primero generar la toma y después aplicar lip sync en Kling 2.6, guiado por la voz de la pista terminada. Así hicimos 33 clips con sincronización labial.

La parte contraintuitiva estaba en el prompt de movimiento. Tenía que mantener la boca sutil y relajada porque luego se reemplazaba; 10 prompts lo decían de forma explícita, y las tomas con articulación de boca demasiado expresiva peleaban contra el lip sync aplicado encima.

Seedance 2.0 → lip sync en Kling 2.6

Fíjate en lo que el prompt de origen NO pide: mantiene el movimiento sutil y la boca relajada, porque esa boca se reemplaza después. El lip sync se añade al final, en Kling 2.6, guiado por la voz de la pista terminada. Esta toma terminó apareciendo cuatro veces distintas en el corte final.

Ver el prompt

Animate this image into a subtle cinematic anime-style video. Preserve the blonde woman’s identity, face, blue eyes, freckles, hair, outfit, headphones, bedroom, lighting, colors, and composition. She lies on her stomach along the bed, hands gently supporting her face, looking into the camera and softly singing along to music in her headphones. Add natural lip-sync, small mouth and jaw movements, gentle blinking, slight eyebrow motion, soft breathing, head movements to the rhythm, and minimal hair motion. Keep her gaze mostly on the camera. Fairy lights softly flicker, candle flame moves naturally, neon heart glow subtly varies. Camera stays almost static with a very slow push-in. Keep motion smooth and restrained. No face changes, warped hands, extra fingers, body distortion, outfit changes, camera cuts, or exaggerated movement.

La parte de la que casi nadie habla: el montaje

La lección más importante del proyecto fue que saber generar sin saber editar produce un showreel, no un videoclip. La canción iba a 130 BPM y el video final tuvo 142 tomas en 118 segundos.

La duración mediana de cada toma fue de 0.70 segundos, equivalente a una negra con puntillo. Ochenta y cinco tomas duraban exactamente 1.5 tiempos, 31 duraban exactamente 2 tiempos, y 117 de los 141 cortes cayeron a menos de medio fotograma de la cuadrícula de medio tiempo.

La densidad también vino de dónde colocamos los cortes. Ochenta de los 141 cortes saltaban a otra localización, de modo que el video cruzaba escuela, café, dormitorio y fiesta en lugar de reproducir cada escena como un bloque cerrado.

Reutilizamos material a propósito: 82 clips fuente cubrieron 123 tomas, y algunos clips aparecieron hasta cuatro veces. El tempo también se diseñó desde la generación, no solo desde la edición, con 19 prompts que mencionaban un BPM y 3 que guionizaban la coreografía tiempo por tiempo; los dos planos largos entre los segundos 77 y 84 fueron el único respiro, y estaban ahí por decisión propia.

Seedance 2.0 — coreografía escrita por tiempos

La coreografía está escrita por tiempos, a los mismos 130 BPM de la canción: «Beats 1-2: dancers step outward. 3-4: pom-poms rise in alternating diagonals». El movimiento generado sobre la cuadrícula de tempo se corta limpiamente sobre esa misma cuadrícula; 19 de nuestros prompts mencionan un BPM por este motivo exacto.

Ver el prompt

High-angle wide shot. Keep exactly the same five Westfield cheerleaders, uniforms and gym. Animate geometric synchronized choreography at 130 BPM. Beats 1-2: dancers step outward, expanding the formation. 3-4: pom-poms rise in alternating diagonals. 5-6: two quick steps inward while everyone rotates about 45°. 7-8: formation opens into a star-like shape and hits a strong final pose. Maintain precise spacing and synchronization. Camera slowly cranes downward and pushes toward center court. Floor reflections and pom-pom highlights move naturally. No added dancers, morphing, character drift or costume changes.

Seis segundos del montaje final

Nueve tomas en seis segundos, con sonido. La toma mediana de este video dura 0.70 s —una negra con puntillo a 130 BPM— y 117 de 141 cortes caen a menos de medio fotograma de la cuadrícula de medio tiempo. Esto es lo que una cara tiene que resistir: 0.7 segundos cada vez, 142 veces.

Genera sobre la cuadrícula. Corta sobre la cuadrícula.

Lo que todavía se rompe

Dos fallos siguieron colándose. En planos largos y casi estáticos, el modelo podía alucinar figuras extra, con una segunda persona apareciendo de la nada; las letras también se degradaban cuando la cámara se movía, así que WESTFIELD en los uniformes de animadoras se convertía en un sinsentido a lo largo de una toma.

Las soluciones prácticas no eran glamurosas, pero ayudaron. Mantuvimos los planos cortos, algo que el montaje rápido ya favorecía, dejamos el texto legible fuera de encuadre o desenfocado y repetimos generaciones en lugar de reescribir cuando un clip estaba cerca de funcionar.

Seedance 2.0 — otra toma, mismo dormitorio

Mira por encima de su hombro hacia el final: una segunda figura aparece de la nada. Los planos largos sobre un encuadre casi estático son donde más se nota, y esa es otra razón para que el montaje respire en corto. Las letras fallan igual: WESTFIELD en los uniformes de animadoras se deshace en algo ilegible cada vez que la cámara se mueve.

El flujo que sí funcionó

Esta es la secuencia que repetiríamos, en este orden.

  1. 1Termina primero la canción. El montaje se construye sobre su tempo, así que necesitas el audio final antes de generar una sola toma.
  2. 2Diseña el look sobre papel. Un arte conceptual que fija paleta, vestuario y los dos rostros le da a cada prompt posterior algo concreto que respetar.
  3. 3Pon nombre a tus personajes y úsalo en cada prompt: «Ava» y «Jordan» sostuvieron la identidad entre generaciones mejor que la descripción física por sí sola.
  4. 4Genera un fotograma por toma en Nano Banana 2, partiendo del arte conceptual en lugar de empezar desde cero.
  5. 5Anima cada fotograma en Seedance 2.0. Cinco segundos a 1080p es el caballo de batalla; usa diez solo cuando la acción realmente lo necesite.
  6. 6Escribe el movimiento por tiempos al tempo de la canción, para que lo generado caiga en la misma cuadrícula que usará el montaje.
  7. 7Di lo que no quieres. Los gestos emocionales por defecto son la razón más común por la que una toma técnicamente correcta se lee mal.
  8. 8Añade el lip sync al final, en Kling 2.6, y solo en las tomas donde la cámara se queda sobre una cara.
  9. 9Corta al ritmo y cruza localizaciones en lugar de reproducir cada escena como un bloque.

Preguntas frecuentes

¿Cómo crear un video musical con IA?

Nosotros lo hicimos construyendo primero el estilo y luego generando fotogramas, movimiento, lip sync y montaje. El arte conceptual fijó a Ava, Jordan, la paleta y el vestuario antes de animar nada; después, 151 fotogramas iniciales guiaron el image-to-video, el lip sync llegó al final y el montaje a 130 BPM dio forma al 1:58 definitivo.

¿Cuánto se tarda en hacer un video musical con IA gratis?

Nuestro video de 2 minutos tomó 7 días naturales, del 10 al 16 de agosto de 2026. Incluyó 205 generaciones, 20 minutos de metraje, 5.3 horas de render de máquina y un montaje que redujo todo el material a 1:58.

¿Cómo mantienes el mismo personaje en todas las tomas?

Mantuvimos la consistencia de personaje partiendo de arte conceptual cerrado y personajes con nombre. Ava y Jordan aparecieron por su nombre en 22 prompts, y cada toma arrancó desde un fotograma de Nano Banana 2 basado en el look establecido, no solo desde texto.

¿Qué motor de IA conviene para un video musical?

En este proyecto, Seedance 2.0 image-to-video hizo casi todo el trabajo de video. Lo usamos en 204 de 205 generaciones a 1080p, mientras Nano Banana 2 se encargó de los fotogramas y Kling 2.6 del lip sync. Si buscas términos como ai music video generator, music video ai, ai music video o music to video ai, este es el tipo de flujo que hay detrás.

¿Todavía hace falta saber editar?

Sí. El montaje convirtió clips generados en un video musical, no en un showreel. El corte final usó 142 tomas en 118 segundos, con la mayoría de los cortes sobre la cuadrícula de medio tiempo y muchos saltos entre localizaciones para ganar densidad.

Sigue explorando

Dale vida a tus fotos

Fotogramas, movimiento y lip sync para tu propio video musical, todo en un solo estudio.

Crea tu video musical