No existe el botón de hazlo increíble
Empecemos bajando la fantasía a tierra, con cariño y un cojín pequeño. No hay un botón mágico que convierta un prompt en una pieza terminada. Si existe, desde luego no nos invitó a la reunión.
Lo que acabas de ver son 1 minuto y 37 segundos de vídeo. Costó 8 horas y 34 minutos, y $85.45. Ahí entran el personaje, el vestuario, las escenas, las tomas de estudio, la voz, el lip sync y la edición; ese lugar donde el optimismo va a que le den una lección de humildad.
Esta guía enseña el proceso entero: los prompts junto a cada plano, los fallos, las correcciones y la factura. Cada fase tiene su manera particular de romperse, que molesta, sí, pero también es el trabajo de verdad.
Conoce a Mila
Mila es un personaje inventado, no una persona real. Tiene 27 años, mide unos 178 cm, lleva el pelo rubio champán por debajo de los hombros con raya al centro, ojos almendrados gris azulados, rostro ovalado con forma de corazón, cejas rubias pobladas y un pequeño lunar bajo el ojo derecho.
Buscábamos una presencia inteligente, serena, observadora y actual. No queríamos el típico estereotipo de influencer pulida hasta el exceso, porque suele acabar en la misma cara lisa de siempre: mejor luz, pero menos personalidad que el lobby de un hotel.
Su historia es sencilla: Mila es una editora de moda de 2030 que crea sus propios looks y los publica. Los rasgos distintivos importan porque una cara bonita genérica es difícil de comprobar entre planos; pecas, cejas y un lunar sirven para que tú, y el modelo, sepáis que sigue siendo ella.
Paso 1: la hoja de referencia
Un retrato no basta para crear una influencer con IA. Lo que necesitas es una hoja de referencia. Generamos seis ángulos: retrato base, giro de 30°, perfil de 90°, plano hasta medio muslo, cuerpo entero y cuerpo entero a 30°.
El truco principal es simple: cuando ya tienes una buena imagen, vuelve a usar esa imagen generada como referencia. Luego dale al modelo una instrucción breve para mantener la cara y la anatomía sin cambios. Funcionó mejor que alargar los prompts hasta el infinito, que es la vía rápida para sonar como un dibujante de retratos policiales con migraña.
Además, nos quedamos casi todo el tiempo dentro del mismo motor a propósito. Así reducimos la deriva de identidad y aprendimos dónde falla ese motor, en lugar de culpar a cinco herramientas a la vez como un padre agotado en un viaje por carretera.






La hoja de referencia de Mila: todos los planos posteriores salen de aquí.
Los cinco prompts detrás de la hoja
Mostramos cada prompt junto a su plano, con notas para explicar por qué está ahí. Lo importante es copiar el patrón: repetir siempre la misma descripción física, nombrar solo lo que cambia y añadir las imágenes aprobadas como referencia a medida que avanzas.
Cada prompt vuelve a fijar la misma descripción facial y añade un ángulo nuevo. El retrato subido hace casi todo el trabajo; las palabras solo le dicen hacia dónde mirar.

Ver el prompt
Use the uploaded portrait of Mila as the primary identity reference. Create a RAW photorealistic studio portrait of the same real-looking adult woman. Keep her exact face: fair skin with natural texture, oval heart-shaped face, defined cheekbones, soft refined jawline, large expressive grey-blue almond eyes, straight narrow nose, natural medium lips, distinctive full blonde eyebrows with a soft lifted arch, and a small beauty mark below her right eye. Champagne-blonde hair below the shoulders, centre part, soft waves. Head-and-shoulders view, face turned 30 degrees to her left, eyes looking into the camera, head upright and level. Calm, intelligent, slightly reserved expression, closed lips. Minimal makeup, graphite-grey crew-neck top, no jewellery. Light-grey seamless studio background, soft frontal light, 85mm lens look, realistic colour, unretouched human photo. No illustration, CGI, doll face, glamour filter, text or watermark.
El perfil estricto es el ángulo más difícil para mantener el personaje. Detallar las cejas y el lunar es lo que evita que se deshaga la identidad.

Ver el prompt
Use the uploaded portrait of Mila as the primary identity reference. Create a RAW photorealistic studio image of the same real-looking adult woman. She is tall and slender, with fair skin, natural texture, visible pores, an oval heart-shaped face, defined cheekbones, a soft refined jawline, large expressive grey-blue almond eyes, a straight narrow nose, natural medium lips, and a small beauty mark below her right eye. Her eyebrows are distinctive: light blonde, full, textured, elegant, with a soft lifted arch. Her hair is champagne blonde, below the shoulders, centre part, soft waves. Show a strict 90-degree right-facing side profile, head level, calm neutral expression, closed lips, hair tucked behind the visible ear. Graphite-grey crew-neck top, no jewellery. Light-grey seamless studio background, soft diffused light, true human photo. No cartoon, CGI, doll face, beauty filter, text or watermark.
No rediseñes, no reinterpretas, no embellezcas ni sustituyas su cara suena a regañina, y es justo lo que frena la deriva.

Ver el prompt
Use the uploaded portrait as the only identity reference. Create a RAW photorealistic studio photo of the exact same woman, framed from head to mid-thigh. Do not redesign, reinterpret, beautify or replace her face. Preserve her identity exactly: same facial geometry, proportions, eyes, eyebrows, nose, lips, jawline, skin tone, hairline, hairstyle and beauty mark. She is a clearly adult woman, tall and slim, with a defined waist and balanced feminine curves. She faces the camera in a relaxed neutral pose, arms slightly away from her torso. She wears a fitted graphite-grey bodysuit. Light-grey seamless background, soft even light, 50mm lens, realistic skin texture, true human photography. Keep the face sharp, detailed and clearly recognizable. No new face, face variation, cartoon, CGI, doll-like skin, distorted anatomy, text or watermark.
Aquí ya entran DOS referencias: el retrato y la toma aprobada de medio muslo. Cuantos más ángulos validados reutilizas, más estable se vuelve el personaje.

Ver el prompt
Use the uploaded portrait and approved mid-thigh image as identity references. Create a RAW photorealistic full-body studio photo of the exact same woman. Do not redesign or replace her face. Preserve her identity exactly: same facial geometry, proportions, eyes, eyebrows, nose, lips, jawline, skin tone, hairline, hairstyle and beauty mark. She is a clearly adult woman, about 178 cm tall, with a slim elegant figure, defined waist, softly rounded hips, balanced feminine curves and long legs, suitable for dress fittings. She stands front-facing in a relaxed neutral pose, arms naturally at her sides, full body visible from head to bare feet. Fitted graphite-grey bodysuit, matte black leggings. Light-grey studio background, soft even light, 50mm lens, true human photo. No new face, face variation, cartoon, CGI, doll-like skin, distorted anatomy, cropped feet, text or watermark.
A estas alturas, el prompt puede ser breve. Mila ya existe; solo la estás citando para otra toma.

Ver el prompt
Using the uploaded portrait as the face reference, create a photorealistic full-body studio photo of the exact same woman. Tall, slim figure with a defined waist and natural feminine curves. Body turned 30 degrees, head toward the camera, relaxed pose, full body and feet visible. Preserve her face and hair exactly. Simple fitted grey outfit, soft studio light, plain grey background, no cartoon, CGI or distorted anatomy.
Los cinco prompts que convirtieron un retrato en una hoja de referencia completa.
Paso 2: construir el vestuario
Después de elegir un look, le pedimos al modelo de imagen que separara cada prenda y accesorio como si fuera una foto de producto limpia: vestido, bolso, zapatos, gafas de sol, pendientes y pulsera.
Ese paso extra merece la pena. Cuando un objeto existe como imagen de referencia propia, puedes volver a colocarlo en cualquier escena y tendrá muchas más opciones de seguir siendo el mismo objeto. Así se arma un lookbook de verdad, pero sin el perchero bloqueando siempre la puerta.






Cada pieza separada como foto de producto para poder reutilizarla con coherencia.
Paso 3: hacer que hable
Para la toma hablada usamos una pila bastante honesta y algo remendada. Generamos un clip parlante a partir de una imagen fija, creamos la voz en ElevenLabs e hicimos el lip sync en Sync.so.
La voz y el lip sync hoy quedan fuera de Vynzo. Kling 2.6 ya permite hacer lip sync de forma nativa dentro de Vynzo, y GPT Image 2 llegará pronto a Vynzo.
El consejo práctico pesa más que la lista de herramientas: empieza cada toma de lip sync desde un clip fuente distinto, con gestos y expresiones diferentes. Reutilizar el mismo clip hace que el resultado parezca robótico, como si Mila se hubiera quedado atrapada en un bucle amable de atención al cliente.
El segmento hablado: la expresión y el gesto importan más que las palabras.
Ver el prompt
Use the uploaded reference image as the exact identity of the character. Preserve her face, hairstyle, skin tone, proportions, clothing and accessories. Do not redesign or stylize her. Medium close-up, eye-level camera. She looks into the lens and speaks naturally: "[DIALOGUE]". Precise lip sync. Expressions follow the speech: subtle eyebrow movement, realistic blinking, small smiles, brief pauses and natural breathing. She uses restrained hand gestures, small head nods and slight posture shifts. Movements are smooth, relaxed and conversational, never theatrical or repetitive. Keep hands anatomically correct. Negative prompt: identity drift, facial warping, frozen expressions, excessive blinking, random gestures, distorted hands, lip-sync errors, flicker, camera shake, cuts or background changes.
Paso 4: la parte en casa
La parte en casa parece sencilla sobre el papel: Mila presenta un producto por clip. El flujo se repite siempre igual: generar la imagen fija desde las referencias, animarla, repetir toma y quedarse con la mejor.
Cada clip llevaba la misma instrucción: conservar la identidad y mantener un movimiento natural y sutil. Las notas bajo cada pieza son donde viven las lecciones reales, porque la primera versión suele ser el momento en que el modelo te enseña, con mucha educación, un problema nuevo.
Un giro completo es la prueba honesta de cualquier personaje: el modelo tiene que seguir siendo ella durante 360°. Esta toma funcionó, pero fíjate en cuánto prompt se dedica a prohibir cosas en vez de pedirlas.
Ver el prompt
Use the provided frame as a strict reference. Vertical 9:16, full-body, static camera. Keep the same woman, identity, face, body proportions, hairstyle, dress, bare feet, room, lighting and framing unchanged throughout. She starts already facing the camera, looking directly into the lens with a soft natural smile. From this exact starting pose, she gently holds the sides of the dress with both hands and makes one smooth natural full turn around herself at normal real-time speed, with small realistic steps. The movement should feel elegant and physically natural, with subtle fabric motion and slight hair movement. After the turn, she finishes facing the camera again. No slow motion, no strange grimaces, no exaggerated expressions, no face distortion, no identity drift, no hand glitches, no extra fingers, no foot deformation, no added heels or footwear, no camera movement, no flicker
Nuestro fallo favorito: el modelo hacía pasar el bolso directamente A TRAVÉS de su propio brazo, como un fantasma. Tras muchos reintentos, usamos solo una parte. El contacto físico entre mano y objeto sigue siendo una zona donde estos modelos tiemblan.
Ver el prompt
A woman naturally presents a light-colored leather handbag in a minimalist room. She gently turns her upper body slightly toward the camera, carefully lifts the bag by its handle, and brings it a little closer to the lens to showcase its shape, leather texture, stitching, and hardware. She then subtly adjusts her grip and slowly rotates the handbag to reveal its side profile. Her expression remains calm and confident, with a soft, natural smile. Her hair and clothing move slightly with her body. The camera performs a slow, smooth push-in while keeping the handbag as the main focal point. Realistic premium fashion commercial, soft natural daylight, elegant and controlled movement, high detail, stable composition, smooth natural motion
Pedir un móvil invisible y, a la vez, un ligero temblor de cámara es lo que hace que se lea como un selfie real. Las patillas de las gafas desaparecían al girar la cabeza; solo se arregló repitiendo tomas y nombrando ese detalle exacto.
Ver el prompt
Create a photorealistic vertical 9:16 front-camera selfie video from the reference image. Preserve her identity, hair, sunglasses, mint athletic outfit, room, lighting, and framing. The phone is in her hand but never visible, so the camera should have subtle natural handheld motion throughout: tiny shakes, micro-sways, and slight distance shifts. She looks at the screen, slowly turns her head to one side and freezes, holding still for a moment to show the sunglasses. Then she slowly turns her head to the other side and freezes again. After that, she gently brings the camera closer to her face for a close-up of the sunglasses and holds it there briefly. Add natural blinking, breathing, tiny facial movements, and slight hair motion. No speaking, cuts, sudden motion, warped features, or background changes.
Primer fotograma / último fotograma. La regla que nadie te cuenta: la posición de cámara debe coincidir en AMBOS frames, o los objetos se desplazan entre cortes.
Ver el prompt
Use the first frame as the starting pose and the last frame as the ending pose. In the same bright minimalist room, the woman sits on the sofa and smoothly transitions from reaching toward the open shoebox on the floor to lifting one iridescent heel out of the box and examining it in her hands. At the start, both shoes are clearly inside the shoebox among the tissue paper. During the action, she leans forward, reaches into the box, takes only one shoe by the ankle strap, lifts it up, and supports it with her other hand while looking at it with soft curiosity and a subtle pleased smile. By the end, one shoe is in her hands and the second shoe remains inside the box. Maintain consistent appearance, outfit, room layout, shoebox position, and shoe design. Soft daylight, static camera, realistic motion
Segundo intento. En el primero, la mano giraba tranquilamente 360 grados completos, cosa que una muñeca no suele hacer.
Ver el prompt
A cinematic product showcase of a futuristic silver iridescent high-heel sandal being elegantly held in one hand inside a bright, minimalist living room. The camera performs a slow, smooth push-in combined with a subtle left-to-right arc, creating gentle parallax between the shoe and the softly blurred background. The hand naturally rotates the shoe a few degrees to reveal the shimmering holographic panels, metallic finish, sculptural transparent heel, and ankle strap. Soft daylight from the window creates realistic reflections and rainbow highlights that glide across the surface as the camera moves. The background remains calm and out of focus, emphasizing the product. Premium luxury fashion commercial aesthetic, ultra-realistic materials, clean composition, shallow depth of field, stabilized camera, natural motion only, no abrupt movements, no object deformation, no flickering, no warping, no extra fingers or artifacts.
El segmento en casa: un producto por clip.
El truco del primer y último fotograma
Para cualquier acción con un inicio y un final claros, como sacar un zapato de una caja, dale al modelo tanto el primer fotograma como el último. Necesita saber dónde empieza la acción y dónde debe aterrizar.
La regla que se suele pasar por alto es la posición de cámara. El primer y el último fotograma deben usar la misma posición. Si no, los objetos se deslizan y mutan porque el modelo intenta mover la cámara y el objeto al mismo tiempo, que es como nacen los zapatos embrujados.


Primer fotograma y último fotograma: misma posición de cámara, o los objetos se desplazan.
Paso 5: estudio y pasarela
Para el segmento de estudio vestimos a Mila con el look completo, con y sin gafas de sol, y después añadimos maquillaje. Aquí la identidad necesita atención extra, porque el maquillaje cambia una cara. Puede ocultar las pequeñas marcas e imperfecciones que hacen reconocible al personaje.
Las tomas tipo making of de la sesión salieron rápido y resultaron convincentes: flashes, ventilador de estudio y un fotógrafo fuera de plano. La pasarela es el plano que vende toda la pieza, porque convierte vestuario, personaje y movimiento en un momento claro.
Nano Banana 2 no siempre pudo mantener idénticos los accesorios. GPT Image 2 lo hizo mejor en esa tarea: subes el accesorio y lo editas dentro del plano. Simple, no mágico, que empieza a ser el tema de todo esto.
El plano que tiene que venderlo todo. Se nombra cada pieza de forma explícita —vestido, gafas de sol, pendientes, pulsera, tacones, bolso— porque lo que no nombras es lo que el modelo puede rediseñar en silencio.
Ver el prompt
The same blonde model from the reference walks confidently down a luxury fashion runway with a professional catwalk stride, maintaining the exact same face, hairstyle, white dress, sunglasses, earrings, bracelet, heels, and cream handbag. She reaches the end of the runway, gracefully stops, and performs three elegant high-fashion poses, subtly shifting her weight, rotating her body, lifting her chin, and naturally presenting the handbag. Camera flashes illuminate her as photographers capture every pose. She executes a smooth runway pivot, then confidently walks back. The dress flows naturally, the handbag swings realistically, and every movement is poised and refined. Cinematic fashion film, glossy runway, soft spotlights, shallow depth of field, ultra-realistic, 9:16, 10 seconds, 4K, 24 fps, preserve the exact appearance from the reference, no outfit or face changes.
El segmento de estudio: el look completo y después la pasarela.
Fotografías de estudio
Las imágenes de estudio son el look completo armado a partir de las tomas de vestuario y fotografiado en un set. Aquí es donde el trabajo previo de foto de producto empieza a pagar el alquiler.


Fotografías de estudio: el look completo, vestido desde las tomas de vestuario.
Todo lo que se rompió
Esta es la parte que muchos artículos se saltan, probablemente porque luce menos que el vídeo final y se parece más a admitir que se te ha reventado la maleta en público. Pero los fallos no son casos raros. Son el trabajo.
Reserva presupuesto para reintentos igual que un fotógrafo reserva margen para disparar más fotos. El hallazgo más útil fue que Seedance a menudo renderiza en cámara lenta, y un prompt negativo no lo arregló; acabamos acelerando esos clips un 35–40% en edición.
El bolso atravesaba su brazo
- Por qué importa
- El contacto entre mano y objeto es uno de los puntos más débiles de los modelos de vídeo actuales
- Qué lo arregló de verdad
- Muchos reintentos; usamos solo una parte de la toma
Las patillas de las gafas desaparecían a mitad de giro
- Por qué importa
- Los detalles pequeños y rígidos se esfuman cuando la cabeza rota
- Qué lo arregló de verdad
- Repetir la toma nombrando ese detalle exacto
La mano giraba 360° completos
- Por qué importa
- La anatomía no se impone sola si no detectas el problema
- Qué lo arregló de verdad
- Un reintento
Todo salía en cámara lenta
- Por qué importa
- Seedance estira una acción corta para llenar el clip
- Qué lo arregló de verdad
- El prompt negativo NO ayudó: acelerar el clip un 35–40% en edición
La escena del lápiz de maquillaje
- Por qué importa
- Hay acciones que el modelo, simplemente, no ejecuta por mucho que cambies la frase
- Qué lo arregló de verdad
- Cortarla
Un arco de espalda antinatural al final
- Por qué importa
- Los últimos fotogramas son donde más suelen romperse las poses
- Qué lo arregló de verdad
- Recorte en edición
Los accesorios cambiaban entre planos
- Por qué importa
- Los modelos de imagen derivan en objetos pequeños
- Qué lo arregló de verdad
- Nano Banana 2 sufrió; GPT Image 2 los mantuvo: subir el accesorio y editar
Prueba los cuatro motores con tu propia foto, en un solo estudio.
Abrir el estudioCuánto costó
La producción completa costó $85.45 y llevó 8 horas y 34 minutos para 1 minuto y 37 segundos de vídeo final. La factura fue de $55.45 para generación de imagen y vídeo, $19 para lip sync y $11 para voz.
Entonces, ¿son baratos los AI influencers? Comparados con una sesión real con modelo, fotógrafo, estudio y localización, sí. Pero no son gratis ni instantáneos. Además, no somos bloggers de moda: esto es una demostración de lo que las herramientas pueden hacer hoy, y con más tomas y una edición mejor el resultado subiría de nivel.
Seedance 2.0 Pro · Nano Banana 2 · GPT Image 2
- Qué cubría
- Todas las imágenes y todos los clips de vídeo
- Coste
- $55.45
Sync.so
- Qué cubría
- Lip sync, usando solo alrededor del 20% de la reserva
- Coste
- $19.00
ElevenLabs
- Qué cubría
- Voz en off
- Coste
- $11.00
Total
- Qué cubría
- 1 minuto y 37 segundos de vídeo final
- Coste
- $85.45
Tiempo
- Qué cubría
- Incluida la edición
- Coste
- 8 h 34 min
Prueba los cuatro motores con tu propia foto, en un solo estudio.
Abrir el estudioLo que te diríamos antes de empezar
Primero: no hay botón mágico, y probablemente nunca lo habrá. Lo sentimos. Los robots han aprendido iluminación y tejidos, pero siguen necesitando a una persona con gusto, paciencia y ganas de repetir la misma toma sin tomárselo como algo personal.
Segundo: sin un guion claro e interesante, solo vas a producir ruido caro. Un personaje bonito caminando por planos bonitos no es una historia; es un salvapantallas con facturas.
Tercero: el personaje es el producto, así que invierte en la hoja de referencia antes que en cualquier otra cosa. Después reserva margen para reintentos y para edición, porque ahí es donde se arreglan la cámara lenta, los finales malos y las tomas imposibles.
