Guías de video con AI 12 min de lectura

ai influencer generator: cómo creamos a Mila de cero

Un ai influencer generator suena como algo que resuelves con un buen prompt y un café. En nuestro caso fue Mila, una editora de moda ficticia: un video de 1 minuto 37 segundos, 8 horas 34 minutos de trabajo y una cuenta final de $85.45.

La pieza final: 1 minuto 37 segundos, un personaje creado con IA, de principio a fin.

No existe el botón de “hazlo increíble”

Primero bajemos la fantasía brillante con suavidad, como con una almohada pequeña. No hay un botón mágico que convierta un prompt en una pieza terminada. Si existe, a nosotros no nos invitó a la junta.

Lo que acabas de ver son 1 minuto 37 segundos de video. Tomó 8 horas 34 minutos y costó $85.45. Ahí entran el diseño del personaje, vestuario, escenas, tomas de estudio, voz, lip sync y edición; también conocida como el lugar donde el optimismo va a recibir una lección de humildad.

Esta guía enseña todo el proceso: los prompts junto a cada toma, los errores, las correcciones y la cuenta final. Cada etapa tiene su propia manera especial de fallar, lo cual es molesto, pero también es el trabajo real.

Conoce a Mila

Mila es un personaje inventado, no una persona real. Tiene 27 años, mide cerca de 178 cm, lleva el pelo rubio champaña debajo de los hombros con raya al centro, ojos almendrados gris azulados, rostro ovalado con forma de corazón, cejas rubias pobladas y una pequeña marca de belleza debajo del ojo derecho.

Buscábamos que se sintiera inteligente, tranquila, observadora y actual. No queríamos el estereotipo de influencer demasiado pulida, porque suele terminar en la misma cara lisa de siempre: mejor iluminada, sí, pero con menos personalidad que el lobby de un hotel.

Su historia es simple: Mila es una editora de moda del año 2030 que arma sus propios looks y los publica. Los rasgos distintivos importan, porque una cara bonita genérica es difícil de verificar entre tomas; pecas, cejas y una marca de belleza te dan a ti —y al modelo— señales claras de que sigue siendo ella.

Paso 1: la hoja de referencia

Un retrato no es un personaje. Una hoja de referencia sí. Generamos seis ángulos: retrato base, giro de 30°, perfil de 90°, plano hasta medio muslo, cuerpo completo y cuerpo completo a 30°.

El truco central es sencillo: cuando ya tienes una buena imagen, vuelve a usar esa imagen generada como referencia. Luego dale al modelo una instrucción breve para mantener el rostro y la anatomía sin cambios. Funcionó mejor que escribir prompts cada vez más largos, que es la ruta directa a sonar como retratista policial con migraña.

También nos quedamos casi todo el tiempo dentro de un solo motor a propósito. Eso redujo la deriva de identidad y nos ayudó a entender dónde se rompe ese motor, en lugar de culpar a cinco herramientas al mismo tiempo como papá cansado en un viaje por carretera.

Retrato base
Retrato base
Giro de 30°
Giro de 30°
Perfil de 90°
Perfil de 90°
Medio muslo
Medio muslo
Cuerpo completo
Cuerpo completo
Cuerpo completo, 30°
Cuerpo completo, 30°

La hoja de referencia de Mila: todas las tomas posteriores salen de aquí.

Los cinco prompts detrás de la hoja

Los prompts aparecen junto a cada toma, y las notas explican por qué están ahí. Lo importante es copiar el patrón: repetir la misma descripción física cada vez, nombrar lo único que cambia y sumar imágenes aprobadas como referencia conforme avanzas.

Giro de 30°

Cada prompt repite la misma descripción del rostro y agrega un ángulo nuevo. El retrato cargado hace el trabajo pesado; las palabras solo le dicen hacia dónde mirar.

Giro de 30°
Ver el prompt

Use the uploaded portrait of Mila as the primary identity reference. Create a RAW photorealistic studio portrait of the same real-looking adult woman. Keep her exact face: fair skin with natural texture, oval heart-shaped face, defined cheekbones, soft refined jawline, large expressive grey-blue almond eyes, straight narrow nose, natural medium lips, distinctive full blonde eyebrows with a soft lifted arch, and a small beauty mark below her right eye. Champagne-blonde hair below the shoulders, centre part, soft waves. Head-and-shoulders view, face turned 30 degrees to her left, eyes looking into the camera, head upright and level. Calm, intelligent, slightly reserved expression, closed lips. Minimal makeup, graphite-grey crew-neck top, no jewellery. Light-grey seamless studio background, soft frontal light, 85mm lens look, realistic colour, unretouched human photo. No illustration, CGI, doll face, glamour filter, text or watermark.

Perfil de 90°

El perfil estricto es el ángulo más difícil para mantener el parecido. Detallar las cejas y la marca de belleza es lo que ayuda a sostener la identidad.

Perfil de 90°
Ver el prompt

Use the uploaded portrait of Mila as the primary identity reference. Create a RAW photorealistic studio image of the same real-looking adult woman. She is tall and slender, with fair skin, natural texture, visible pores, an oval heart-shaped face, defined cheekbones, a soft refined jawline, large expressive grey-blue almond eyes, a straight narrow nose, natural medium lips, and a small beauty mark below her right eye. Her eyebrows are distinctive: light blonde, full, textured, elegant, with a soft lifted arch. Her hair is champagne blonde, below the shoulders, centre part, soft waves. Show a strict 90-degree right-facing side profile, head level, calm neutral expression, closed lips, hair tucked behind the visible ear. Graphite-grey crew-neck top, no jewellery. Light-grey seamless studio background, soft diffused light, true human photo. No cartoon, CGI, doll face, beauty filter, text or watermark.

Medio muslo

“No rediseñar, reinterpretar, embellecer ni reemplazar su rostro” suena insistente, y justo por eso funciona: frena la deriva.

Medio muslo
Ver el prompt

Use the uploaded portrait as the only identity reference. Create a RAW photorealistic studio photo of the exact same woman, framed from head to mid-thigh. Do not redesign, reinterpret, beautify or replace her face. Preserve her identity exactly: same facial geometry, proportions, eyes, eyebrows, nose, lips, jawline, skin tone, hairline, hairstyle and beauty mark. She is a clearly adult woman, tall and slim, with a defined waist and balanced feminine curves. She faces the camera in a relaxed neutral pose, arms slightly away from her torso. She wears a fitted graphite-grey bodysuit. Light-grey seamless background, soft even light, 50mm lens, realistic skin texture, true human photography. Keep the face sharp, detailed and clearly recognizable. No new face, face variation, cartoon, CGI, doll-like skin, distorted anatomy, text or watermark.

Cuerpo completo

Aquí ya entran DOS referencias: el retrato y la toma aprobada hasta medio muslo. Mientras más ángulos validados vuelves a alimentar, más estable se vuelve el personaje.

Cuerpo completo
Ver el prompt

Use the uploaded portrait and approved mid-thigh image as identity references. Create a RAW photorealistic full-body studio photo of the exact same woman. Do not redesign or replace her face. Preserve her identity exactly: same facial geometry, proportions, eyes, eyebrows, nose, lips, jawline, skin tone, hairline, hairstyle and beauty mark. She is a clearly adult woman, about 178 cm tall, with a slim elegant figure, defined waist, softly rounded hips, balanced feminine curves and long legs, suitable for dress fittings. She stands front-facing in a relaxed neutral pose, arms naturally at her sides, full body visible from head to bare feet. Fitted graphite-grey bodysuit, matte black leggings. Light-grey studio background, soft even light, 50mm lens, true human photo. No new face, face variation, cartoon, CGI, doll-like skin, distorted anatomy, cropped feet, text or watermark.

Cuerpo completo, 30°

A estas alturas el prompt ya puede ser corto. Mila ya existe; solo la estás citando para otra toma.

Cuerpo completo, 30°
Ver el prompt

Using the uploaded portrait as the face reference, create a photorealistic full-body studio photo of the exact same woman. Tall, slim figure with a defined waist and natural feminine curves. Body turned 30 degrees, head toward the camera, relaxed pose, full body and feet visible. Preserve her face and hair exactly. Simple fitted grey outfit, soft studio light, plain grey background, no cartoon, CGI or distorted anatomy.

Los cinco prompts que convirtieron un retrato en una hoja de referencia completa.

Paso 2: construir el vestuario

Después de elegir un look, le pedimos al modelo de imagen que separara cada prenda y accesorio como una foto de producto limpia: vestido, bolso, zapatos, lentes de sol, aretes y pulsera.

Ese paso extra vale la pena. Cuando un objeto existe como su propia imagen de referencia, puedes volver a insertarlo en cualquier escena con muchas más probabilidades de que siga siendo el mismo objeto. Así se arma un lookbook real, solo sin el perchero que siempre bloquea la puerta.

Vestido
Vestido
Bolso
Bolso
Zapatos
Zapatos
Lentes de sol
Lentes de sol
Aretes
Aretes
Pulsera
Pulsera

Cada pieza separada como foto de producto para reutilizarla con consistencia.

Paso 3: hacer que hable

Para la toma hablada usamos un stack honesto y un poco remendado. Generamos un clip desde una imagen fija, creamos la voz en ElevenLabs e hicimos el lip sync en Sync.so.

Hoy la voz y el lip sync están fuera de Vynzo. Kling 2.6 ya puede hacer lip sync de forma nativa dentro de Vynzo, y GPT Image 2 llegará pronto a Vynzo.

El consejo práctico pesa más que la lista de herramientas: empieza cada toma de lip sync desde un clip fuente distinto, con gestos y expresiones diferentes. Reutilizar el mismo clip hace que el resultado se sienta robótico, como si Mila hubiera quedado atrapada en un loop amable de atención al cliente.

El segmento hablado: la expresión y los gestos importan más que las palabras.

Ver el prompt

Use the uploaded reference image as the exact identity of the character. Preserve her face, hairstyle, skin tone, proportions, clothing and accessories. Do not redesign or stylize her. Medium close-up, eye-level camera. She looks into the lens and speaks naturally: "[DIALOGUE]". Precise lip sync. Expressions follow the speech: subtle eyebrow movement, realistic blinking, small smiles, brief pauses and natural breathing. She uses restrained hand gestures, small head nods and slight posture shifts. Movements are smooth, relaxed and conversational, never theatrical or repetitive. Keep hands anatomically correct. Negative prompt: identity drift, facial warping, frozen expressions, excessive blinking, random gestures, distorted hands, lip-sync errors, flicker, camera shake, cuts or background changes.

Paso 4: la escena en casa

La escena en casa suena simple en papel: Mila presenta un producto por clip. El flujo se repite cada vez: generar la imagen fija desde el set de referencias, animarla, hacer nuevas variantes y quedarse con la mejor toma.

Cada clip llevaba la misma instrucción: preservar identidad y mantener un movimiento natural y sutil. Las notas debajo de cada clip son donde viven las lecciones reales, porque la primera versión suele ser el momento en que el modelo te presenta, muy educadamente, un problema nuevo.

El giro con el vestido

Un giro completo es la prueba honesta de un personaje: el modelo tiene que mantenerla siendo ella durante 360°. Esta toma salió bien, pero fíjate cuánto del prompt se dedica a prohibir cosas en lugar de pedirlas.

Ver el prompt

Use the provided frame as a strict reference. Vertical 9:16, full-body, static camera. Keep the same woman, identity, face, body proportions, hairstyle, dress, bare feet, room, lighting and framing unchanged throughout. She starts already facing the camera, looking directly into the lens with a soft natural smile. From this exact starting pose, she gently holds the sides of the dress with both hands and makes one smooth natural full turn around herself at normal real-time speed, with small realistic steps. The movement should feel elegant and physically natural, with subtle fabric motion and slight hair movement. After the turn, she finishes facing the camera again. No slow motion, no strange grimaces, no exaggerated expressions, no face distortion, no identity drift, no hand glitches, no extra fingers, no foot deformation, no added heels or footwear, no camera movement, no flicker

El bolso

Nuestro fallo favorito: el modelo insistía en pasar el bolso DIRECTO a través de su propio brazo, como fantasma. Después de muchos reintentos, solo usamos una parte. El contacto físico entre una mano y un objeto sigue siendo donde estos modelos tambalean.

Ver el prompt

A woman naturally presents a light-colored leather handbag in a minimalist room. She gently turns her upper body slightly toward the camera, carefully lifts the bag by its handle, and brings it a little closer to the lens to showcase its shape, leather texture, stitching, and hardware. She then subtly adjusts her grip and slowly rotates the handbag to reveal its side profile. Her expression remains calm and confident, with a soft, natural smile. Her hair and clothing move slightly with her body. The camera performs a slow, smooth push-in while keeping the handbag as the main focal point. Realistic premium fashion commercial, soft natural daylight, elegant and controlled movement, high detail, stable composition, smooth natural motion

Selfie con lentes de sol

Pedir un celular invisible más un temblor deliberado de cámara en mano es lo que hace que se lea como una selfie real. Las varillas de los lentes desaparecían al girar la cabeza; solo se arregló reintentando y nombrando exactamente ese detalle.

Ver el prompt

Create a photorealistic vertical 9:16 front-camera selfie video from the reference image. Preserve her identity, hair, sunglasses, mint athletic outfit, room, lighting, and framing. The phone is in her hand but never visible, so the camera should have subtle natural handheld motion throughout: tiny shakes, micro-sways, and slight distance shifts. She looks at the screen, slowly turns her head to one side and freezes, holding still for a moment to show the sunglasses. Then she slowly turns her head to the other side and freezes again. After that, she gently brings the camera closer to her face for a close-up of the sunglasses and holds it there briefly. Add natural blinking, breathing, tiny facial movements, and slight hair motion. No speaking, cuts, sudden motion, warped features, or background changes.

Zapatos fuera de la caja

Primer frame / último frame. La regla que nadie te dice: la posición de cámara debe coincidir en AMBOS frames, o los objetos se desplazan en el corte.

Ver el prompt

Use the first frame as the starting pose and the last frame as the ending pose. In the same bright minimalist room, the woman sits on the sofa and smoothly transitions from reaching toward the open shoebox on the floor to lifting one iridescent heel out of the box and examining it in her hands. At the start, both shoes are clearly inside the shoebox among the tissue paper. During the action, she leans forward, reaches into the box, takes only one shoe by the ankle strap, lifts it up, and supports it with her other hand while looking at it with soft curiosity and a subtle pleased smile. By the end, one shoe is in her hands and the second shoe remains inside the box. Maintain consistent appearance, outfit, room layout, shoebox position, and shoe design. Soft daylight, static camera, realistic motion

Close-up del zapato

Segundo intento. En el primero, la mano giró tranquilamente 360 grados completos, algo que una muñeca humana no puede hacer.

Ver el prompt

A cinematic product showcase of a futuristic silver iridescent high-heel sandal being elegantly held in one hand inside a bright, minimalist living room. The camera performs a slow, smooth push-in combined with a subtle left-to-right arc, creating gentle parallax between the shoe and the softly blurred background. The hand naturally rotates the shoe a few degrees to reveal the shimmering holographic panels, metallic finish, sculptural transparent heel, and ankle strap. Soft daylight from the window creates realistic reflections and rainbow highlights that glide across the surface as the camera moves. The background remains calm and out of focus, emphasizing the product. Premium luxury fashion commercial aesthetic, ultra-realistic materials, clean composition, shallow depth of field, stabilized camera, natural motion only, no abrupt movements, no object deformation, no flickering, no warping, no extra fingers or artifacts.

La escena en casa: un producto por clip.

El truco del primer frame / último frame

Para cualquier acción con inicio y final claros —por ejemplo, sacar un zapato de una caja— dale al modelo tanto el primer frame como el último. Necesita saber dónde empieza la acción y dónde debe aterrizar.

La regla que muchos pasan por alto es la posición de cámara. El primer y el último frame deben usar la misma posición. Si no, los objetos se deslizan y se deforman porque el modelo intenta mover la cámara y el objeto al mismo tiempo. Así nacen los zapatos embrujados.

Primer frame
Primer frame
Último frame
Último frame

Primer frame y último frame: misma posición de cámara, o los objetos se deslizan.

Paso 5: estudio y pasarela

Para el segmento de estudio vestimos a Mila con el look completo, con y sin lentes de sol, y luego sumamos maquillaje. Aquí la identidad requiere atención extra, porque el maquillaje cambia un rostro. Puede tapar pequeñas marcas e imperfecciones que vuelven reconocible al personaje.

Las tomas tipo detrás de cámaras del photoshoot salieron rápido y se veían convincentes: flashes de estudio, ventilador y un fotógrafo justo fuera de cuadro. La toma de pasarela es la que vende toda la película, porque convierte vestuario, personaje y movimiento en un momento claro.

Nano Banana 2 no siempre logró mantener los accesorios idénticos. GPT Image 2 lo hizo mejor en esa tarea: subes el accesorio y lo editas dentro de la toma. Simple, no mágico; un tema que se repite bastante.

La pasarela

La toma que tiene que venderlo todo. Todo está nombrado de forma explícita —vestido, lentes de sol, aretes, pulsera, tacones, bolso— porque cualquier cosa que no nombres es algo que el modelo puede rediseñar en silencio.

Ver el prompt

The same blonde model from the reference walks confidently down a luxury fashion runway with a professional catwalk stride, maintaining the exact same face, hairstyle, white dress, sunglasses, earrings, bracelet, heels, and cream handbag. She reaches the end of the runway, gracefully stops, and performs three elegant high-fashion poses, subtly shifting her weight, rotating her body, lifting her chin, and naturally presenting the handbag. Camera flashes illuminate her as photographers capture every pose. She executes a smooth runway pivot, then confidently walks back. The dress flows naturally, the handbag swings realistically, and every movement is poised and refined. Cinematic fashion film, glossy runway, soft spotlights, shallow depth of field, ultra-realistic, 9:16, 10 seconds, 4K, 24 fps, preserve the exact appearance from the reference, no outfit or face changes.

El segmento de estudio: el look completo y luego la pasarela.

Fotos fijas de estudio

Las fotos fijas de estudio son el look completo armado a partir de las tomas de vestuario y luego fotografiado en un set de estudio. Aquí es donde el trabajo de producto empieza a pagar la renta.

Look completo
Look completo
Sentada
Sentada

Fotos de estudio: el look completo, vestido desde las tomas de vestuario.

Todo lo que se rompió

Esta es la parte que muchos artículos se saltan, probablemente porque es menos glamorosa que el video final y más parecida a admitir que tu maleta explotó en público. Pero los fallos no son casos raros: son parte del trabajo.

Presupuesta reintentos como un fotógrafo presupuesta disparos. El hallazgo más útil fue que Seedance muchas veces renderiza en cámara lenta, y un prompt negativo no lo arregló; así que aceleramos esos clips 35–40% en la edición.

El bolso atravesó su brazo

Por qué importa
El contacto mano-objeto es el punto más débil de los modelos de video actuales
Qué lo arregló de verdad
Muchos reintentos; usamos solo una parte de la toma

Las varillas de los lentes desaparecieron a mitad del giro

Por qué importa
Los detalles pequeños y rígidos se pierden cuando la cabeza rota
Qué lo arregló de verdad
Reintentar nombrando exactamente ese detalle

La mano giró 360° completos

Por qué importa
La anatomía no se respeta si tú no la vigilas
Qué lo arregló de verdad
Un reintento

Todo salió en cámara lenta

Por qué importa
Seedance estira una acción corta para llenar el clip
Qué lo arregló de verdad
Un prompt negativo NO ayudó: acelerar el clip 35–40% en edición

La escena del lápiz de maquillaje

Por qué importa
Hay acciones que el modelo simplemente no ejecuta, sin importar cómo las pidas
Qué lo arregló de verdad
La cortamos

Un arco de espalda poco natural al final

Por qué importa
Los últimos frames son donde las poses suelen romperse
Qué lo arregló de verdad
Recorte en edición

Los accesorios cambiaban entre tomas

Por qué importa
Los modelos de imagen derivan en props pequeños
Qué lo arregló de verdad
Nano Banana 2 batalló; GPT Image 2 los sostuvo: subir el accesorio y editarlo

Prueba los cuatro motores con tu propia foto, en un solo estudio.

Abrir el estudio

Cuánto costó

La producción completa costó $85.45 y tomó 8 horas 34 minutos para 1 minuto 37 segundos de video terminado. La cuenta fue $55.45 en generación de imagen y video, $19 en lip sync y $11 en voz.

Entonces, ¿los AI influencers son baratos? Comparados con una producción real con modelo, fotógrafo, estudio y locación, sí. Pero no son gratis ni instantáneos. Además, no somos bloggers de moda: esto es una demostración de lo que las herramientas pueden hacer hoy, y con más tomas y una mejor edición quedaría todavía mejor.

ElementoQué cubrióCosto
Seedance 2.0 Pro · Nano Banana 2 · GPT Image 2Cada imagen y cada clip de video$55.45
Sync.soLip sync (solo usamos ~20% de la reserva)$19.00
ElevenLabsVoz en off$11.00
Total1 minuto 37 segundos de video terminado$85.45
TiempoIncluida la edición8 h 34 min

Prueba los cuatro motores con tu propia foto, en un solo estudio.

Abrir el estudio

Lo que te diríamos antes de empezar

Primero: no hay botón mágico, y probablemente nunca lo habrá. Lo sentimos. Los robots ya aprendieron iluminación y tela, pero todavía necesitan a una persona con gusto, paciencia y disposición para reintentar la misma toma sin tomárselo personal.

Segundo: sin un guion claro e interesante, vas a producir ruido caro. Un personaje bonito caminando por tomas bonitas no es una historia; es un protector de pantalla con facturas.

Tercero: el personaje es el producto, así que invierte en la hoja de referencia antes de cualquier otra cosa. Luego reserva presupuesto para reintentos y para edición, porque la edición es donde se arreglan la cámara lenta, los malos finales y las tomas imposibles.

Preguntas frecuentes

¿Cómo crear un influencer con IA?

Crea un personaje original, arma una hoja de referencia y luego genera vestuario, escenas, voz, lip sync y edición. En esta producción, Mila empezó con una hoja de seis ángulos antes de crear cualquier clip final. Si buscas ai influencer how to create, ese es el flujo base.

¿Los AI influencers generan dinero?

Nosotros no monetizamos este proyecto; fue una demostración. El formato se usa para contenido de marca, lookbooks y anuncios, pero no vamos a inventar cifras de ingresos.

¿Cuánto cuesta hacer un video de AI influencer?

Este costó $85.45 y tomó 8 h 34 min para 1 min 37 s de video. Fueron $55.45 en generación de imagen y video, $19 en lip sync y $11 en voz.

¿Cómo mantienes la misma cara en todas las tomas?

Usa una hoja de referencia de seis ángulos y vuelve a alimentar el modelo con imágenes aprobadas. También repetimos la instrucción de preservar rostro y anatomía, en vez de hacer prompts cada vez más largos.

¿Qué herramientas de IA necesitas para un AI influencer?

Usamos Nano Banana 2, GPT Image 2, Seedance 2.0 Pro, Sync.so y ElevenLabs. Kling 2.6 puede hacer lip sync dentro de Vynzo, y GPT Image 2 llegará pronto a Vynzo. Esto se acerca más a un ai influencer studio que a un generador de un solo clic.

¿Es legal crear una influencer hecha con IA?

Crear un personaje original está bien; usar la imagen de una persona real sin consentimiento no. Mila es ficticia, que es la forma segura de construir este tipo de proyecto.

Sigue explorando

Dale vida a tus fotos

Prueba Kling, Seedance, Veo y WAN con tu propia foto, todo desde un solo estudio.

Crea tu propio personaje