Guide ai video AI 9 min di lettura

image to video ai: da foto a video con l’AI

image to video ai significa partire da una foto già definita e usare il prompt per guidare solo il movimento. In Vynzo abbiamo provato lo stesso ritratto su quattro motori AI image to video per capire cosa rende davvero naturale l’animazione di un’immagine.

Una foto statica, messa in movimento. Il risultato migliore: Seedance 2.0 con un prompt ottimizzato.

Come l’AI trasforma una foto in video

Un sistema image to video AI prende una singola immagine e la converte in una clip breve. La foto stabilisce già composizione, soggetto, luce e stile: il prompt non deve ricostruire la scena da zero.

Per questo va scritto in modo diverso rispetto al text-to-video. Qui il prompt deve spiegare soprattutto come si muove ciò che è già nell’immagine. L’errore più comune è restare sul vago, per esempio chiedere che il soggetto “sembri vivo”, invece di indicare un’azione concreta. Il risultato, spesso, è un movimento rigido o poco credibile.

  • Indica una sola azione chiara, oppure una breve sequenza di gesti.
  • Aggiungi un unico movimento di camera: un lento avvicinamento è la scelta più sicura.
  • Descrivi movimenti concreti, non stati d’animo.
  • Non ripetere nel prompt ciò che la foto mostra già.
L’immagine iniziale

La foto di partenza usata in tutti i test.

Il test: una foto, un’azione, quattro motori

Abbiamo usato lo stesso ritratto e la stessa azione su quattro motori disponibili in Vynzo: Kling 2.6, Seedance 2.0, Google Veo 3.1 e WAN 2.7. La sequenza prevedeva sorriso, battito di ciglia, bacio verso la camera, risata calda e capelli mossi da una brezza leggera.

Il test si è svolto in tre passaggi: prima un prompt semplice, poi un prompt ottimizzato per ogni motore, infine correzioni mirate. Lavorare in un unico studio ci ha permesso di confrontare la stessa foto, fianco a fianco, senza variabili inutili.

Qui sotto trovi i prompt esatti usati per ogni clip, insieme alle nostre note: puoi copiarli e adattarli, senza dover tirare a indovinare dal riassunto.

Round 1 — il prompt semplice che scrivono quasi tutti

In questa prova abbiamo inserito una sola riga, lasciato le impostazioni standard e chiesto ai quattro motori di animare una foto senza ulteriori istruzioni.

Nel round “ingenuo” ha vinto Kling. Seedance ha generato un effetto slow motion, Veo ha prodotto i capelli migliori ma un inquietante battito con un occhio solo, mentre WAN è risultato plastificato e ha inventato petali di rosa.

Lo stesso identico prompt su tutti e quattro i motori

she smiles, winks and blows a kiss to the camera, her hair blowing in the wind

Kling 2.6

Vincitore del round con prompt semplice. Identità mantenuta e richiesta quasi tutta eseguita: manca solo il battito di ciglia.

Seedance 2.0

Buono: identità preservata e tutti i passaggi presenti, ma l’intera clip è uscita in slow motion.

Google Veo 3.1

I capelli più naturali del gruppo e identità stabile, però il battito con un solo occhio è straniante e durante il bacio la testa si muove troppo.

WAN 2.7

Riconoscibile, ma la pelle diventa plastica, il battito si trasforma in una smorfia, la brezza sembra vento forte e compaiono petali di rosa dalla mano.

Round 1 — lo stesso prompt semplice su tutti e quattro i motori.

Round 2 — un prompt su misura per ogni motore

Nel secondo round abbiamo riscritto il prompt per ciascun motore. La lezione, poco intuitiva ma chiarissima: più dettagli non significa sempre risultati migliori.

Con un prompt molto sceneggiato, Kling è peggiorato e ha finito per baciare il proprio palmo invece della camera. Seedance ha reagito all’opposto: i tempi scanditi hanno prodotto il risultato migliore di tutto il test.

Veo è rimasto convincente, mentre WAN è migliorato ma da vicino continuava ad avere un effetto ceroso. Il punto è questo: il motore migliore dipende anche da come lo guidi. Kling preferisce prompt brevi e naturali; Seedance premia istruzioni precise e temporizzate.

Kling 2.6

Peggioramento netto. Espressioni brusche, occhiolino fallito e bacio dato al palmo, guardandolo, invece che verso la camera.

Il prompt che abbiamo usato

She forms a soft smile, then gives one clear, natural blink followed by a playful wink; she raises one hand to her lips and blows a kiss, opening her palm toward the camera — fingers natural and intact, nothing leaves her hand; she finishes with a warm little laugh and a slight head tilt. Her hair drifts in a gentle breeze. Camera holds with a slow, subtle push-in. Keep her face and identity exactly as in the photo; natural real-time motion, no warping.

Seedance 2.0

Il miglior risultato dell’intero test. I tempi risolvono lo slow motion, l’espressione è naturale e l’identità resta intatta. Unico difetto: l’occhiolino è quasi troppo rapido per notarlo.

Il prompt che abbiamo usato

Real-time natural pacing — NOT slow motion. [0-2s] she forms a soft smile. [2-4s] one clear, natural blink, then a playful wink. [4-7s] she raises a hand to her lips and blows a kiss, opening her palm toward the camera; fingers natural and intact, nothing leaves her hand. [7-10s] a warm laugh and a slight head tilt. A gentle breeze moves her hair throughout. Camera: slow, smooth push-in. Keep her identity and lighting consistent; stable, physically natural motion; no slow motion, no warping.

Google Veo 3.1

Ci va vicino. Identità, naturalezza e aderenza al prompt ci sono, ma l’occhiolino resta strano e il viso si contrae di nuovo. Con qualche re-roll in più, probabilmente, si arriverebbe al risultato giusto.

Il prompt che abbiamo usato

Medium close-up, image-to-video from the still. She forms a soft, genuine smile, then gives one calm, natural blink with both eyes closing and opening together — not a squint, no facial scrunching — followed by a single playful wink. She raises one hand to her lips and gently blows a kiss, opening her palm toward the camera; fingers relaxed and intact, nothing leaves her hand. She keeps her head steady — only her hand, lips and eyes move, no head shaking. Hair drifts softly in a light breeze. Camera: static with a very slow push-in. Warm natural daylight, photorealistic skin. Audio: soft ambient breeze, no dialogue, no music. Keep her face and identity as in the photo.

WAN 2.7

Meglio del Round 1, ma ancora ceroso. L’occhiolino diventa una smorfia e l’avvicinamento marcato fa leggere la pelle come rughe invecchiate.

Il prompt che abbiamo usato

Use the photo as the first frame and identity anchor; keep her face and skin exactly as in the photo, photorealistic skin texture (not plastic or waxy). She forms a soft smile, gives one clean, natural eye blink — eyelids gently close and open, do NOT scrunch or wrinkle the face — then a playful wink; she raises a hand to her lips and blows a kiss, opening her palm toward the camera (fingers intact, nothing leaves it); ends with a small warm laugh. Only a light, gentle breeze moves her hair. Camera: slow, subtle push-in. Real-time natural motion. Negative: plastic skin, waxy texture, face wrinkling, grimace, strong wind, rose petals, falling petals, extra fingers, morphing.

Round 2 — un prompt diverso, ottimizzato per ogni motore.

Round 3 — correzioni mirate

A questo punto solo due motori richiedevano ancora interventi. Per Kling abbiamo provato uno script più pulito e breve, eliminando l’occhiolino: il risultato è comunque uscito molto peggio della riga semplice del Round 1.

La conclusione è chiara: con Kling conviene non “ingegnerizzare” troppo il prompt; una frase naturale basta e spesso vince. Per WAN, invece, un’inquadratura media più un negative prompt hanno finalmente portato a una clip soddisfacente: meno plastica, movimento abbastanza naturale, ma ancora leggermente sintetica da vicino. Correggi una variabile alla volta e ricorda che, a volte, la soluzione è scrivere meno, non di più.

Kling 2.6

La sorpresa del test: anche questo script più breve e ordinato è risultato molto peggiore della semplice riga del Round 1. Con Kling vince la formulazione più naturale e minimale.

Il prompt che abbiamo usato

She smiles warmly, gives one clear natural blink, then raises a hand to her lips and blows a kiss toward the camera while looking straight at the lens; she finishes with a soft laugh. Her hair drifts in a gentle breeze. Slow, subtle push-in. Keep her face and identity as in the photo; natural motion.

WAN 2.7

Finalmente soddisfacente. Molto meno plastico grazie al negative prompt, senza occhiolino e con un movimento abbastanza naturale, anche se da vicino resta un filo sintetico.

Il prompt che abbiamo usato

Use the photo as the first frame and identity anchor; keep her face and youthful, smooth skin exactly as in the photo. She smiles warmly, gives one clean natural eye blink (no squint, do not wrinkle or scrunch the face), then raises a hand to her lips and blows a kiss toward the camera while looking at the lens; fingers intact, nothing leaves her hand; ends with a small warm laugh. Only a light breeze moves her hair. Camera: hold a steady MEDIUM distance — do NOT push in close, no close-up. Photorealistic smooth young skin. Negative: plastic skin, waxy texture, wrinkles, aged skin, face scrunching, strong wind, petals, extra fingers, close-up.

Round 3 — una modifica mirata per ciascuno dei due risultati più deboli.

La parte più difficile: l’occhiolino

Un dettaglio ha mandato in crisi tutti i motori nei primi round: l’occhiolino. Kling lo ha saltato, Seedance lo ha reso troppo veloce, mentre Veo e WAN lo hanno trasformato in una smorfia poco piacevole.

Il movimento asimmetrico di un solo occhio è una delle micro-espressioni più difficili per i modelli attuali. Meglio usare un battito con entrambi gli occhi più un sorriso, oppure mettere in conto diversi re-roll. Eliminare l’occhiolino ha aiutato WAN a raggiungere una clip soddisfacente nel Round 3; con Kling, però, nemmeno questo è bastato a superare il prompt semplice.

Quale motore anima meglio una foto?

Non esiste un unico motore migliore per ogni AI photo animation. Seedance 2.0 è stato il più naturale dopo l’ottimizzazione, Kling 2.6 il più affidabile con un prompt semplice, Veo 3.1 ha offerto i migliori capelli e la fisica più credibile, oltre all’audio nativo, ma è anche il più costoso; WAN 2.7 ha mantenuto l’identità, risultando però più sintetico nei ritratti ravvicinati.

La tabella separa questi compromessi, così puoi scegliere in base a ciò che conta davvero per il tuo progetto: movimento naturale, semplicità del prompt, capelli e fisica, audio, identità o realismo nei primi piani.

Kling 2.6

Identità
Eccellente
Azione
Ottimo con prompt semplici
Realismo
Naturale
Movimento
Fluido
Velocità
Veloce
Costo
Medio
Flessibilità dei contenuti
Policy standard
Ideale per
Animazioni di ritratti rapide e affidabili

Seedance 2.0

Identità
Eccellente
Azione
Ottimo con tempi scanditi
Realismo
Molto naturale
Movimento
Cinematografico
Velocità
Più lento
Costo
Medio
Flessibilità dei contenuti
Più permissivo
Ideale per
Risultati curati quando sceneggi i passaggi

Google Veo 3.1

Identità
Forte
Azione
Buona
Realismo
Capelli/fisica eccellenti
Movimento
Naturale
Velocità
Veloce
Costo
Più alto
Flessibilità dei contenuti
Filtri rigorosi
Ideale per
Movimento realistico + audio nativo

WAN 2.7

Identità
Buona
Azione
OK dopo ottimizzazione
Realismo
Leggermente sintetico
Movimento
OK
Velocità
Media
Costo
Basso
Flessibilità dei contenuti
Pesi aperti, installabile in autonomia → meno restrizioni
Ideale per
Inquadrature più larghe, multi-reference, self-hosting

Prova tutti e quattro i motori sulla tua foto, in un unico studio.

Apri lo studio

Il workflow affidabile, qualunque motore tu usi

Questo è il processo che ci ha dato i risultati migliori per creare una clip naturale già al primo tentativo.

Parti da un’azione chiara, aggiungi un movimento di camera semplice, testa prima la versione più pulita e poi correggi solo ciò che si rompe davvero. I passaggi qui sotto trasformano il tutto in un workflow image to video AI ripetibile, utile anche se cerchi un image to video ai generator o soluzioni image to video ai gratis.

  1. 1Scegli una foto chiara: un solo soggetto, buona luce, volto interamente nell’inquadratura e spazio per eventuali gesti con la mano.
  2. 2Scrivi il movimento, non la scena: indica un’azione concreta, come un sorriso, un battito di ciglia o un bacio, e un solo movimento di camera.
  3. 3Adatta il prompt al motore: breve per Kling; con passaggi temporizzati ([0-3s]…) per Seedance.
  4. 4Genera prima una clip breve e mantieni il movimento sottile, così il viso resta stabile.
  5. 5Se il volto si deforma o un’espressione non funziona, riduci il numero di azioni: l’eccesso di movimento è la causa principale delle deformazioni.
  6. 6Esporta in verticale (9:16) per TikTok, Reels e Shorts.

Domande frequenti

Come trasformo una foto in video con l’AI?

Carica una foto, descrivi un movimento chiaro e genera una breve clip image-to-video. Per risultati migliori aggiungi un solo movimento di camera, per esempio un avvicinamento lento, ed evita prompt vaghi basati solo sull’atmosfera.

Qual è la migliore AI per animare una foto?

Dipende dal prompt e dal risultato che cerchi. Nel nostro test, Seedance 2.0 è stato il più naturale dopo l’ottimizzazione, Kling 2.6 il migliore con un prompt semplice, Veo 3.1 il più forte su capelli e fisica, mentre WAN 2.7 ha mantenuto l’identità ma da vicino è sembrato più sintetico.

Perché la mia animazione AI da foto sembra finta?

Di solito il problema nasce da movimenti vaghi, prompt troppo carichi o dettagli facciali difficili. Indica una sola azione concreta, mantieni semplice la camera ed evita micro-espressioni complesse come l’occhiolino, a meno di essere pronto a fare più tentativi.

Posso animare una vecchia foto con l’AI?

Sì, puoi animare vecchie foto con l’AI se volto e soggetto sono abbastanza chiari. Usa movimenti semplici e naturali, come un sorriso, un battito di ciglia o un lento avvicinamento, perché stile, luce e composizione sono già fissati dalla foto.

Quanto può durare un’animazione AI da foto?

Di solito un’animazione AI da foto crea una clip breve partendo da una singola immagine. La durata esatta dipende dal motore e dalle impostazioni, quindi conviene pensare a una piccola sequenza di gesti, non a una scena lunga.

Continua a esplorare

Dai vita alle tue foto

Prova Kling, Seedance, Veo e WAN sulla tua foto: tutto in un unico studio.

Anima la tua foto