AI generativa video con HeyGen: un avatar, sette lingue
Il mio esperimento precedente ha clonato la mia voce in cinque lingue con ElevenLabs. Questo aggiunge il volto: un gemello digitale HeyGen creato da una sola registrazione in studio, che parla lingue che non ho mai filmato. La maggior parte dei video comparativi usa audio dei miei cloni ElevenLabs; una demo usa la mia voce clonata con il motore di HeyGen, e le versioni di Video Translate usano il doppiaggio generato da HeyGen. Tutti i video di questa pagina sono generati dall’IA; nessuno è stato filmato nella lingua che senti. Anche il lip sync è generato: accento e fluidità sono i punti dove si vedono le cuciture, ascoltali con attenzione.
Sette lingue in totale: cinque parlate dalle voci clonate (inglese, spagnolo, italiano, giapponese e cinese) e cinque prodotte da Video Translate (spagnolo, italiano, francese, tedesco e giapponese), con sovrapposizione al centro.
I primi due piani
| Free | Creator | |
|---|---|---|
| Prezzo (luglio 2026) | USD 0 | USD 29/mese (USD 24/mese con fatturazione annuale) |
| Video | 3 al mese, 1 minuto ciascuno, con watermark | 600 crediti mensili |
| Esportazione | 720p condivisibile | Download in 1080p |
| Slot gemello digitale | 1 | 1+ (espandibile) |
| Funzioni premium | Accesso di prova | Avatar IV, translate, look |
I crediti sono specifici per funzione: Avatar IV, Video Translate, la modalità Precision e la generazione di look consumano a ritmi diversi. Il piano Free basta per validare se il tuo gemello ti somiglia nei movimenti; io ho usato Creator per le esportazioni 1080p senza watermark e le funzioni a pagamento mostrate qui.
Creare il gemello digitale
Il processo è più semplice di quanto sembri: registrati parlando in camera per almeno 2 minuti in un’unica ripresa continua (HeyGen consiglia fino a 5 per il miglior addestramento), carica il girato e registra un breve video di consenso. HeyGen stima dai 10 ai 20 minuti per elaborare l’avatar base (girato non 4K); i tempi reali variano con la coda e il materiale. Il risultato è un avatar che modella le tue espressioni, il linguaggio del corpo e il modo di parlare, e può essere guidato da script o audio supportati, soggetto a moderazione.
Questo è ciò che HeyGen ha generato dalla mia registrazione:
E questo è il gemello che parla con la mia voce clonata dal motore vocale di HeyGen, prima di passare ai miei cloni ElevenLabs. In questa pagina finiscono a confronto tre motori di clonazione: quello di HeyGen e i due livelli di ElevenLabs:
Look: generare gli ambienti
Uno slot avatar contiene fino a 500 look, tra foto e video: variazioni generate di abbigliamento, sfondo e inquadratura, così lo stesso gemello può presentare da un ufficio, uno studio o qualsiasi altro posto senza rifilmare. La rimozione dello sfondo dipende dal tipo di avatar e dal piano. I video qui sotto usano questi look generati; nessuno degli ambienti esiste fisicamente.
L’abbinamento delle voci
La voce del gemello non è di HeyGen: i video comparativi IVC e PVC qui sotto sono stati generati in HeyGen usando audio prodotto con i miei cloni ElevenLabs dell’esperimento precedente, registrati con uno Shure SM58. Stesso script per lingua; la variabile principale è il metodo di clonazione, Instant Voice Cloning (IVC) contro Professional Voice Cloning (PVC), anche se il risultato finale dipende pure dalla sintesi e dal lip sync. Il cinese ha solo la versione PVC, consideralo un campione e non una coppia.
Inglese
Spagnolo
Italiano
Giapponese
Cinese
HeyGen Video Translate
L’ultimo pezzo non richiede di creare e gestire un clone vocale separato. Ho dato a HeyGen Translate il video in inglese chiedendo cinque lingue: trascrive l’audio originale, lo traduce, genera la voce doppiata e risincronizza le labbra. Ho attivato i sottotitoli incorporati per le versioni mostrate qui. Entra una registrazione, escono cinque video localizzati. Usa i pulsanti per cambiare lingua; il primo è l’originale.
Conclusione
Due minuti di girato ben illuminato e continuo hanno prodotto un gemello che sopravvive a lingue che non ho mai parlato in camera. Nei miei test, Instant Voice Cloning è bastato per validare l’idea; Professional Voice Cloning è ciò che pubblicherei. Per la pura localizzazione, Video Translate è stata la scorciatoia: nessun clone separato da gestire, sottotitoli su richiesta. Niente è impeccabile, accento e ritmo tradiscono ancora la generazione in alcuni punti, ma lo stack di produzione di un video multilingue in camera si è ridotto a una registrazione sorgente, un set di modelli vocali riutilizzabili e una coda di elaborazione.