Video conversazionale con IA usando Tavus: un avatar con cui parli, non un clip da guardare
I miei tre esperimenti precedenti hanno prodotto video da guardare. Ho clonato la mia voce con ElevenLabs, ho costruito un gemello digitale con HeyGen e ho trasformato un brief tecnico in un explainer aziendale con Synthesia. Tavus è un’altra categoria. Non è un clip da guardare. È un avatar con cui parli.
Cos’è Tavus, e per chi
Tavus è costruito attorno a CVI, la sua Conversational Video Interface: una piattaforma API-first per conversazioni video con IA, faccia a faccia e in tempo reale, su WebRTC. L’avatar ascolta, gestisce i turni e risponde in camera, dal vivo. È tutto qui, ed è ciò che distingue Tavus dagli altri strumenti che ho testato.
Per questo il pubblico è diverso. HeyGen e Synthesia servono a team che devono produrre un video. Tavus serve a prodotti che hanno bisogno di un’interfaccia: agenti di supporto, onboarding e tutoraggio, intake e triage, FAQ interattive o, nel mio caso, un portavoce scientifico a cui puoi fare domande. Non premi play. Hai una conversazione.
La conversazione
La registrazione qui sotto è una chiamata Tavus reale: il riquadro grande è il replica IA, la finestra piccola sono io, dal vivo. Per questo test, il replica ha parlato come il portavoce di Kleidos. Questa è la persona che gli ho dato, in inglese:
Hello, I’m the scientific spokesperson for Kleidos. Kleidos is a biotechnology platform designed to help professionals transform complex biomedical information into structured, evidence-based knowledge. The platform supports the analysis of genetic variants, connects molecular findings with clinical phenotypes, and organizes scientific evidence from specialized sources into consistent and traceable workflows. Rather than replacing clinical expertise, Kleidos helps researchers and healthcare professionals review information more efficiently, maintain data traceability, and improve consistency throughout the interpretation process. Our mission is to enable responsible use of artificial intelligence while keeping scientific rigor, transparency, and human expertise at the center of every decision.
Poi gli ho fatto delle domande, dal vivo, e ha risposto in camera. Tre, da un set più lungo:
- Cos’è Kleidos e a chi è destinato?
- Come aiuta Kleidos i ricercatori ad analizzare le varianti genetiche in modo più efficiente?
- Perché la coerenza nell’interpretazione delle varianti è importante per la biotecnologia e la ricerca clinica?
La parte interessante non è che le risposte siano corrette. È che sono senza copione e interrompibili. La stessa persona potrebbe prendere un’altra domanda subito dopo e rispondere, in camera, senza un nuovo render.
I piani
I prezzi cambiano nel tempo, quindi verifica prima di acquistare. Al momento di questo test, i piani per sviluppatori erano così.
| Piano | Prezzo | Video conversazionale | Training di replica proprio | Stream simultanei |
|---|---|---|---|---|
| Basic | USD 0 | 25 minuti | Nessuno (solo stock replica) | 1 |
| Starter | USD 59/mese + uso | 100 minuti | 3 al mese | Fino a 3 |
| Growth | USD 397/mese + uso | 1250 minuti | 7 al mese | Fino a 10 |
| Enterprise | Personalizzato | Personalizzato | Personalizzato | Personalizzato, white-label, SLA |
Il dettaglio chiave per avere il tuo avatar: il piano gratuito Basic ti dà stock replica ma nessun training di replica proprio, quindi un replica personale parte da Starter. I minuti conversazionali extra sono pay-as-you-go oltre il piano, circa USD 0,37/min su Starter e USD 0,32/min su Growth.
Come si allena l’avatar
Un avatar Tavus si chiama replica, ed è economico da creare. Puoi costruirne uno da una singola immagine, o da circa due minuti di video di training. La ricetta del video è semplice: circa un minuto di parlato seguito da un minuto di silenzio nello stesso clip, dove la parte in silenzio funge anche da segmento di consenso. Il motore di rendering Phoenix preserva identità, microespressioni e sfumatura emotiva. Il training gira in background e il replica di solito è pronto in circa quattro a sei ore. Il consenso è obbligatorio, e sui piani più alti il flusso di consenso può essere completamente white-label.
Tavus vs HeyGen vs Synthesia
Dopo quattro esperimenti, i tre strumenti si dividono in tre modi distinti.
- HeyGen è un gemello digitale che parla: clip di busto parlante multilingue, forte per video da creator e personali.
- Synthesia è un explainer aziendale: video strutturato a diapositive per formazione, onboarding e distribuzione su LMS.
- Tavus è una conversazione: un avatar in tempo reale che interrompi e interroghi, fatto per vivere dentro un prodotto.
I primi due producono un asset che distribuisci. Tavus produce un’interfaccia che colleghi a uno script, a una base di conoscenza e a un utente dal vivo.
Conclusione
Tavus ha risposto alla domanda che gli altri strumenti non potevano: cosa succede quando chi guarda vuole rispondere. Un portavoce di Kleidos che puoi intervistare non è una registrazione, è un’interfaccia, e cambia a cosa serve l’avatar. Il compromesso è onesto: la conversazione in tempo reale è più difficile di un pre-render pulito, quindi timing, latenza e qualche inciampo occasionale sono dove si vedono le cuciture. Ma il modello di produzione è diverso nella sostanza. Un replica, una persona, una base di conoscenza, e ogni visitatore riceve una risposta dal vivo, un po’ diversa.