Skip to content

Mariano Rodrigo

AI Solutions Engineer building production systems with artificial intelligence, automation, and full-stack architecture. This is my public engineering lab: architecture decisions, implementation reports, experiments, and lessons from real systems.

Video conversacional con IA usando Tavus: un avatar con el que hablás, no un clip que mirás

El experimento en dos minutos

Mis tres experimentos anteriores produjeron videos para mirar. Cloné mi voz con ElevenLabs, construí un gemelo digital en HeyGen y convertí un brief técnico en un explainer corporativo con Synthesia. Tavus es otra categoría. No es un clip que mirás. Es un avatar con el que hablás.

Qué es Tavus, y para quién

Tavus se organiza alrededor de CVI, su Conversational Video Interface: una plataforma API-first para conversaciones de video con IA, cara a cara y en tiempo real, sobre WebRTC. El avatar escucha, maneja los turnos y responde a cámara, en vivo. Ese es el punto, y es lo que separa a Tavus del resto de las herramientas que probé.

Por eso el público es distinto. HeyGen y Synthesia son para equipos que necesitan producir un video. Tavus es para productos que necesitan una interfaz: agentes de soporte, onboarding y tutoría, intake y triage, FAQ interactivas o, en mi caso, un vocero científico al que podés preguntarle. No apretás play. Tenés una conversación.

La conversación

La grabación de abajo es una llamada real de Tavus: el frame grande es el replica de IA, la ventana chica soy yo, en vivo. Para esta prueba, el replica habló como el vocero de Kleidos. Esta es la persona que le di, en inglés:

Hello, I’m the scientific spokesperson for Kleidos. Kleidos is a biotechnology platform designed to help professionals transform complex biomedical information into structured, evidence-based knowledge. The platform supports the analysis of genetic variants, connects molecular findings with clinical phenotypes, and organizes scientific evidence from specialized sources into consistent and traceable workflows. Rather than replacing clinical expertise, Kleidos helps researchers and healthcare professionals review information more efficiently, maintain data traceability, and improve consistency throughout the interpretation process. Our mission is to enable responsible use of artificial intelligence while keeping scientific rigor, transparency, and human expertise at the center of every decision.

Una conversación en vivo por Tavus: entrevisto al replica del vocero científico de Kleidos

Después le hice preguntas, en vivo, y respondió a cámara. Tres de ellas, de un set más largo:

  1. ¿Qué es Kleidos y para quién está diseñado?
  2. ¿Cómo ayuda Kleidos a los investigadores a analizar variantes genéticas de forma más eficiente?
  3. ¿Por qué es importante la consistencia en la interpretación de variantes para la biotecnología y la investigación clínica?

Lo interesante no es que las respuestas sean correctas. Es que son sin guion e interrumpibles. La misma persona podría tomar otra pregunta a continuación y responderla, a cámara, sin un render nuevo.

Los planes

Los precios cambian con el tiempo, así que verificá antes de contratar. Al momento de esta prueba, los planes de desarrollador eran así.

PlanPrecioVideo conversacionalEntrenamientos de replica propioStreams simultáneos
BasicUSD 025 minutosNinguno (solo stock replicas)1
StarterUSD 59/mes + uso100 minutos3 por mesHasta 3
GrowthUSD 397/mes + uso1250 minutos7 por mesHasta 10
EnterprisePersonalizadoPersonalizadoPersonalizadoPersonalizado, white-label, SLAs

El detalle clave para tener tu propio avatar: el plan gratis Basic te da stock replicas pero no entrenamiento de replica propio, así que un replica personal arranca en Starter. Los minutos conversacionales extra son pay-as-you-go más allá del plan, alrededor de USD 0,37/min en Starter y USD 0,32/min en Growth.

Cómo se entrena el avatar

Un avatar de Tavus se llama replica, y es barato de crear. Podés armar uno desde una sola imagen, o desde unos dos minutos de video de entrenamiento. La receta del video es simple: cerca de un minuto hablando seguido de un minuto en silencio en el mismo clip, donde la parte en silencio funciona además como el segmento de consentimiento. El motor de render Phoenix preserva identidad, microexpresiones y matiz emocional. El entrenamiento corre en segundo plano y el replica suele estar listo en unas cuatro a seis horas. El consentimiento es obligatorio, y en los planes más altos el flujo de consentimiento se puede white-labelear por completo.

Tavus vs HeyGen vs Synthesia

Después de cuatro experimentos, las tres herramientas se ordenan en tres modos distintos.

  • HeyGen es un gemelo digital que habla: clips de busto parlante multilingües, fuerte para video de creador y personal.
  • Synthesia es un explainer corporativo: video estructurado tipo diapositiva para formación, onboarding y entrega en LMS.
  • Tavus es una conversación: un avatar en tiempo real que interrumpís y preguntás, hecho para vivir dentro de un producto.

Las dos primeras producen un asset que distribuís. Tavus produce una interfaz que conectás a un guion, una base de conocimiento y un usuario en vivo.

Conclusión

Tavus respondió la pregunta que las otras herramientas no podían: qué pasa cuando el que mira quiere responder. Un vocero de Kleidos al que podés entrevistar no es una grabación, es una interfaz, y cambia para qué sirve el avatar. El trade-off es honesto: la conversación en tiempo real es más difícil que un pre-render prolijo, así que el timing, la latencia y algún tropiezo ocasional son donde se ven las costuras. Pero el modelo de producción es distinto en esencia. Un replica, una persona, una base de conocimiento, y cada visitante recibe una respuesta en vivo, un poco distinta.