IA generativa de voz con ElevenLabs: una voz, cinco idiomas
Mi voz fue clonada únicamente a partir de grabaciones en español. Todo lo demás en esta página es generado: el mismo clon hablando inglés, italiano, chino y japonés, idiomas en los que nunca me escuchó. Esta es mi escucha controlada del estado actual de la IA generativa de voz, usando ElevenLabs, el proveedor de referencia, como banco de pruebas.
El clon se entrenó solo con mi audio en español: segundos para Instant Voice Cloning (IVC), unos 30 minutos para Professional Voice Cloning (PVC). Un guion, configuración de generación idéntica, una sola variable: el método de entrenamiento. Como referencia, las secciones de inglés y español abren con una grabación real de mi voz.
Configuración de la prueba
| Parámetro | Valor |
|---|---|
| Velocidad | 1.00 |
| Estabilidad | 45 |
| Similitud | 80 |
| Speaker Boost | Activado |
Cada muestra usa exactamente esta configuración, así el nivel de entrenamiento es la única variable.
Dos niveles de entrenamiento
| Nivel | Audio de entrenamiento | Uso previsto | Plan (julio 2026) |
|---|---|---|---|
| Instant Voice Cloning (IVC) | ~10 segundos | Prototipado | USD 6/mes |
| Professional Voice Cloning (PVC) | ~30 minutos | Producción | USD 22/mes |
Inglés
Español
Italiano
Chino
Japonés
Cómo escuchar
Compará cada par IVC/PVC según: preservación de la identidad, pronunciación, entonación y ritmo, estabilidad, naturalidad. Empezá por el idioma que mejor conocés, donde los defectos se notan más, y fijate si los mismos defectos aparecen en los otros.
Conclusión
La transferencia de identidad entre idiomas funciona hoy: puedo escuchar mi propia voz en idiomas que nunca hablé, clonada solo desde español, en ambos niveles. Lo que compran más datos de entrenamiento es consistencia: una dicción más estable entre idiomas y en pasajes largos. Segundos de audio validan una idea; minutos justifican producción. El límite ya no es el idioma: es la consistencia que exige tu caso de uso.